Les assistants IA qui répondent en langage courant aux questions d’affaires passent des projets pilotes aux mains des cadres supérieurs. Leur attrait, c’est la vitesse : la réponse arrive dans la minute où la question est posée, sans attendre un analyste. Mais ce n’est pas la vitesse que les dirigeants retiennent. Ils se souviennent du jour où l’assistant a donné un chiffre d’affaires différent de celui du dossier du conseil d’administration.

Un seul chiffre erroné peut annuler des mois d’efforts d’adoption, car il jette le doute sur toutes les autres réponses. La solution n’est pas de ralentir l’assistant. Elle consiste à prouver, avant qu’il ne s’adresse à la direction et après chaque modification, que ses réponses concordent avec les chiffres certifiés.

Partir du chiffre certifié

Un chiffre certifié est un chiffre que l’organisation a accepté d’endosser : rapproché de la source, fondé sur une définition qui a un responsable et publié dans les rapports que la direction utilise déjà. C’est ce chiffre, et non l’arithmétique de l’assistant, qui sert de référence. L’assistant n’a raison que lorsqu’il reproduit le chiffre certifié pour la même définition, la même période et le même périmètre.

Lorsqu’aucun chiffre certifié n’existe pour une question, l’assistant doit le dire et préciser ce qu’il a utilisé à la place. Un « ceci n’est pas une mesure certifiée » honnête protège bien mieux la confiance qu’une estimation avancée avec aplomb.

Bâtir un jeu d’essai à partir de vraies questions

Le jeu d’essai est une liste de questions accompagnées de leurs réponses attendues; peu d’éléments d’un projet d’analytique fondé sur l’IA ont autant de valeur. Constituez-le à partir de ce que les dirigeants demandent réellement : questions envoyées aux analystes, soulevées en réunion de suivi ou saisies dans l’assistant pendant le projet pilote. Chaque cas d’essai consigne quatre éléments.

  • La question, formulée comme les gens la posent, avec quelques reformulations et la question de suivi qui vient naturellement.
  • La réponse attendue, tirée du rapport certifié, avec sa période, son périmètre et son unité.
  • La source que la réponse doit citer, pour qu’un chiffre exact tiré du mauvais endroit échoue quand même.
  • Le responsable qui confirme la réponse attendue et la met à jour lorsqu’une définition change.

Incluez des questions auxquelles l’assistant doit refuser de répondre : périodes qui ne sont pas encore clôturées, données hors de son périmètre et renseignements que la personne qui l’interroge n’est pas autorisée à voir. Un refus approprié compte comme une réussite. Pour commencer, quelques dizaines de questions bien choisies par sujet valent mieux que des centaines de questions génériques.

Pièce : comment un agent IA traite les questions financières courantes, et son exactitude sur un jeu d’essai par type de question, par rapport à un seuil de mise en service.

L’exécuter à chaque modification

Un jeu d’essai utilisé une seule fois, au lancement, n’est qu’une démonstration. Sa valeur vient de son exécution automatique chaque fois que quelque chose change : le modèle sémantique, une mesure, les instructions de l’assistant, le modèle d’IA sous-jacent, voire le nom d’une colonne. Les changements qui semblent anodins sont souvent ceux qui modifient les réponses, car l’assistant lit les noms et les descriptions pour comprendre le sens d’une question.

Fixez un seuil de mise en service avec le responsable d’affaires et traitez-le comme n’importe quel autre contrôle de la qualité. Un changement qui fait passer l’exactitude sous le seuil n’atteint pas les utilisateurs tant qu’il n’est pas corrigé. Exécutez le jeu complet avant chaque mise en service et un jeu plus court chaque jour, car les données changent aussi. Conservez chaque exécution afin de pouvoir montrer l’évolution de l’exactitude au fil du temps.

Pièce : exactitude sur le jeu d’essai après chaque modification; le seul changement passé sous le seuil a été arrêté avant sa mise en service.

S’entendre d’abord sur les tolérances

Tout écart n’est pas une erreur, et en débattre après un échec fait perdre du temps. Convenez des tolérances avec la finance avant la première exécution. Les dénombrements et les transactions doivent concorder exactement. Les montants ne peuvent différer que par l’arrondi, à la précision affichée dans le rapport certifié. Les ratios doivent suivre la définition certifiée, et non un nouveau calcul fait à partir de chiffres arrondis.

La formulation peut varier; les chiffres, les périodes et les définitions, non. Une réponse qui cite le chiffre d’affaires brut alors que la question portait sur le chiffre d’affaires net est fausse, aussi bien rédigée soit-elle. Lorsqu’une question est ambiguë, l’assistant doit énoncer son hypothèse ou demander une précision, et le jeu d’essai doit vérifier qu’il l’a fait.

Quand l’assistant se trompe

Traitez une réponse erronée comme vous traiteriez une erreur dans un rapport publié : comme un défaut, avec une cause, un responsable et un correctif. Les causes sont généralement connues : deux mesures aux noms semblables, une description manquante, un filtre que l’assistant n’a pas appliqué ou une question qui dépasse les données auxquelles il a accès.

Corrigez la cause dans le modèle ou dans les instructions plutôt que de rapiécer la seule réponse fautive, puis ajoutez la question qui a échoué au jeu d’essai pour que la même erreur ne puisse pas revenir sans être détectée. Pendant la correction, réduisez le périmètre de l’assistant : dirigez les questions sur ce sujet vers un analyste et informez les utilisateurs de ce qui a changé. Les gens pardonnent bien plus facilement une limite connue qu’une erreur silencieuse.

Afficher la source dans chaque réponse

Chaque réponse doit indiquer sa provenance : le rapport ou le modèle certifié dont elle est tirée, la mesure utilisée, la période et les filtres appliqués ainsi que la date de la dernière actualisation des données, avec un lien vers la page où le chiffre peut être vérifié. Les réponses fondées sur des données non certifiées doivent le dire clairement.

Afficher la source fait plus que renforcer la confiance. Les erreurs deviennent visibles rapidement, car les lecteurs remarquent tout de suite quand la période ou le périmètre ne correspond pas à leur question. Et l’assistant ne doit voir que ce que la personne qui l’interroge est autorisée à voir, afin que chaque réponse respecte les mêmes règles d’accès que le rapport dont elle provient.

En définitive

La vitesse est la promesse de l’IA en analytique; la confiance est la condition pour s’en servir. Les organisations qui traitent les réponses attendues comme un actif gouverné, sous la responsabilité conjointe de la finance et de l’équipe d’analytique, et qui exécutent le jeu d’essai à chaque modification, peuvent étendre un assistant sujet par sujet, preuves à l’appui à chaque étape. Celles qui font l’impasse sur le jeu d’essai découvrent leurs erreurs par la bouche de leurs dirigeants, ce qui est la façon la plus coûteuse de l’apprendre.