Évaluer un agent IA avant de signer : les questions à poser
Évaluer un agent IA avant de signer tient en six questions que l'éditeur doit soutenir, de ses données d'apprentissage au coût d'une erreur. Une démonstration ne répond qu'aux questions qu'il a préparées.
L'essentiel
Évaluer un agent IA avant de signer tient en six questions que l'éditeur doit soutenir, de ses données d'apprentissage au coût d'une erreur. Une démonstration ne répond qu'aux questions qu'il a préparées.
Sur quelles données il apprend, et ce qu'il fait des vôtres
Les exigences techniques envers un agent, le journal rejouable, le périmètre en liste blanche, le droit de veto, ont leur propre article sur ce blog, et je pars du principe qu'elles sont acquises. Les questions qui suivent sont celles de la due diligence, celles qu'un directeur supply chain et son DSI posent ensemble à l'éditeur pour évaluer son agent avant d'engager l'entreprise. La première porte sur l'apprentissage : l'agent s'appuie-t-il sur un modèle entraîné sur des données générales, apprend-il sur votre historique, sur vos décisions passées, et à partir de quelle profondeur d'historique devient-il utile. La réponse révèle la nature réelle du produit, un modèle qui s'adapte à vous ou un jeu de règles avec un modèle de langage en façade, et les deux peuvent être légitimes à condition de savoir lequel on achète. Il faut dans le même échange demander ce que deviennent vos données : si elles servent à améliorer un modèle partagé avec d'autres clients, parfois vos concurrents, cela doit être dit et accepté par écrit, et le refus doit être possible sans dégrader le service.
Ce qu'il fait quand il ne sait pas
C'est à mes yeux la question la plus révélatrice, et la plus rarement posée. Un agent sérieux dispose d'une notion de confiance dans ses propres recommandations et d'un comportement défini quand cette confiance est basse : proposer plutôt qu'agir, escalader vers une personne nommée, demander une donnée manquante, ou s'abstenir en le signalant. Il doit aussi avoir un comportement défini face à une donnée absente ou aberrante, un délai à zéro, un stock négatif, une référence sans historique, parce que c'est dans ces situations que les systèmes automatisés produisent leurs erreurs les plus coûteuses avec le plus d'assurance. La façon d'évaluer ce point consiste à demander une démonstration sur un cas hors de ce que l'agent connaît, une référence lancée le mois dernier, un fournisseur jamais vu, une commande dix fois supérieure à l'habitude, et à observer s'il invente une recommandation confiante ou s'il déclare ses limites. Un éditeur qui répond que son agent sait toujours quoi faire vous décrit un produit que je n'ai jamais rencontré en production.
Comment on le débranche
La troisième question concerne la réversibilité, à trois échelles. À l'échelle de l'action, comment on interrompt l'agent au milieu d'une opération et dans quel état il laisse l'ERP, ce qui doit se démontrer et non se décrire. À l'échelle du périmètre, comment on annule ou corrige en série les actions d'une journée si l'on découvre un mauvais paramétrage, et en combien de temps. À l'échelle du contrat, comment on sort : export du journal de décision et des règles paramétrées dans un format ouvert, durée de préavis, sort des données après résiliation. Il faut y ajouter ce qui reste exploitable si l'éditeur disparaît ou se fait racheter, question que les ETI posent trop peu à des sociétés jeunes. Le coût de sortie fait partie du coût d'entrée, et un agent facile à arrêter est aussi un agent que l'on peut étendre avec confiance, parce que chaque extension reste une décision réversible.
Ce qu'il coûte quand il se trompe
La quatrième question ramène l'agent à une réalité que les démonstrations évitent : il se trompera, et il faut savoir à quel prix. Demandez le taux d'erreur observé sur les déploiements existants et la façon dont il est mesuré ; si l'éditeur n'a pas encore de déploiement en production, il le dira, et c'est une information utile plutôt qu'un motif d'exclusion, à condition que le pilote soit dimensionné en conséquence. Distinguez ensuite les deux erreurs, qui n'ont pas le même coût : un faux positif déclenche un transport express ou une commande inutile, dont le coût est connu et borné. Un faux négatif laisse passer une rupture, dont le coût dépend du client touché et peut dépasser de loin le premier. Un bon éditeur accepte de calculer avec vous, sur votre périmètre, ce que coûterait un mois d'erreurs à son taux observé, et de comparer ce montant à ce que coûte aujourd'hui l'absence de décision rapide. Cette comparaison, et non la précision affichée, fonde la décision d'achat, et elle doit se retrouver dans les seuils inscrits au contrat.
Comment on mesure sa valeur à quatre-vingt-dix jours
La cinquième question doit être réglée avant la signature, parce qu'après il est trop tard pour évaluer l'agent contre une référence honnête. Il faut fixer une base de départ mesurée sur les trois mois précédents, sur le périmètre du pilote : coût des transports express, ruptures et leur coût, pénalités, heures passées en réunions de crise, délai moyen entre l'apparition d'un signal et la décision qui y répond. Il faut ensuite choisir trois ou quatre indicateurs suivis pendant le pilote, dont au moins un exprimé en euros et un exprimé en temps de décision, ainsi que le taux de propositions acceptées, qui dit si l'agent est utile ou seulement présent. Il faut enfin décider qui calcule, et la réponse ne peut pas être l'éditeur seul. Un fournisseur incapable de proposer cette mesure vous dit qu'il n'a jamais eu à la produire. Le point de vigilance est de ne pas mesurer ce que l'outil met en avant, la précision de ses estimations par exemple. La valeur d'un agent de pilotage se lit dans les décisions prises plus tôt et mieux après un écart, et non dans la réduction de l'écart lui-même, que personne ne supprimera.
Évaluer un agent IA sur un pilote réel, pas sur une démonstration
La sixième question prend la forme d'une condition : les cinq réponses précédentes s'évaluent sur un pilote, et un pilote se distingue d'une démonstration par trois caractéristiques. Il tourne sur vos données, en lecture, sur une famille ou un site réel choisi pour sa douleur plutôt que pour sa simplicité, et il est utilisé par les planificateurs qui l'utiliseront ensuite, et non par une cellule projet. Il a enfin une durée, quatre à huit semaines, une clause de sortie sans frais et un bilan chiffré dont les critères de succès ont été écrits avant le premier jour. Le bilan doit contenir le journal de ce que l'agent a proposé, de ce que les humains en ont fait et de ce que cela a changé par rapport à la base de départ, sans quoi la décision d'étendre se prendra à l'impression. La méthode de déploiement en quelques semaines a déjà été décrite sur ce blog ; ce que j'ajoute ici, c'est que les réponses de l'éditeur aux cinq premières questions, consignées par écrit, deviennent l'annexe du contrat, et que le pilote sert à vérifier qu'elles étaient vraies. Un éditeur qui préfère la démonstration au pilote a ses raisons, et elles ne sont pas les vôtres.
Cet article part d'une conviction : la prévision parfaite n'existe pas, ce qui compte c'est la décision d'après.
- Sur quelles données il apprend, et ce qu'il fait des vôtres
- Ce qu'il fait quand il ne sait pas
- Comment on le débranche
- Ce qu'il coûte quand il se trompe
- Comment on mesure sa valeur à quatre-vingt-dix jours
- Évaluer un agent IA sur un pilote réel, pas sur une démonstration
Clevizio
Clevizio est la couche de décision qui se branche sur vos outils existants : elle détecte l'imprévu, simule vos options et garde la mémoire de chaque arbitrage. Découvrir comment fonctionne le copilote de décision.
Questions fréquentes
Quelles questions poser à un éditeur d'IA avant de signer ?
Six questions : données d'apprentissage, comportement quand il ne sait pas, réversibilité, coût des erreurs, mesure de la valeur et conditions du pilote. Dans le détail : sur quelles données l'agent apprend et ce qu'il fait des vôtres, comment on l'arrête et comment on sort du contrat, ce que coûtent ses erreurs selon leur type, comment sa valeur sera mesurée à quatre-vingt-dix jours, et à quelles conditions un pilote sur périmètre réel sera conduit. Les réponses écrites deviennent l'annexe du contrat.
Comment tester un agent IA avant de l'acheter ?
Par un pilote de quatre à huit semaines sur vos données réelles, avec les planificateurs qui l'utiliseront et des critères de succès écrits à l'avance. Choisissez une famille ou un site douloureux plutôt que simple, et exigez une clause de sortie sans frais. Pendant le pilote, soumettez-lui des cas hors de ce qu'il connaît pour observer s'il déclare ses limites ou s'il invente.
Comment mesurer la valeur d'un agent IA après 90 jours ?
En comparant à une base de départ mesurée sur les trois mois précédents : transports express, ruptures, pénalités, réunions de crise, délai de décision. Le délai de décision se mesure entre l'apparition d'un signal et l'arbitrage qui y répond. Suivez au moins un indicateur en euros, un en temps de décision et le taux de propositions acceptées, calculés par vos équipes et non par l'éditeur seul. La précision des estimations, elle, ne mesure pas la valeur d'un agent de pilotage.
À lire aussi
Mettez enfin un chiffre sur ce que vos imprévus vous coûtent chaque année.
Commençons par estimer ce que vos imprévus vous coûtent réellement. C'est gratuit, ça prend 30 minutes, et vous repartez avec un chiffre que personne dans votre entreprise ne connaît aujourd'hui.
