Les capacités de l’IA dessinent une frontière irrégulière plutôt qu’une échelle régulière.
Un système peut obtenir d’excellents résultats sur une tâche et échouer de manière inattendue sur une autre qui paraît tout aussi difficile à un humain. Il peut rédiger un bon résumé d’un rapport fourni, mais inventer un fait face à une question ouverte. Il peut classer correctement un document familier, mais mal interpréter une exception rare. Il peut mener à bien un workflow court, mais perdre sa cohérence sur une longue séquence d’étapes interdépendantes.
Cette limite inégale est l’une des idées les plus importantes pour le déploiement en entreprise.
Pourquoi les moyennes induisent en erreur
Les équipes évaluent souvent un système d’IA à l’aide de moyennes :
- Précision moyenne
- Temps gagné en moyenne
- Satisfaction moyenne des utilisateurs
- Performance moyenne sur les benchmarks
Les moyennes sont utiles, mais elles peuvent masquer le mode de défaillance qui compte le plus. Si un système a raison dans 95 % des cas courants mais n’est pas fiable sur les exceptions, sa valeur dépend de la capacité du workflow à détecter les 5 % restants et à les orienter en toute sécurité.
« Quelle est la précision du modèle ? » n’est pas la bonne question à poser en premier. Une meilleure question serait :
Où le modèle échoue-t-il, ces échecs sont-ils visibles, et que se passe-t-il lorsqu’il échoue ?
Le littoral dans le brouillard
La métaphore de la frontière est utile, car elle change notre façon d’envisager le déploiement.
Un mur serait facile à gérer : tout ce qui se trouve d’un côté fonctionne, tout ce qui se trouve de l’autre ne fonctionne pas. Un littoral dans le brouillard est plus difficile. Des tâches voisines peuvent se situer de part et d’autre de la ligne. Les utilisateurs ne voient pas toujours où passe la limite, en particulier lorsque le résultat reste assuré et cohérent.
C’est pourquoi des équipes peuvent vivre des expériences contradictoires avec le même outil :
- Une équipe de service client constate des gains immédiats
- Une équipe juridique découvre des citations peu fiables
- Les analystes accélèrent le reporting courant
- Les experts perdent du temps à valider des cas limites complexes
Toutes peuvent avoir raison. Le système opère sur différentes parties de la frontière.
Cartographier les workflows plutôt que les intitulés de poste
L’unité d’analyse utile est la tâche, et la manière dont son résultat est vérifié. Un intitulé de poste est trop grossier.
Prenons le rôle d’« analyste financier ». Il recouvre de nombreuses activités différentes :
- Collecter des données à partir de rapports
- Rapprocher des entités entre différents systèmes
- Rédiger des commentaires courants
- Analyser un écart inattendu
- Décider si une anomalie est significative
- Défendre une recommandation auprès de la direction
Certaines sont très structurées et faciles à vérifier. D’autres dépendent d’un contexte tacite, de la responsabilité et du jugement. L’IA n’affectera pas toutes les composantes du rôle au même rythme.
Un exercice de cartographie pratique
Pour chaque workflow, évaluez cinq dimensions :
- Qualité des sources : les données d’entrée sont-elles accessibles, structurées et gouvernées ?
- Répétabilité de la tâche : le travail suit-il un schéma récurrent ?
- Coût de vérification : le résultat peut-il être vérifié rapidement et de manière fiable ?
- Conséquence d’une erreur : que se passe-t-il si le résultat est faux ?
- Circuit d’escalade : les cas incertains peuvent-ils être transmis à un responsable qualifié ?
Les tâches qui combinent des données de qualité, une structure répétable, une vérification peu coûteuse, des conséquences maîtrisables et une escalade claire sont de bonnes candidates à l’automatisation.
Les tâches marquées par des données ambiguës, une vérification coûteuse, des conséquences graves et une responsabilité floue relèvent de l’investigation assistée par l’IA plutôt que de l’automatisation sans supervision.
Concevoir pour échouer proprement
Les meilleurs systèmes d’IA d’entreprise partent du principe que le modèle se trompera parfois, et sont conçus pour échouer de manière visible et sûre.
Cela signifie que :
- La confiance seule ne décide pas de l’action
- Des règles métier signalent les exceptions connues
- Les preuves sources sont disponibles à côté de chaque affirmation déterminante
- Les cas à faible confiance ou à fort impact sont escaladés
- Les équipes suivent l’évolution des schémas de défaillance dans le temps
- Les retours améliorent le workflow, et pas seulement le prompt
Éliminer toutes les erreurs avant le déploiement n’est pas réaliste. L’objectif est de rendre les erreurs restantes visibles, circonscrites et rattrapables.
L’approche aixtract
aixtract aide les organisations à voir où se situe la frontière. En reliant les résultats aux données et aux preuves sous-jacentes, aixtract permet de déployer l’IA là où elle est fiable, d’identifier les exceptions là où elle ne l’est pas, et d’affiner la limite en continu.
Savoir si l’IA fonctionne ne répond qu’à la moitié de la question. L’autre moitié consiste à savoir si le workflow sait quoi faire lorsqu’elle échoue.
Adapté du livre La pensée au rabais : Ce que l’IA rend abondant, ce qu’elle rend rare, et à qui profite la différence de Daoyuan Li, PhD.