Avec 95 % de réussite par étape, un agent de 20 étapes n'a que 35 % de succès réel : les erreurs se multiplient (p^n), elles ne s'additionnent pas. Le remède n'est pas un modèle plus malin, mais de monter la fiabilité par étape et de raccourcir les chaînes.
Un agent qui réussit 95 % du temps a des allures d'employé de luxe. Embauchez-le mentalement : il ne se trompe presque jamais, il rate un mouvement sur vingt, il est pratiquement parfait. Maintenant, demandez-lui d'exécuter une tâche réelle — enquêter, décider, appeler une API, transformer la donnée, écrire le résultat, vérifier — et observez comment ces 95 % irréprochables s'effondrent jusqu'à devenir un pile ou face pire que le pile ou face lui-même. La démo était honnête. L'agent n'a pas menti. C'est l'arithmétique que tu avais en tête qui a menti, parce que tu as supposé que les erreurs s'additionnent alors qu'en réalité elles se multiplient. Voici l'essai sur la loi la plus cruelle — et la plus ignorée — de l'ingénierie des agents.
La Loi de Lusser : pourquoi une chaîne vaut le produit de ses maillons
Dans les années 50, un ingénieur allemand nommé Robert Lusser a formulé une loi inconfortable pour les systèmes en série : quand N composants doivent tous fonctionner pour que l'ensemble fonctionne, la fiabilité totale est le produit des fiabilités individuelles, ni la moyenne ni le minimum. La formule est d'une simplicité brutale : p élevé à la puissance n. Si chaque étape réussit avec une probabilité p et que la tâche exige n étapes enchaînées où chacune dépend de la précédente, le succès de bout en bout est p^n. Lusser l'a déduite en travaillant sur les missiles V-2, des systèmes où un seul maillon défectueux transformait toute la machine en ferraille en flammes. Soixante-dix ans plus tard, la même loi gouverne quelque chose que Lusser n'aurait jamais imaginé : un agent d'IA qui raisonne étape par étape.
Fais le calcul et ton sourire se fige
Mettons des chiffres sur les 95 % par étape, ce chiffre qui sonne comme une mention très bien. Cinq étapes : 0,95^5 = 77 %. Tu as déjà perdu près d'un quart de tes exécutions. Dix étapes : 59 %. Tu viens de franchir la frontière où la plupart de tes runs échouent plus qu'un médiocre. Vingt étapes : 35 %. Ton agent à 95 % de réussite par étape mène la tâche complète à bien une fois sur trois. Cinquante étapes — un flux agentique vraiment ambitieux, avec outils, branches et vérifications — atterrit à un accablant 7 %. Il n'y a eu aucune dégradation du modèle, aucun mauvais jour, aucun prompt raté. Chaque étape a gardé ses 95 % irréprochables. C'est la multiplication, silencieuse et implacable, qui a dévoré ton produit.
Le mirage de la démo : pourquoi ils brillent sur scène et explosent en production
Maintenant tu comprends pourquoi les agents sont des stars sur scène et des désastres dans l'équipe de nuit. La démo est courte par conception : deux ou trois étapes, un happy path répété, un p^n qui vit encore en territoire confortable. La production est longue par nature : vingt, trente, cinquante maillons où chacun hérite du léger écart du précédent. C'est la différence entre réussir un lancer franc — tu le mets neuf fois sur dix — et réussir quarante lancers francs d'affilée sans en rater un seul : le second exploit est presque impossible même si ton adresse est excellente. La démo mesure un tir. La production mesure la série. Et les longues séries, c'est là que p^n t'attend avec un couteau. Gartner a déjà chiffré la désillusion : le cabinet prévoit que plus de 40 % des projets d'IA agentique seront annulés d'ici 2027, beaucoup à cause de coûts et d'un ROI qui n'arrivent jamais — le prix à payer pour découvrir la Loi de Lusser avec de l'argent réel plutôt qu'avec un tableur.
Le remède n'est pas un modèle plus malin : ce sont des maillons plus fiables et des chaînes plus courtes
Le réflexe de l'industrie est de réclamer un modèle plus intelligent, comme si le problème venait du cerveau. La mathématique dit autre chose. Fais passer la fiabilité par étape de 95 % à 99 % et ces mêmes vingt étapes bondissent de 35 % à 81 % : un point de pourcentage par maillon te rend le produit entier. C'est là le levier caché de p^n — l'exposant punit avec la même férocité qu'il récompense. De là surgissent les deux seuls leviers réels, et aucun n'est « attendre GPT-N ». Premier : monter p, la fiabilité de chaque étape, avec de la vérification, de la validation de schéma à chaque frontière et des checkpoints qui attrapent l'écart avant qu'il ne se propage. Deuxième : baisser n, raccourcir la chaîne, décomposer la tâche géante en sous-tâches courtes et vérifiables au lieu d'une épopée monolithique de cinquante mouvements. Un agent discipliné n'est pas celui qui raisonne le plus joliment ; c'est celui qui se trompe moins par étape et enchaîne moins d'étapes par tâche.
Le cadre mental à emporter chez toi
Retiens cette phrase et répète-la chaque fois que tu vois une démo d'agent qui te laisse bouche bée : les erreurs se multiplient, elles ne s'additionnent pas. C'est le cadre réutilisable qui sépare celui qui construit des jouets de celui qui construit des systèmes. Avant de confier à un agent un processus métier, ne demande pas « à quel point est-il malin ? ». Demande deux choses : « quelle est sa fiabilité par étape ? » et « combien d'étapes enchaîne-t-il ? ». Multiplie p^n dans ta tête et tu sauras, avant de dépenser un dollar, si tu regardes un produit ou un mirage de scène. Cette loi est la sœur d'une autre que nous avons déjà racontée — la mathématique du 27 %, l'écart entre ce qu'un agent réussit en démo et ce qu'il tient en production — : celle-là mesure la chute, celle-ci explique le mécanisme exact qui la produit. Lis-les ensemble et tu auras la photographie complète des raisons pour lesquelles tant de pilotes agentiques n'atteignent jamais l'usine.
Comment nous le voyons
Chez NeuralOS, nous ne combattons pas p^n avec de l'optimisme ni avec des promesses de modèle magique : nous le combattons avec de l'architecture. Le moteur d'Automations est conçu autour de la Loi de Lusser même s'il ne porte pas son nom gravé : des étapes courtes et vérifiables au lieu de chaînes monolithiques, des waits durables qui figent l'état sans perdre le fil, la reprise pour repartir exactement là où le processus s'est arrêté, et des checkpoints qui attrapent l'écart avant que la multiplication ne le transforme en catastrophe. Chacun de ces mécanismes attaque la même équation sous un angle différent : il monte le p, raccourcit le n effectif, et fait qu'une défaillance à l'étape 19 n'incendie pas les dix-huit autres déjà réussies. Nous ne promettons pas d'agents infaillibles — personne d'honnête ne le peut, la mathématique ne le permet pas. Nous promettons quelque chose de plus utile : un moteur qui respecte la loi cruelle au lieu de faire comme si elle n'existait pas, pour que tes flux survivent à l'équipe de nuit et pas seulement à la démo de midi.