NeuralOS
Engineering

La mathématique cruelle des agents : 95 % par étape, 35 % à l'arrivée

Un agent qui réussit 95 % du temps semble irréprochable. Enchaînez vingt étapes et son taux de réussite réel tombe à 35 %. Ce n'est pas un bug : c'est la Loi de Lusser, la même mathématique qui fait exploser les fusées. Les erreurs ne s'additionnent pas, elles se multiplient.

EN
Equipo NeuralOS
Ingeniería
Jul 19, 20267 min read
In short

Avec 95 % de réussite par étape, un agent de 20 étapes n'a que 35 % de succès réel : les erreurs se multiplient (p^n), elles ne s'additionnent pas. Le remède n'est pas un modèle plus malin, mais de monter la fiabilité par étape et de raccourcir les chaînes.

Un agent qui réussit 95 % du temps a des allures d'employé de luxe. Embauchez-le mentalement : il ne se trompe presque jamais, il rate un mouvement sur vingt, il est pratiquement parfait. Maintenant, demandez-lui d'exécuter une tâche réelle — enquêter, décider, appeler une API, transformer la donnée, écrire le résultat, vérifier — et observez comment ces 95 % irréprochables s'effondrent jusqu'à devenir un pile ou face pire que le pile ou face lui-même. La démo était honnête. L'agent n'a pas menti. C'est l'arithmétique que tu avais en tête qui a menti, parce que tu as supposé que les erreurs s'additionnent alors qu'en réalité elles se multiplient. Voici l'essai sur la loi la plus cruelle — et la plus ignorée — de l'ingénierie des agents.

La Loi de Lusser : pourquoi une chaîne vaut le produit de ses maillons

Dans les années 50, un ingénieur allemand nommé Robert Lusser a formulé une loi inconfortable pour les systèmes en série : quand N composants doivent tous fonctionner pour que l'ensemble fonctionne, la fiabilité totale est le produit des fiabilités individuelles, ni la moyenne ni le minimum. La formule est d'une simplicité brutale : p élevé à la puissance n. Si chaque étape réussit avec une probabilité p et que la tâche exige n étapes enchaînées où chacune dépend de la précédente, le succès de bout en bout est p^n. Lusser l'a déduite en travaillant sur les missiles V-2, des systèmes où un seul maillon défectueux transformait toute la machine en ferraille en flammes. Soixante-dix ans plus tard, la même loi gouverne quelque chose que Lusser n'aurait jamais imaginé : un agent d'IA qui raisonne étape par étape.

Fais le calcul et ton sourire se fige

Mettons des chiffres sur les 95 % par étape, ce chiffre qui sonne comme une mention très bien. Cinq étapes : 0,95^5 = 77 %. Tu as déjà perdu près d'un quart de tes exécutions. Dix étapes : 59 %. Tu viens de franchir la frontière où la plupart de tes runs échouent plus qu'un médiocre. Vingt étapes : 35 %. Ton agent à 95 % de réussite par étape mène la tâche complète à bien une fois sur trois. Cinquante étapes — un flux agentique vraiment ambitieux, avec outils, branches et vérifications — atterrit à un accablant 7 %. Il n'y a eu aucune dégradation du modèle, aucun mauvais jour, aucun prompt raté. Chaque étape a gardé ses 95 % irréprochables. C'est la multiplication, silencieuse et implacable, qui a dévoré ton produit.

Le mirage de la démo : pourquoi ils brillent sur scène et explosent en production

Maintenant tu comprends pourquoi les agents sont des stars sur scène et des désastres dans l'équipe de nuit. La démo est courte par conception : deux ou trois étapes, un happy path répété, un p^n qui vit encore en territoire confortable. La production est longue par nature : vingt, trente, cinquante maillons où chacun hérite du léger écart du précédent. C'est la différence entre réussir un lancer franc — tu le mets neuf fois sur dix — et réussir quarante lancers francs d'affilée sans en rater un seul : le second exploit est presque impossible même si ton adresse est excellente. La démo mesure un tir. La production mesure la série. Et les longues séries, c'est là que p^n t'attend avec un couteau. Gartner a déjà chiffré la désillusion : le cabinet prévoit que plus de 40 % des projets d'IA agentique seront annulés d'ici 2027, beaucoup à cause de coûts et d'un ROI qui n'arrivent jamais — le prix à payer pour découvrir la Loi de Lusser avec de l'argent réel plutôt qu'avec un tableur.

Le remède n'est pas un modèle plus malin : ce sont des maillons plus fiables et des chaînes plus courtes

Le réflexe de l'industrie est de réclamer un modèle plus intelligent, comme si le problème venait du cerveau. La mathématique dit autre chose. Fais passer la fiabilité par étape de 95 % à 99 % et ces mêmes vingt étapes bondissent de 35 % à 81 % : un point de pourcentage par maillon te rend le produit entier. C'est là le levier caché de p^n — l'exposant punit avec la même férocité qu'il récompense. De là surgissent les deux seuls leviers réels, et aucun n'est « attendre GPT-N ». Premier : monter p, la fiabilité de chaque étape, avec de la vérification, de la validation de schéma à chaque frontière et des checkpoints qui attrapent l'écart avant qu'il ne se propage. Deuxième : baisser n, raccourcir la chaîne, décomposer la tâche géante en sous-tâches courtes et vérifiables au lieu d'une épopée monolithique de cinquante mouvements. Un agent discipliné n'est pas celui qui raisonne le plus joliment ; c'est celui qui se trompe moins par étape et enchaîne moins d'étapes par tâche.

Le cadre mental à emporter chez toi

Retiens cette phrase et répète-la chaque fois que tu vois une démo d'agent qui te laisse bouche bée : les erreurs se multiplient, elles ne s'additionnent pas. C'est le cadre réutilisable qui sépare celui qui construit des jouets de celui qui construit des systèmes. Avant de confier à un agent un processus métier, ne demande pas « à quel point est-il malin ? ». Demande deux choses : « quelle est sa fiabilité par étape ? » et « combien d'étapes enchaîne-t-il ? ». Multiplie p^n dans ta tête et tu sauras, avant de dépenser un dollar, si tu regardes un produit ou un mirage de scène. Cette loi est la sœur d'une autre que nous avons déjà racontée — la mathématique du 27 %, l'écart entre ce qu'un agent réussit en démo et ce qu'il tient en production — : celle-là mesure la chute, celle-ci explique le mécanisme exact qui la produit. Lis-les ensemble et tu auras la photographie complète des raisons pour lesquelles tant de pilotes agentiques n'atteignent jamais l'usine.

Comment nous le voyons

Chez NeuralOS, nous ne combattons pas p^n avec de l'optimisme ni avec des promesses de modèle magique : nous le combattons avec de l'architecture. Le moteur d'Automations est conçu autour de la Loi de Lusser même s'il ne porte pas son nom gravé : des étapes courtes et vérifiables au lieu de chaînes monolithiques, des waits durables qui figent l'état sans perdre le fil, la reprise pour repartir exactement là où le processus s'est arrêté, et des checkpoints qui attrapent l'écart avant que la multiplication ne le transforme en catastrophe. Chacun de ces mécanismes attaque la même équation sous un angle différent : il monte le p, raccourcit le n effectif, et fait qu'une défaillance à l'étape 19 n'incendie pas les dix-huit autres déjà réussies. Nous ne promettons pas d'agents infaillibles — personne d'honnête ne le peut, la mathématique ne le permet pas. Nous promettons quelque chose de plus utile : un moteur qui respecte la loi cruelle au lieu de faire comme si elle n'existait pas, pour que tes flux survivent à l'équipe de nuit et pas seulement à la démo de midi.

Share
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.