每步95%正确率下,一个20步的智能体真实成功率只有35%:错误相乘(p^n),不相加。解药不是更聪明的模型,而是提高每步可靠性并缩短链条。
一个95%正确率的智能体听起来像个顶级员工。在脑子里雇佣它试试:它几乎从不出错,每二十次动作才失手一次,简直堪称完美。现在让它执行一项真实任务——调研、决策、调用一个API、转换数据、写出结果、再做验证——然后看着那无懈可击的95%如何崩塌,最终沦为比抛硬币还糟的赌注。演示是诚实的,智能体没有撒谎。撒谎的是你脑子里的那套算术,因为你以为错误会相加,而现实里它们相乘。这篇文章讲的,就是智能体工程中最残酷、也最被忽视的那条定律。
Lusser定律:为什么一条链子的强度等于各环强度之乘积
上世纪50年代,一位名叫Robert Lusser的德国工程师为串联系统提出了一条令人不适的定律:当N个组件必须全部正常工作、整体才能运转时,总可靠性等于各个可靠性之乘积,而非平均值,也非最小值。公式简单得残酷:p的n次方。如果每一步以概率p成功,而任务需要n个环环相扣的步骤、每一步都依赖前一步,那么端到端的成功率就是p^n。Lusser是在研究V-2导弹时推导出它的——在那种系统里,单单一个有缺陷的环节就能把整台机器变成一堆燃烧的废铁。七十年后,同一条定律统治着一个Lusser从未想象过的东西:一步步推理的AI智能体。
把账一算,你的笑容就冻住了
我们给那个听起来像满分的每步95%填上数字。五步:0,95^5 = 77%。你已经损失了近四分之一的执行。十步:59%。你刚跨过那道分界线,从此大多数运行都比一个平庸者失败得更频繁。二十步:35%。你那每步95%正确率的智能体,完成整项任务的概率只有三次里一次。五十步——一个真正野心勃勃的智能体流程,带着工具、分支和验证——落在了毁灭性的7%。模型没有退化,没有状态不佳的一天,没有糟糕的提示词。每一步都保持着无可指摘的95%。是那乘法,无声而无情地,吞掉了你的产品。
演示的幻觉:为什么它们在舞台上闪耀、在生产中爆炸
现在你懂了,为什么智能体在舞台上是明星、在夜班里是灾难。演示天生就短:两三步,一条排练好的happy path,一个仍活在舒适区里的p^n。生产天生就长:二十、三十、五十个环节,每一个都继承着前一个的轻微偏差。这就像罚球命中——你十次里能进九次——和连续罚进四十个球一个不失之间的差别:哪怕你的准头出色,后一个壮举也几乎不可能。演示衡量的是一次投篮,生产衡量的是连续命中。而漫长的连击,正是p^n拿着刀等你的地方。Gartner已经给这场幻灭标了价:它预测到2027年,超过40%的智能体AI项目将被取消,很多是因为成本和迟迟不来的ROI——这是用真金白银、而非一张电子表格去发现Lusser定律的代价。
解药不是更聪明的模型:是更可靠的环节和更短的链条
行业的本能反应是要一个更聪明的模型,仿佛问题出在脑子上。数学说的是另一回事。把每步可靠性从95%提到99%,同样的二十步就从35%跃升到81%:每个环节一个百分点,就把整个乘积还给了你。这就是p^n隐藏的杠杆——指数惩罚你时有多凶狠,奖赏你时就有多慷慨。由此得出仅有的两根真实杠杆,没有一根是'等GPT-N'。第一:提高p,也就是每一步的可靠性,靠验证、在每个边界做schema校验、以及在偏差扩散之前就抓住它的检查点。第二:降低n,缩短链条,把一项巨型任务拆解成短小、可验证的子任务,而不是一场五十个动作的单体史诗。一个训练有素的智能体,不是那个推理得更漂亮的;而是那个每步出错更少、每项任务串联更少步骤的。
带回家的思维框架
记住这句话,每当你看到一个让你目瞪口呆的智能体演示时就重复一遍:错误相乘,不相加。这就是那个可复用的框架,它把造玩具的人和造系统的人区分开来。在把一个业务流程托付给智能体之前,别问'它有多聪明?'。问两件事:'它每步的可靠性是多少?'以及'它串联多少步?'。在脑子里算一算p^n,你还没花一美元就会知道:你看的是一个产品,还是一场舞台幻觉。这条定律与我们讲过的另一条是姊妹——那道27%的数学,即智能体在演示中达成的与它在生产中撑得住的之间的鸿沟:那道衡量的是跌落,这条解释的是造成跌落的确切机制。把它们放在一起读,你就有了一张完整的照片,看清为什么那么多智能体试点永远走不进工厂。
我们怎么看
在NeuralOS,我们不用乐观、也不用某个魔法模型的承诺去对抗p^n:我们用架构去对抗它。Automations引擎的设计就围绕着Lusser定律,哪怕它没把这名字刻在上面:用短小、可验证的步骤代替单体链条,用durable waits冻结状态而不丢失线索,用可恢复性从流程停下的确切位置接着走,还有在偏差被乘法放大成灾难之前就抓住它的检查点。这些机制中的每一个,都从不同角度攻击同一个方程:提高p,缩短有效的n,让第19步的一次失败不至于烧掉前面已经跑对的十八步。我们不承诺无懈可击的智能体——没有一个诚实的人能承诺,数学不允许。我们承诺一件更有用的事:一个尊重这条残酷定律、而非假装它不存在的引擎,好让你的流程不只挺过正午的演示,也挺过夜班。