NeuralOS
Engineering

エージェントの残酷な数学:1ステップ95%が、最後には35%に

95%の確率で正解するエージェントは完璧に聞こえる。だが20ステップ連鎖させると、実際の成功率は35%まで落ちる。これはバグではない。ロケットを爆発させるのと同じ数学、Lusserの法則だ。エラーは足し算ではなく、掛け算で効いてくる。

EN
Equipo NeuralOS
Ingeniería
Jul 19, 20267 min read
In short

1ステップ95%正解でも、20ステップのエージェントの実際の成功率はわずか35%。エラーは足し算ではなく掛け算(p^n)で効く。治療法はより賢いモデルではなく、1ステップあたりの信頼性を上げ、鎖を短くすることだ。

95%の確率で正解するエージェントは、まるで一流の社員のように聞こえる。頭のなかで採用してみよう。ほとんど失敗せず、20回の操作に1回だけ間違え、実質ほぼ完璧だ。ところが実際のタスク——調査し、判断し、APIを呼び、データを変換し、結果を書き出し、検証する——を任せてみると、あの非の打ちどころのない95%が崩れ落ち、コインを投げるより悪い賭けに成り下がっていく様子が見える。デモは正直だった。エージェントは嘘をつかなかった。嘘をついたのは、君の頭のなかにあった算数のほうだ。エラーは足し算になると思い込んでいたのに、実際には掛け算になるからだ。これは、エージェント工学における最も残酷な——そして最も無視されている——法則についてのエッセイである。

Lusserの法則:なぜ鎖は、その各環の積と同じ強さしか持たないのか

1950年代、Robert Lusserというドイツ人技術者が、直列システムに関する不都合な法則を定式化した。全体が機能するためにN個の部品すべてが機能しなければならないとき、全体の信頼性は各信頼性の積であって、平均でも最小値でもない。その式は残酷なほど単純だ。pのn乗である。各ステップが確率pで正解し、タスクが各ステップが前のステップに依存するnステップの連鎖を必要とするなら、端から端までの成功率はp^nになる。Lusserはこれを、たった1つの欠陥のある環が機械全体を燃えるスクラップに変えてしまうシステム——V-2ミサイル——を扱いながら導き出した。70年後、同じ法則が、Lusserには想像もできなかったものを支配している。ステップごとに推論するAIエージェントだ。

計算してみると、笑顔が凍りつく

優等生のように聞こえる、あの1ステップあたり95%という数字を代入してみよう。5ステップ:0.95^5 = 77%。すでに実行の4分の1近くを失っている。10ステップ:59%。凡人よりも多く失敗する国境を、いま越えたところだ。20ステップ:35%。1ステップ95%正解のエージェントが、タスク全体を完遂するのは3回に1回。50ステップ——ツールも分岐も検証もある、本当に野心的なエージェント・フロー——では、壊滅的な7%に着地する。モデルの劣化はなかった。調子の悪い日もなかった。悪いプロンプトもなかった。各ステップは非の打ちどころのない95%を保っていた。君のプロダクトを飲み込んだのは、静かで容赦ない掛け算だったのだ。

デモの蜃気楼:なぜ舞台では輝き、本番では崩壊するのか

これで、エージェントが舞台ではスターなのに夜勤では惨事になる理由がわかる。デモは設計からして短い。2〜3ステップ、リハーサル済みのハッピーパス、まだ快適な領域に生きているp^n。本番は本質的に長い。20、30、50の環があり、そのそれぞれが前の環のわずかなズレを引き継ぐ。これは、フリースローを決めること——10回中9回は沈める——と、フリースローを40回連続で1本も外さずに決めることの違いだ。後者の偉業は、狙いが優秀でもほぼ不可能である。デモは1本のシュートを測る。本番は連続記録を測る。そして長い連続記録こそ、p^nがナイフを持って君を待っている場所なのだ。Gartnerはすでにこの幻滅に数字を付けている。エージェント型AIプロジェクトの40%以上が2027年までに中止されると予測しており、その多くはコストと、決して届かないROIが原因だ——表計算ソフトではなく本物の金でLusserの法則を発見してしまった代償である。

治療法はより賢いモデルではない:より信頼できる環と、より短い鎖だ

業界の反射的な反応は、問題が脳みそにあるかのように、より賢いモデルを求めることだ。数学は別のことを言う。1ステップあたりの信頼性を95%から99%に上げれば、同じ20ステップは35%から81%へと跳ね上がる。1環あたりわずか1ポイントで、積の全体が戻ってくる。これがp^nの隠れたテコ——指数は、報いるのと同じ獰猛さで罰する。ここから、たった2つの本物のレバーが導かれる。どちらも「GPT-Nを待つ」ではない。1つ目:pを上げる。各ステップの信頼性を、検証、各境界でのスキーマ・バリデーション、そしてズレが伝播する前に捕まえるチェックポイントで高める。2つ目:nを下げる。鎖を短くし、巨大なタスクを50手の一枚岩の叙事詩ではなく、短く検証可能なサブタスクに分解する。規律あるエージェントとは、より美しく推論するものではない。1ステップあたりの間違いが少なく、1タスクあたりに連鎖するステップが少ないものだ。

持ち帰るべきメンタルモデル

このフレーズを胸に刻み、君を唖然とさせるエージェントのデモを見るたびに繰り返そう。エラーは掛け算で効く、足し算ではない。これは、おもちゃを作る者とシステムを作る者を分ける、再利用可能なフレームワークだ。エージェントにビジネスプロセスを託す前に、「どれだけ賢いか?」と問うな。2つのことを問え。「1ステップあたりの信頼性はいくつか?」そして「何ステップ連鎖するのか?」。頭のなかでp^nを掛ければ、1ドルも使う前に、それがプロダクトなのか舞台の蜃気楼なのかがわかる。この法則には、以前語った別の法則という姉妹がいる——27%の数学、エージェントがデモで達成することと本番で維持することのギャップだ。あちらは下落を測り、こちらはそれを生み出す正確なメカニズムを説明する。両方を合わせて読めば、なぜこれほど多くのエージェント型パイロットが決して工場に到達しないのか、その全体像が手に入る。

私たちの見方

NeuralOSでは、p^nを楽観論や魔法のモデルの約束では戦わない。アーキテクチャで戦う。Automationsのエンジンは、その名を刻んではいなくてもLusserの法則を中心に設計されている。一枚岩の鎖ではなく短く検証可能なステップ、糸を失わずに状態を凍らせる durable な wait、プロセスが止まった場所からきっかり再開するための resumability、そして掛け算がそれを大惨事に変える前にズレを捕まえるチェックポイント。これらのメカニズムはそれぞれ、異なる角度から同じ方程式を攻める。pを上げ、実効的なnを短くし、ステップ19での失敗が、すでにうまくいった残り18ステップを焼き尽くさないようにする。私たちは無謬のエージェントを約束しない——正直な者なら誰も約束できない、数学がそれを許さないからだ。私たちが約束するのは、もっと役に立つものだ。あの残酷な法則を、存在しないふりをするのではなく尊重するエンジン。君のフローが正午のデモだけでなく、夜勤を生き延びるために。

Share
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.