1ステップあたりの成功率が85%のAIエージェントでも、8ステップの一連の処理を最後までやり切れるのはわずか27%。エラーが掛け算で膨らむからだ(0.85⁸ ≈ 27%)。だからこそデモで輝くエージェントの多くが本番で失敗し、Gartnerは2027年までにエージェント型プロジェクトの40%超が中止されると予測している。
あなたはあのデモを見たことがあるはずだ。AIエージェントが指示を受け、自分だけで立て続けに10のことをこなし、完璧な結果を差し出す。拍手。あなたは胸を躍らせ、自分のビジネス向けに導入し……そして1週間後、ひとりでに崩れ落ちる。黒魔術か?いや、違う。中学レベルの数学だ。2026年のAIをめぐる、いちばん居心地の悪い数字をお見せしよう。
誰もやりたがらない計算
あなたのエージェントが、一つひとつの小さなステップで85%の確率で正解を出すとしよう。悪くない響きだろう?なかなかの高得点だ。問題は、現実のフローが1ステップではないことだ。数珠つなぎになった多くのステップからなり、それぞれが前のステップに依存している。8ステップあるなら、すべてがうまくいく確率は85%ではない――0.85の8乗だ。電卓を叩いてみてほしい。答えは27%。27パーセント。あなたの「高得点」なエージェントがタスク全体を最後までやり切れるのは、4回に1回そこそこでしかない。これがreliability gap、デモと現実のあいだに口を開けた深淵だ。
なぜデモはあなたを欺くのか(悪気はないのに)
デモは必ず幸せな一本道を見せる。きれいなデータ、完璧な問い、すべてが整った状態。本番はその逆――カオスだ。変なデータが飛び込み、APIが遅れ、利用上限にぶつかり、ユーザーが思いもよらないことを書く。そうしたつまずきの一つひとつが転倒のチャンスであり、ステップを数珠つなぎにすると、そのつまずきは掛け算で膨らんでいく。エージェントが出来が悪いのではない。現実の暮らしが、どんなデモよりも長く、そして汚れているのだ。
あなたの思い込みではない――Gartnerがすでに数字にした
大げさだと思うなら、これを見てほしい。コンサルティング会社のGartnerは、エージェント型AIのプロジェクトの40%超が2027年末までに中止されると予測している。おもな理由は?膨れ上がるコストと、姿を現さない価値――まさに、デモで輝いたものが本番で期待を裏切るときに起こることだ。熱狂は本物だが、あの深淵を渡り切るための規律は乏しい。
朗報――深淵は運ではなく規律で渡る
本番を生き延びる「本物の」エージェントは、より賢いわけではない――より規律正しいのだ。何かが失敗しても諦めず、リトライする。APIの上限を辛抱強くさばく。何かがうまくいかなかったとき何が起きたのかを知るための目(observability)を持っている。そして何より、きれいなデモの中だけでなく、誰かが本気で試験している。それが、縁日の手品と仕事道具とを分ける違いだ。
私たちの見方
NeuralOSでは、差を生むのは目を奪う単体の部品ではなく、現実の世界に耐えられるよう全体を組み上げ、試験しきる規律にこそあると信じている。あの27%は、まさに私たちを突き動かす問題そのものだ――拍手のためのデモではなく、本番を見据えて作ること。それが私たちの向かう方向であり、すでに手触りのあるものと、まだ道半ばのものとを、正直に区別しながら進んでいく。