Stack Overflow 2025 调查(49,000+ 名开发者)显示,对 AI 最大的不满(66%)不是它出错,而是它交出\"几乎正确\"的方案:看起来已完工,却在细节上失败,修它比从头开始还费劲。这门手艺不再是生成,而是用清晰的规格和验证去收尾那最后一段。
有一种错误比彻底搞错更让人恼火:几乎做对。当某样东西明显是错的,你会把它扔掉、重新开始,毫无留恋。但当它几乎是对的——95% 无可挑剔,5% 坏在一个你看不见的角落——你就被困住了,因为看起来你只差一次微调就能收尾,而实际上你离一次彻底重写还很远。Stack Overflow 2025 官方调查有超过 49,000 名开发者作答,给这份恼火标上了数字:对 AI 排名第一的不满不是它说谎、不是它幻觉、也不是它慢。而是它交出的是"几乎对、但差一点"的方案。66% 的人指向了这一点。这是整个行业票数最高的抱怨,它蕴含着一条教训,适用于任何向模型提出要求的人——无论你会不会编程。
"几乎"是世上最贵的错误
直觉告诉我们,大错比小错代价更高。可在 AI 身上恰恰相反。一个显而易见的错误很便宜:你一秒就能发现它,想都不用想就丢掉。而"几乎正确"的错误贵得离谱,因为它首先得说服你它是对的——而且它做到了,因为那能跑通的 95% 卸下了你的防备——然后才在上线后、在客户盯着看的时候,暴露出让它崩溃的那 5%。你付了两次代价:为信任付一次,为发现得太晚再付一次。调查中的第二大不满冷冷地印证了这一点:45.2% 的人说,调试 AI 生成的代码比自己写还费时间。翻译过来就是:那个"几乎"没帮你省下工作,只是把它挪了个地方,还给它加上了利息。
最后一公里综合症
有一个比任何图表都更贴切的类比。想象一个快递员把你的包裹送了 99% 的路程,然后把它扔在对街的人行道上、错误的门牌前、离你家一条街的地方。技术上讲他几乎跑完了全程。实际上,包裹没送到,而现在得由你冒着雨出门去找它。那最后一公里——从"几乎送达"到"送达"之间的那一段——正是真正价值所在,也正是 AI 无法独自收尾的那一段。它几秒钟就生成了 90%,把需要理解整个问题的那 10% 留给你。问题在于,最后那 10% 往往比开头的 90% 更难,因为它要求的是上下文、判断力,以及知道在你这个具体场景里什么才算真正"正确"。
所以信任下降了,而且下降得有道理
同一份调查记录了一个乍看矛盾的数据:84% 的开发者在用或计划用 AI,但与此同时,正面情绪从 2023 和 2024 年的 70% 以上,跌到了 2025 年的约 60%。用的人更多,喜欢的人却更少。这不是矛盾,而是成熟。新鲜感耗尽了,剩下的是真实体验,而真实体验是:AI 是一件强大的工具,需要持续的监督。最能说明问题的细节:如今主动怀疑 AI 准确性的开发者(46%)比信任它的(33%)还多,而真正非常信任的只有可怜的 3%。这不是排斥。这是你对一台电锯该有的健康敬意:你每天都在用它,也正因如此,你从不把两只手都松开。
不舒服的真相:"几乎"是流程的错,不是模型的错
把锅甩给模型很诱人——什么它会幻觉、它不会推理——但那躲开了真正的教训。一个模型产出的,是它的规格允许它去验证的东西。如果你对它说"帮我做一个支付表单",却不说清楚什么才算正确——支持哪些货币、有哪些错误、用户双击会怎样、要记录什么——模型就会用看似合理的假设去填补那些空白,而"看似合理"正是"几乎正确"的定义。几乎对并非源于模型的无知;它源于请求的含糊,以及缺少一个能给出是或否的检验。哪里没有清晰的规格和验证,模型就总会交出一个看起来已经完工的东西。"它对吗?"这个问题,构建的人回答不了。得由验证的人来回答——而且这必须是两个不同的时刻。
这门手艺不再是写,而是收尾
如果那 90% 谁都能在几秒内生成,专业上的优势就迁移到了最后一公里:迁移到在提出请求之前会界定什么才算正确,以及在收到结果之后会验证它是否真的做到了。这就是可以复用、可以分享的思维框架:把 AI 的每一次输出都当作一份有说服力的草稿,而不是一份可交付成果;在生成之前就把"完成"的标准白纸黑字写下来;并且刻意地把构建和审计分成两个步骤,因为构建的那颗脑子爱着自己的作品,看不见那坏掉的 5%——那 5% 只有一颗带着找茬之心、全新上阵的脑子才抓得住。几乎对,不是靠更多的信任来收尾的。它靠更多的规格和更多的检验来收尾。这没有"AI 全都搞定"那么光鲜,但这是唯一能把一份令人印象深刻的草稿,变成在另一端有真实客户时也扛得住的东西的办法。
我们怎么看
在 NeuralOS,我们从一开始就假定:AI 单独运作,产出的就是那个几乎对——我们不把它当作某天会被修好的缺陷,而是当作这片地形的本性。所以我们构思产品,不是围绕着更快地生成,而是围绕着收尾那最后一公里:让规格成为唯一的真相来源,从而在任何东西被执行之前,"什么才算正确"就已经写下来;让构建与审计刻意地活在分开的步骤里,因为同一颗脑子做不好这两件事;让"完成"的标准不由"看起来能跑"的兴奋来裁定,而由一个能给出是或否的明确验证来裁定。这就是我们全部的立场:我们不兜售"AI 会自己做对"的幻想。我们捍卫的是那种把它的"几乎"变成一个可验证的"是"的纪律——那最后一公里,做得足够扎实,好在真正重要的时刻扛得住。因为归根结底,功劳从来都不在生成那 90%。它一直、始终,在于收尾那决定包裹是否送到的 10%。