NeuralOS
Industria

2026年夏季AI安全指数:没有一家实验室拿到C+以上,三家不及格

Future of Life Institute组织了一个七人专家小组,用37项指标和大学式评分标准,对九家AI巨头进行了评估。没人拿到A或B。班上最好的Anthropic以C+勉强及格。三家实验室拿了F不及格。这是唯一一份独立的AI安全排行榜,而它的标题就是给整个行业的一记警钟。

EN
Equipo NeuralOS
Radar de IA
Jul 14, 20265 min read
In short

Future of Life Institute的2026年夏季AI安全指数用7位专家和6大领域评估了9家AI公司:没有一家拿到A或B。最好的是Anthropic,C+(2.66);xAI(0.65)、DeepSeek(0.47)和Mistral(0.33)以F不及格。

想象一下,一整个行业的期末成绩单发下来,却连一个荣誉学位都没有。没有优秀,没有良好,甚至连中上都没有。这正是Future of Life Institute发布2026年夏季AI安全指数时发生的事:地球上九家最强大的AI公司参加了这场考试,没有一家拿到A或B。班上最好的Anthropic以C+勉强及格。而在另一端,三家实验室直接不及格。当尖子生都只是刚刚及格,问题就不在某个学生身上,而在教材本身。

## 如何做一份行业无法忽视的成绩单

让这份报告有分量的不是分数,而是方法。Future of Life Institute不是一家往对手身上扔石头的竞争公司:它是一个多年来一直推动AI安全的独立组织。为了这份指数,他们召集了一个七人外部专家小组,审阅了每家公司截至2026年6月3日的公开证据,分布在六大领域——风险评估、当前危害、安全框架、生存性安全、治理和透明度——并细分为37项具体指标。所有这些都被换算成类似GPA的评分标准,也就是美国大学里用来打分的那套。时至今日,这是唯一一份独立的、方法论公开的AI安全排行榜。换句话说:这不是茶余饭后的意见,而是现存最严肃的温度计。

## 谁也没能上榜的光荣榜

我们来看数字,因为它们很扎心。Anthropic以2.66(C+)位居榜首,在六个受评领域中的五个领跑——班上第一,但这个第一还有作业没做完。紧随其后的是OpenAI,拿了2.28(C),不过在风险评估领域占了上风,而Google DeepMind拿了2.01(C):勉强及格。Meta停在D+,Z.ai和Alibaba Cloud并列在可怜的D-。然后是不及格的那一队:xAI拿了0.65(F),DeepSeek拿了0.47(F),Mistral以0.33(F)垫底。翻译过来就是:这个行业的大多数公司,包括那些你天天在用或听说过的名字,在安全上连及格线都够不着。而我们说的,正是那些在构建越来越多替我们做决定的系统的公司。

## 几乎没人拿来做标题的尴尬细节

报告里有个数据一晃就过去,却应该让你的笑容凝固:审阅者指出,在2024到2026年间,Anthropic、OpenAI、Google DeepMind和Meta都撤销了它们对军事用途的禁令,如今正在主动寻求国防合作。也就是说,榜单上排名最靠前的四家实验室——本该在责任担当上走在最前面的那些——在一条它们自己画下的红线上开了倒车。这不是技术细节:这是当竞赛收紧时引力往哪个方向拉的证据。当竞争升温,安全护栏是最先松动的东西,而在公司官网上承诺一件事的人,可能正在合同上签下相反的另一件事。正因如此,一份独立的指数才如此重要:它衡量的是做了什么,而不是说了什么。

## 这对用AI搭建产品的人意味着什么

这份成绩单的教训既清晰又扎心:AI安全不是出厂自带的,就连领跑的那些实验室也一样。如果世界最好的都只是勉强及格,还有好几家不及格,那责任就不能整个甩给当下的某个模型;它必须在你的产品和数据所在的那一层构建起来。这里我们不放烟雾弹:NeuralOS不制造前沿模型,也不打算修复整个行业的安全问题。我们真正做的,是在自己的地盘上认真对待护栏——按租户隔离数据、加密凭证、每个冲刺阶段都做一遍对抗式审计流程——并且做到与模型无关,正是为了不被绑在那个今天拿C+、明天谁知道会怎样的模型上。如果这份指数留下了什么,那就是:在AI领域,信任很容易,而验证才是真正的工作。我们更愿意选择工作。

Share
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.