Future of Life InstituteのAI Safety Index 2026年夏版は、7人の専門家と6領域でAI企業9社を評価した。AもBも取れた社はゼロ。トップはAnthropicのC+(2.66)で、xAI(0.65)、DeepSeek(0.47)、Mistral(0.33)はFで不合格だった。
業界全体の学年末の成績が配られて、首席が1人も現れないところを想像してほしい。「秀」もない。「優」すらない。まさにそれが、Future of Life InstituteがAI Safety Index 2026年夏版を発表したときに起きたことだ。地球上でもっとも強力なAI企業9社が試験を受け、AもBも取れた社は一つもなかった。トップのAnthropicもC+でギリギリの合格。そして反対の端では、3つの研究所がそのまま不合格になった。花形の生徒がやっと合格ラインに届くとき、問題は生徒ではない。カリキュラムそのものだ。
## 業界が無視できない成績表の作り方
このレポートに重みを与えているのは成績ではなく、その手法だ。Future of Life Instituteは、ライバル企業が石を投げているのではない。長年にわたって安全なAIを推し進めてきた独立組織だ。この指標のために、7人の外部専門家パネルを招集し、各社の公開エビデンスを2026年6月3日まで精査した。対象は6つの大きな領域——リスク評価、現在の被害、安全性フレームワーク、実存的安全性、ガバナンス、透明性——であり、それらを37の具体的な指標に細分化している。そのすべてを、米国の大学で使われるのと同じGPA式の成績スケールに翻訳した。これは現時点で、独立した手法を公開している唯一のAI安全性ランキングだ。つまり、食後の雑談レベルの意見ではなく、存在するもっとも真剣な体温計なのだ。
## 誰も讃えない栄誉の表
数字を見ていこう。痛いからだ。Anthropicは2.66(C+)でトップに立ち、評価された6領域のうち5つでリードした——首席だが、まだ宿題を残している首席だ。その後ろにはOpenAIが2.28(C)で続き、こちらはリスク評価の領域で優位に立った。Google DeepMindは2.01(C)で、ギリギリの合格だ。MetaはD+にとどまり、Z.aiとAlibaba Cloudは冴えないD-で並んだ。そして落第組の集団だ。xAIが0.65(F)、DeepSeekが0.47(F)、そしてリストを締めくくるMistralが0.33(F)。翻訳すると、あなたが日常的に使っている、あるいは耳にしている名前を含め、業界の大半は安全性で合格ラインにすら届いていない。しかも、話しているのは、私たちに代わってますます多くの決定を下すシステムを構築している企業たちなのだ。
## ほとんど誰も見出しにしない、都合の悪い細部
レポートには、さらっと読み流されがちだが、あなたの笑顔を凍りつかせるべき一節がある。レビュアーたちが指摘したのは、2024年から2026年にかけて、Anthropic、OpenAI、Google DeepMind、Metaが軍事利用の禁止を撤回し、今日では防衛関連の提携を積極的に模索しているという事実だ。つまり、表のもっとも上位に位置する4つの研究所——責任の面で先頭を走っているはずの4社——が、自ら引いたレッドラインで後戻りしたのだ。これは些末な技術論ではない。競争が激しくなったとき、重力がどちらに向かって引っ張るかの証拠だ。競争が過熱すると、安全性のガードレールは真っ先に緩む。そして企業サイトで一つのことを約束する者が、契約書で正反対のことにサインしているかもしれない。だからこそ独立した指標がこれほど重要になる。語られることではなく、行われることを測るからだ。
## AIで構築する側にとっての意味
この成績表の教訓は、明快であると同時に都合が悪い。AIの安全性は工場出荷時に付いてこない。それをリードしている研究所でさえもだ。世界最高峰がギリギリ合格し、複数が不合格になるなら、責任をそのときどきのモデルに丸ごと委ねることはできない。あなたのプロダクトとデータが生きるレイヤーで、それを構築しなければならない。ここで煙に巻かずに言おう。NeuralOSはフロンティアモデルを製造していないし、業界全体の安全性を修理するつもりもない。私たちがやっているのは、自分たちの領域でガードレールを真剣に受け止めることだ——テナントごとのデータ分離、暗号化されたクレデンシャル、各スプリントでの敵対的監査プロトコル——そしてmodel-agnosticであること。今日C+を取る相手に縛られないためにこそだ。この指標が残すものがあるとすれば、AIにおいて信頼することは簡単で、検証することが本当の仕事だということだ。私たちは仕事のほうを選ぶ。