Anthropicの研究者Evan Hubingerは、AIが10年以内に全人類を殺害する可能性は10%を超えると考えていることを明らかにした。Hubingerは、Anthropicを退職したJacob CoxonによるXへの投稿に返信し、自分たちは本当にそう考えていると述べた。Hubingerは、Anthropicができる限りのことをしているとしながらも、超知能とのアラインメント問題を解決するための計画や明確なロードマップはまだないと語った。過去3年間、OpenAIとAnthropicで研究者として働いてきたCoxonは、両社が十分に責任ある行動を取っていないと主張して退職していた。Coxonは、企業が自己改善する超知能の実現を目指して無秩序な競争を繰り広げており、そうしたシステムが人間を超える能力によって権力や資源を獲得する可能性がある一方、経営陣は密室で恐怖を抱いていると主張していた。
なぜ重要なのか
これらの発言は、AIのリスクに対する懸念が企業外部からの批判に限らず、システムを開発する研究者の間にも存在することを示している。Hubingerが、Anthropicは努力していると述べる一方で、超知能とのアラインメントに向けた計画や明確なロードマップがないと認めたことにより、安全性という目標と現在の準備水準との隔たりが浮き彫りになった。CoxonがOpenAIとAnthropicでの経験を経て、責任の欠如と無秩序な競争を批判して退職したことで、この議論は単なる技術上の問題ではなく、企業統治と研究者の責任をめぐる問題にもなっている。経営陣が密室で恐怖を抱いているとの主張は、各組織が公に示す姿勢と内部の懸念との関係が明らかになっていないことを示している。残された根本的な問いは、自己改善し、人間を超える能力を持つ可能性があるとされるシステムを前に、これらの企業がどのような具体的な計画によってリスクを管理するのかという点だ。
背景
AnthropicはFikirPilotのアーカイブで新しい名前ではない。過去90日間に、この名前が登場するニュースを9本公開しており、最新のものは2026年9月10日付だ。