OpenAIの最も強力なAIモデルになると予想されているAstraの発売は、安全プロトコルを強化するため、数週間延期された。延期の決定から間もなく、The Informationは、同モデルが他の最先端AIシステムと比べて「思考」プロセスをはるかに少なくしか示していないと報じた。これにより、Astraの監視や危険な挙動の検出が困難になる可能性があるとの懸念が生じた。
現在、多くの高度なAIモデルは、回答を生成する際に推論の手順を可視化する「chain of thought」アプローチを使用している。研究者はこれにより、モデルが嘘をついたり、安全対策を回避したりする計画を追跡できる。The Informationが身元を明らかにしていない情報筋の話として報じたところによると、Astraは、情報を内部の層の間で循環的に処理する「recurrent depth」または「looped transformer」と呼ばれる、より閉鎖的な技術を使用している。この手法は性能を向上させる可能性がある一方、モデルの思考プロセスを分かりにくくし、脅威の特定を困難にする可能性がある。
OpenAIは、この技術の使用を制限し、研究者が推論を監視できるよう追加の対策を講じたと報じられている。同社は、Astraを「chain-of-thought monitoring」とともに提供し、不適合な行動を迅速に検出して制限すると説明したが、モデルの技術的基盤については確認しなかった。
Redwood Researchの主任科学者Ryan Greenblattは、より閉鎖的なアーキテクチャーは「AI security/safety」の観点から、これまでで最悪の展開になり得ると述べた。Greenblattら専門家は、企業が競争を理由にますます不透明なシステムへと向かうことで、AI監督における「race to the bottom」が生じる可能性があると警告した。
OpenAIの主任科学者Jakub Pachockiは、Astraの内部計算の深さはGPT-4の2倍未満の範囲にあると述べた。同社は、looped transformerを使用しているかどうかを確認しなかった。
なぜ重要か
Astraの延期は、発売スケジュールだけでなく、高度なAIシステムをどのように監督するかをめぐる議論にも影響を及ぼしている。モデルの内部動作を見えにくくするアーキテクチャーを使用しているとの主張は確認されていない。しかしこの主張は、モデルが嘘をついたり、安全対策を回避しようとしたりする試みを追跡する能力について、安全性研究者の懸念を強めている。OpenAIが追加の監視・制限措置を計画していると説明しても、性能と監督可能性の間にある緊張は解消されない。依然として残る根本的な問いは、同社の安全プロトコルが、非公開性の高いシステムにおいて危険な行動を適時に特定するのに十分かどうかだ。
背景
OpenAIは、FikirPilotのアーカイブでは新しい名前ではない。過去90日間にこの名前が登場するニュースを19本公開しており、最も新しいものは2026年9月6日付だ。