OpenAIは、フロンティアAIラボがモデルの安全な訓練、評価、展開に責任を負うとしたうえで、独立した第三者による評価を支援すると明らかにした。これらの取り組みは、安全性に関する主張を検証し、見過ごされているリスクを明らかにし、ラボの説明責任を高めることを目的としている。評価者には、訓練、評価、展開のプロセスにおける技術的な安全対策、chain of thoughtへのアクセス、機密データ、インシデント対応のための内部展開システムへのアクセスが提供される可能性があるという。
OpenAIは、「安全性に関する主張」を、モデルまたはシステムの安全性に関して証拠によって検証可能な具体的な声明と定義し、「安全性ファイル」を、特定の活動におけるリスクが十分に管理されていることを証拠に基づいて説明する構造化された論証と定義した。評価には数週間または数カ月かかる可能性があり、複数の取り組みを並行して実施できるほか、特に特定の安全性に関する主張を長期的に検討することに重点を置くと記された。
より包括的な評価に向けた4つの優先分野は、以下のとおりだ。
- 訓練、評価、内部展開、外部展開を対象とする安全性ファイルの独立した審査。安全性に関する主張が証拠によって裏付けられているか、プロセス上の条件が遵守されているか、重大なリスクが網羅されているかを評価する。
- 内部展開および外部展開における重要な安全対策の審査。ジェイルブレイク、高リスクなサイバー・生物・化学能力の向上、サイバー防御、モデルのミスアラインメント・モニターにおける欠落に対する強靱性を検証する。
- Preparedness risk categories、すなわちChemical and Biological Risks、Cybersecurity、AI Self-Improvementの分野を対象とする能力評価、および深刻なミスアラインメント・リスクに関する評価の審査。閾値とテストが最新のものであるかを検証する。
- 無許可の行動や監視の回避など、重大なモデルのミスアラインメント事象を独立して調査する。事象の原因と、安全対策および是正措置が同様の事象を防止できるかどうかを調べる。
原則として、対象範囲と主張を事前に共同で定めること、比例的なアクセス、透明性のある手法と基準、専門性と独立性、情報セキュリティと機密性、是正に活用できる調査結果、さらに証拠に基づき、機微な情報を保護する責任ある公表が示された。評価者は利益相反を開示し、安全性の要件を満たし、報告書で不確実性を明示しなければならないと強調された。OpenAIは、独立評価者のエコシステムと共通の国際基準の策定を支援すると明らかにした。
なぜ重要なのか
このアプローチは、AI安全性をラボの自己申告だけで評価するのではなく、外部の専門家が証拠とプロセスを検証できる監査の枠組みへと移行させることを目指している。これにより、開発者の安全性関連文書、テストの十分性、重大インシデントへの対応を組織外から審査できるようになる。とりわけ、高リスクなサイバー・生物・化学能力や、モデルが監視を回避する可能性といった分野で、独立した審査の対象範囲を広げるものだ。一方で、評価者による機微なデータへのアクセスと責任ある公表とのバランスは、調査結果がどの程度一般に公開されるかを左右する主要な問題として残されている。共通の国際基準を求める動きも、異なる評価の比較可能性という点で重要となる。