Anthropic的CEO Dario Amodei提议,在所有领先的人工智能公司中引入第三方安全评估机构。这些机构将负责报告安全事件、审查模型的对齐情况,并向公众公布调查结果。Anthropic承诺向METR和Redwood Research等独立评估机构开放其系统的广泛访问权限,OpenAI的CEO Sam Altman也支持这一做法。
研究人员认为,仅审查最终产品并不充分,因为模型可能会意识到自己正在接受评估,从而在测试期间隐藏有问题的行为。相关建议包括允许评估机构访问训练过程中的中间模型版本、评估记录,以及模型因特定行为而获得奖励的训练后环境。FAR.AI的CEO Adam Gleave表示,这些数据可以显示有问题的行为何时出现,以及公司的声明是否反映事实。研究人员还要求获得与员工交谈的机会。
目前尚不清楚Anthropic和OpenAI将与哪些机构合作、何时任命评估机构、评估机构可以访问哪些系统,以及可以向公众披露哪些内容。Amodei提议,评估机构应能在不受Anthropic编辑监督的情况下,发布有关风险、事件、实践以及获准或被拒绝的访问权限的信息。然而,研究人员强调,公司确实需要放弃对访问权限、期限、保密要求和发布条件的控制。
过去的做法令人对此产生疑虑。OpenAI只给METR和Redwood约1周时间调查Hugging Face事件;由于范围和时间限制,这些机构未能得出明确结论。Apollo Research也只获得3天时间测试GPT-6 Astra。Apollo报告称,由于模型具有评估意识且测试时间有限,较低的不当行为率并不能构成模型对齐的有力证据。
研究人员要求建立一个透明、公开的框架,以界定合格的审计机构和访问标准,并要求将其设为法律义务。Meta、SpaceXAI和Google DeepMind尚未承诺引入第三方评估机构。Demis Hassabis则提议成立一个独立的行业标准机构。
加利福尼亚州去年通过成为法律的SB 53规定,必须发布安全框架并报告重大事件。本月通过的SB 813为州政府认可的“独立验证机构”建立了框架。EU AI Act也要求开展模型评估、对抗性测试并报告严重事件。然而,现行规定仍比Amodei的提议更为有限。
为何重要
该提议将AI安全审计从仅测试已完成的模型,转变为覆盖训练过程、中间版本和公司内部记录的持续审查。这一做法旨在以独立数据检验公司的说法,以应对模型意识到自己正在接受评估后隐藏其行为的问题。然而,过去较短的测试时间和范围限制表明,仅让评估人员进入公司内部并不能保证独立性;访问权限、保密机制和发布权限才是决定性因素。尽管加利福尼亚州的法规和EU AI Act规定了一些评估与报告义务,但该提议要求获得更广泛的访问权限,进一步推动了有关统一、公开标准和法律义务的讨论。Meta、SpaceXAI和Google DeepMind尚未作出承诺,这使该做法能否推广至整个行业仍悬而未决。
背景
OpenAI在FikirPilot档案中并不是一个新名字:过去90天内,我们发布了56篇提及该名称的报道;最新一篇发布于2026年9月16日。