跳到正文
中文
FikirPilot 内容

有效开展第三方评估的优先事项和原则

更新于: 2026年10月4日 · 3 分钟阅读

发布于: · 消息抵达: · 处理时长: 271 小时 44 分钟

有效开展第三方评估的优先事项和原则
服务器机房内进行安全检查

OpenAI宣布,将支持独立第三方评估,并指出前沿人工智能实验室应对模型的安全训练、评估和部署负责。这些工作旨在检验安全声明、揭示被忽视的风险,并提高实验室的问责性。据称,评估人员可能获得对培训、评估和部署流程中的技术安全措施、chain of thought 访问权限、机密数据以及用于事件响应的内部部署系统的访问权限。

OpenAI将“安全声明”定义为与模型或系统安全性有关、且可以通过证据进行检验的具体表述;将“安全论证文件”定义为一种结构化论证,通过证据说明特定活动中的风险已得到充分管理。据记录,评估可能持续数周或几个月,不同研究可以并行开展,尤其将着眼于从长期角度审查特定的安全声明。

更全面的评估包括以下四个优先领域:

  • 对涵盖训练、评估、内部部署和外部部署的安全文件进行独立审查;评估安全声明是否有证据支持、是否遵守流程条件,以及是否涵盖关键风险。
  • 审查内部和外部部署中的关键安全措施;测试其抵御越狱攻击、高风险网络、生物和化学能力提升、网络防御以及模型不一致性监测器漏洞的能力。
  • 审查涵盖 Preparedness 风险类别,即 Chemical and Biological Risks、Cybersecurity 和 AI Self-Improvement 领域的能力评估,以及针对严重不一致性风险的评估;检验阈值和测试是否保持最新。
  • 对未经授权的行为或逃避监督等关键模型不一致性事件进行独立调查;研究事件原因,并调查安全措施和纠正措施能否防止类似事件再次发生。

相关原则包括:预先共同确定范围和声明、按比例提供访问权限、采用透明的方法和标准、确保专业性和独立性、保障信息安全和机密性、提供可用于纠正问题的可执行发现,以及开展以证据为基础并保护敏感信息的负责任发布。相关方面强调,评估人员必须披露利益冲突、满足安全要求,并在报告中说明不确定性。OpenAI表示,将支持独立评估生态系统以及共同国际标准的制定。

为什么重要

这一方法旨在将人工智能安全从仅依据实验室自我声明进行评估,转向一种由外部专家检验证据和流程的审计框架。这样一来,开发者的安全文件、测试的充分性以及其对关键事件的应对,都可以接受机构外部的审查。该框架尤其扩大了在高风险网络、生物和化学能力,以及模型逃避监督等领域开展独立审查的范围。然而,评估人员获取敏感数据与负责任发布之间的平衡,仍是决定调查结果在多大程度上向公众公开的核心问题。寻求共同的国际标准,对于确保不同评估结果具有可比性也十分重要。

来源: OpenAI