跳到正文
中文
FikirPilot 内容

Microsoft的新AI“行为准则”文件指出,模型不应入侵系统或欺骗人类

更新于: 2026年9月14日 · 3 分钟阅读

发布于: · 消息抵达: · 处理时长: 3 小时 32 分钟

Microsoft的新AI“行为准则”文件指出,模型不应入侵系统或欺骗人类
空荡的数据中心走廊

Microsoft发布了旨在让人工智能模型远离危险行为的新“AI 行为准则”文件。与 Anthropic CEO Dario Amodei 呼吁设定限制不同,该文件侧重于指导 Microsoft AI 内部模型训练的价值观和红线。

文件预测,未来十年内,超级智能人工智能系统将在大多数任务上的表现超过人类,并指出,控制这种力量将成为人类面临的最大考验之一。在为 Microsoft 模型确立支持人类、促进人类福祉等总体原则的同时,文件还表示,每个模型都必须遵守一套高于用户偏好或特定任务的行为准则。

这些规则将网络攻击、核武器和深度伪造列为“绝对限制”范围内的禁止事项。模型不得使用可适应、欺骗性、自我强化或基于秘密协作的机制来逃避人类监督;同时,模型必须能够由获得授权的人员或系统进行引导、修改和关闭。

这份发布日期为2026年9月14日的公告发布之际,正值人们对人工智能安全的关注不断上升、“rogue-agent”事件相继发生。Microsoft CEO Satya Nadella表示,他们与 OpenAI、Anthropic 和 xAI 一起,支持谨慎推进边界,并开展“embedded evaluators”研究。

为什么重要

该文件的重要性在于,它没有将人工智能安全仅仅寄托于用户警告,而是将其与模型训练和行为边界联系起来。将网络攻击、核武器和深度伪造生成等领域列入绝对限制范围,使哪些用途被视为不可接受变得更加具体。不得逃避监管、可以被修改并能够被关闭等要求,则是从维护人类控制、而非模型能力的角度来界定安全。不过,这些规则将如何在不同模型中实施、如何发现违规行为,以及 embedded evaluators 研究在多大程度上能够得出可靠结果,仍是悬而未决的问题。这一框架也使用户需求与针对模型行为设定的高层级限制之间可能存在的紧张关系变得更加明显。

背景

Microsoft 并不是 FikirPilot 档案中的新面孔:在过去90天里,我们发布了10篇提及这一名称的报道;最新一篇发布于2026年9月14日。

来源: TechCrunch AI