人工智能安全是一个工程问题;为此需要明确的要求、可实施的控制措施、负责任的人员,以及证明防护措施有效的证据。随着能力不断增强,应扩大对防御工具的访问,并更快地分享有效实践。
即使互联网和云计算发生变化,身份验证、访问控制、限制暴露面以及验证防护措施等基本责任仍然存在。能够进行推理、使用工具并根据数据进行调整的 AI 代理,要求将这些原则应用于新的条件。
代理安全取决于对模型、管理上下文和工作流的 harness、运行环境、代码、数据、身份、服务和基础设施进行协同保护。例如,网络策略应阻止试图通过恶意指令将客户数据发送至未经授权目标的代理;受保护的日志应显示工具调用、授权决定和结果。更新记录的权限并不等于导出权限;代理不能自行批准额外的访问权限。
运行环境应独立实施文件、网络和进程边界。代理应具备可追溯的身份、受任务限制的凭据、明确的访问策略以及人工审批。应验证工具的来源和完整性;还应制定访问撤销和事件遏制流程。NVIDIA OpenShell 是一个开源、受保护且在代理之外实施策略的运行环境。
为何重要
这一框架表明,仅根据 AI 代理生成的输出对其进行评估可能并不充分;风险会从代理使用的工具扩展到其访问的数据以及运行环境。因此,对于开发人员、系统管理员和安全团队而言,区分责任所在的层级,不仅需要事后调查违规行为,还需要建立预防性边界。代理无法将为执行任务而获得的权限转变为另一种访问方式,这凸显了权限范围在安全设计中的决定性作用。尚未解决的问题是,如何确定在不同工作流中验证这些控制措施的标准,以及当防护措施失效时,如何实施访问撤销和事件遏制。
术语:代理
AI 代理不是只生成单一响应的软件,而是通过调用工具、执行多步骤工作来实现目标的软件。