SheepNav
精选11天前0 投票

智能体AI运行时治理:Aegis系统实现动作边界控制与失败闭合执行

随着AI智能体(Agentic AI)从单纯的文本生成走向实际工具操作,安全问题正从“有害文本”转向“有害操作副作用”。一篇来自arXiv的新论文提出了名为 Aegis 的运行时治理系统,将模型输出视为“动作提议”,由可信运行时在工具执行前进行裁决,从而建立真正的执行边界。

从提示词治理到运行时治理

传统的安全防护主要依赖提示词层面的约束,例如在系统提示中明确“不要删除文件”或“不要发送邮件”。然而,论文作者指出,提示词治理只能塑造模型行为,却无法创建执行边界。模型可能因越狱、幻觉或上下文误导而违反指令,而一旦工具调用被直接执行,后果将不可逆转。

Aegis的核心设计理念是:模型提议,运行时决策。模型输出的工具调用不再被直接执行,而是先提交给一个可信的决策层,由后者根据当前策略状态进行评估。

Aegis的关键机制

  • 策略评估:Aegis将模型提议与活跃策略进行比对,判断该操作是否在允许范围内。
  • 服务端溯源解析:与客户端信任模型不同,Aegis在服务端解析数据来源,确保决策基于可信的上下文。
  • 失败闭合(Fail-Closed):当系统对某项操作的安全性不确定时,默认拒绝执行,而非放行。
  • 参议院式裁决(Senate-style Settlement):对于需要授权的操作,采用基于法定人数的非单边授权路径,避免单一决策点。

这些机制共同构建了一个多层次的防护网,确保即使模型输出存在风险,也无法直接转化为实际副作用。

实验验证:零风险副作用

论文在包含 5个运行家族、42项任务、3种条件、每家族10次重复 的沙箱语料库上进行了评估。在 6,300行 数据中,仅提示词策略控制产生了 79行 风险比较路径泄漏;而在 2,100行 Aegis治理数据中,系统记录了 零次 治理的模拟工具应用和 零次 治理的风险副作用完成。此外,1,832行 尝试治理的行均保留了可信的Aegis解析溯源,1,019行 参议院裁决行均具有法定人数和最终签名计数证据。

意义与局限

这项研究的意义在于,它为智能体AI的安全性提供了一种新的思路:将安全边界从模型内部转移到外部运行时。正如作者所言,这些结果并不证明通用自主智能体的安全性,但支持一个更具体的系统声明:在评估的沙箱语料库中,运行时动作边界治理防止了观察到的风险提议变成治理的副作用。

未来,Aegis这类系统有望成为AI智能体部署的标准组件,特别是在金融、医疗等高风险领域,为自主决策提供必要的安全护栏。

延伸阅读

  1. Sayscroll:随声而动的AI提词器,让演讲更自然流畅
  2. 告别你的弃坑项目:RIP MY BUILD 为它举行最后一次“发布”
  3. ChordWeaver:用乐理解锁音乐创作与学习的新维度
查看原文