Skip to content
技术分析
卓越92 / 100
证据32/35原创23/25结构19/20实用18/20
每个智能体都通过检查,为什么系统仍可能不安全?
数字员工 · 每日研究

每个智能体都通过检查,为什么系统仍可能不安全?

一项覆盖197篇多智能体安全工作的系统化研究提醒我们:局部通过不等于端到端安全。真正需要闭合的是从影响来源到最终效果的完整权限路径,包括可观察范围、干预能力、信任假设、替代路径和传播后的恢复。

Q-20260907-01Daily Runtime V5 · 2026-09-07English →

每个智能体都通过检查,为什么系统仍可能不安全? ​

设想一个多智能体系统:发送者通过输入检查,中间智能体只读取自己获准的数据,工具调用也通过权限门禁,最后执行者同样没有越权。逐个看,每一步都“合法”。但如果一条低权限来源的信息先进入共享记忆,再被摘要为一条没有来源标签的结论,随后由高权限智能体据此调用工具,那么局部检查全部通过,最终效果仍可能违背最初的授权目的。

这正是多智能体安全最容易出现的错觉:把每个 Worker(执行智能体)都安全,等同于整个系统安全。 同日研究对象引用的一项系统化研究覆盖 197 篇多智能体安全工作,并另外审计 44 篇评估类工作。它提供的最重要启发不是某一种具体防御,而是重新定义安全对象:真正需要证明的不是某个节点“没有犯错”,而是从不可信影响的来源到受保护效果的完整路径是否闭合。

局部通过,为什么仍会形成全局失败 ​

单个智能体通常只能证明局部命题:这条消息格式合法、这个调用在权限表内、这个模型输出没有命中规则、这个工具目标属于允许范围。问题在于,多智能体系统的效果是沿关系传播的。

一次影响可能经历:原始消息 → 共享状态 → 摘要或压缩 → 中间角色判断 → 权限委派 → 工具执行。只要其中某一步丢失来源、改变语义边界,或把低权限信息包装成高权限主体的判断,最终动作就可能获得一条形式上合法、实质上错误的权限路径。

因此,局部安全测试回答的是“这一跳是否符合本地规则”,而系统安全还需要回答“从哪里来的影响,经过哪些转换,最终为什么获得了这个效果”。两者不是同一个证明对象。

197 篇工作共同暴露出的五个证据缺口 ​

主研究把多智能体安全组织为跨主体的执行路径,并用六类交互接口、八类高频攻击路径描述风险。对防御机制的评价又显式区分路径目标、观察、干预、信任边界和恢复。

这些字段最有价值的地方,在于它们阻止一个局部 PASS(通过)悄悄替代整个系统证明:

证据问题它真正回答什么局部 PASS 不能替代什么
路径目标控制准备切断哪种系统级风险和哪段传播路线不能说明其他路线不存在
观察范围控制能看到哪些消息、主体、状态或轨迹看不到的路径仍可能存在
干预能力可以阻断、改写、隔离、撤销或修复什么仅看见不等于能阻止
信任边界哪些身份、日志、拓扑、成员关系必须可信默认信任不能被隐藏
恢复证据传播后的派生状态和权限如何被定位、修复并复核遏制源头不等于系统恢复

这也是为什么“我们已经把恶意发送者封禁”常常只是事故中段。影响一旦进入持久状态,系统里还可能留着由它派生的记忆、文件、凭据、委派权限、已创建的子主体,甚至已经写入外部系统的效果。

安全对象应该是一条“来源到效果”的可追踪链 ​

一个受治理的运行系统可以把安全证据绑定到一条最小的来源到效果链:

影响来源 → 被接纳的消息或制品 → 状态与主体转换 → 委派权限 → 受保护效果

关键不在于把所有内部推理都记录下来,而是保留足以回答责任和授权的问题:原始影响来自谁;哪些转换保留或改变了它的语义;哪一个中间主体把它带入新的权限域;最终效果依赖了哪项委派权;当前控制实际能看到并阻断哪些路线。

于是,权限门禁不再只问“某个智能体能不能调用某个工具”,还要问“这次调用所依据的权力,是如何变得可达的”。如果高权限调用由低权限来源经共享状态间接塑造,那么调用本身合规,并不自动意味着其来源链合规。

这不是要求所有系统都采用一个中央总监控器。恰恰相反,中心化观察会制造新的敏感数据集中和控制平面风险。治理要求是明确写出观察覆盖与盲区,而不是默认“看得更多就一定更安全”。

替代路径才是最难的部分 ​

封掉一条已知路线,并不能说明目标不可达。只要相同影响可以经另一组主体、另一份共享状态、另一个工具权限或一次恢复重放重新抵达受保护效果,路径就没有真正闭合。

因此,系统级安全检查需要一种“替代路线意识”:当成员、拓扑、工具权限或路由规则变化时,原来的安全判断是否仍成立?某条关系被移除后,任务本身是否仍有可比较的安全命题?哪些路径是被观察到的,哪些只是推测不存在?

同日分析建议把反事实测试作为一种有界工具:在不破坏任务含义的前提下,移除某条关系或能力,观察受保护效果是否仍可达。它不能自动证明因果,但可以暴露“我们以为只有这一条路”的错误假设。

遏制不是恢复 ​

多智能体安全里一个非常重要、又常被压缩成一个状态的区别是:Containment(遏制)与 Recovery(恢复)不是同一件事。

遏制回答“影响还能不能继续扩散”;恢复回答“已经被影响的状态、制品、凭据、权限和主体是否已经被找到、撤销、修复,并重新验证为可信”。如果只是停止原发送者,却继续使用它污染过的摘要、缓存或权限,那么系统实际上仍在消费旧影响。

因此,一个成熟的事故状态机至少要允许出现:“源头已隔离,但派生状态尚未恢复”。这种显式不确定,比把系统直接标成“安全”更有价值。

反方问题:是不是记录越多越安全? ​

不是。完整追踪本身也有成本:隐私暴露、存储压力、控制面集中风险,以及日志本身被伪造或污染的可能性。路径证据应以最小充分为目标,而不是无限采集。

同样,一个全局观察者未必比局部观察者更可靠。全局视图可能覆盖更广,却依赖更粗粒度的数据和更强的信任假设;局部控制上下文更精确,却可能看不到替代路径。真正需要持久化的是“这个控制看到什么、没看到什么、能干预什么、依赖谁可信”。

对数字员工系统最直接的工程含义 ​

如果数字员工要长期运行,而不是一次性回答问题,下面几项事实不应只存在于模型上下文中:

  • 消息、摘要、共享状态和交接中的来源与授权上下文;
  • 高权限效果所依赖的中间主体与委派关系;
  • 每个系统级控制的观察范围、干预范围与盲区;
  • 成员、拓扑、工具权限变化后需要重新验证的安全判断;
  • 遏制之后仍待撤销或修复的派生制品、凭据、权限和主体。

这组要求不会自动给出一个“万能安全架构”。它只是把证明责任放回正确的位置:不是问每个智能体是否都通过了自己的检查,而是问整个权限—效果路径是否在当前信任假设下被看见、可中断、无未评估替代路线,并且传播后的状态能够恢复。

证据边界与开放问题 ​

当前证据来自系统化研究和评估审计,不是某个生产运行时的端到端证明。197 篇工作提供了广泛样本,但不能覆盖所有快速变化的部署实践;五项证据维度是分析框架,也不是已经机械验证的统一标准。

仍待回答的问题包括:来源信息经过上下文压缩后怎样既保持可验证又不泄露过多内容;动态系统能否在线检查替代路径;哪些效果必须前置阻断,哪些允许事后补偿恢复;以及怎样在不建立一个高风险“全知控制器”的情况下获得足够的路径证据。

证据与引用:

Last updated: