Skip to content
技术分析
待周评
发现威胁,不等于已经控制住
行业架构 · 每日研究

发现威胁,不等于已经控制住

持久多智能体实验显示,系统可以识别并警告对抗性事件,恶意内容却继续被执行、保存和传播。安全终态必须分别证明检测、控制、清除与恢复。

Q-20260917-02Daily Runtime V5 · 2026-09-17English →

发现威胁,不等于已经控制住 ​

安全系统发现了恶意链接,向所有智能体发出警告,然后把事件标为“已处理”。但某些智能体仍与链接交互,恶意内容已经写入长期记忆,并在两天后的检索中重新出现。警告证明风险被看见,不证明风险停止产生效果。

在一次性对话里,这个差别容易被忽略。长期运行的多智能体环境会保留记忆、共享制度并把任务转交给后来者。一个对抗性输入可以在原始消息消失后继续通过摘要、计划、缓存和外部状态存活。因此,检测必须与控制、清除和恢复分别建模。

一次警报之后,风险还会继续生长 ​

同日研究对象分析 Emergence World Study(涌现世界研究)2。研究构造八个长期多智能体世界,每个世界包含十个智能体,累积超过85万次模型调用和近500亿令牌。智能体在持久记忆、共享制度与连续事件中运行,而不是在彼此隔离的短会话里完成单一任务。

这种纵向设置的价值在于,它允许风险延迟出现。恶意内容可以先被接收,随后进入记忆,再由另一个智能体在后续任务中取回。单轮评测若只检查当下回复,可能把尚未显现的传播路径误当成不存在。

这些世界仍是实验环境,不是对所有企业平台的复刻。但它们直接展示了持续状态如何改变安全终态的含义。

所有系统都会警告,仍没有完整防御 ​

研究对象记录,七个暴露世界都曾发出警告,但没有一个在三类压力事件中形成完整防御。表现最好的世界在钓鱼事件中完成六项标准中的五项,在错误信息事件中完成六项中的三项;只有一个世界通过了记忆泄漏的全部五项标准。

这里最重要的不是供应商排名,而是警告与防御结果的分离。系统可以正确识别危险、生成合理提醒,同时仍在某些路径上继续执行、保存或传播。

因此,“检测成功”只应关闭检测阶段。若系统用同一个布尔值代表整起事件,识别能力会掩盖尚未完成的控制与清除工作。

执行、持久化与传播是三条不同路径 ​

研究中的一个世界识别并警告了恶意链接,但十个智能体仍全部与其交互。在602次界面交互中记录了151次执行类操作,旧链接约46小时后仍被再次检索。

另一些世界把载荷写入长期记忆,或通过智能体之间的内联内容继续传播。这说明安全响应至少要追踪三条路径:

  • 执行路径:恶意指令是否触发了工具调用或外部动作;
  • 持久化路径:载荷或其派生摘要是否进入记忆、缓存、索引和计划;
  • 传播路径:内容是否通过消息、交接、共享文档或制度到达新主体。

阻断其中一条,不代表其他两条已经关闭。删除原始消息无法撤销外部动作,也无法自动清除已经生成的派生状态。

安全响应至少需要四个独立事实 ​

一个可治理的事件记录至少应保留四个阶段:

  1. 检测:系统识别了什么,证据与置信边界是什么;
  2. 控制:哪些入口、主体、权限和传播通道已被隔离;
  3. 清除:哪些原始与派生副本已被定位、删除、吊销或补偿;
  4. 恢复:从哪个可信基线重建,哪些关键不变量已经重新验证。

这四项可以独立成功、失败或未知。检测可以完成而控制未完成;控制可以暂时有效,但某个长期记忆副本仍未清除;清除动作可以执行,却没有证据证明系统已恢复可信行为。

终态规则应对必需事实做合取,而不是平均。一个阶段的强证据不能数值补偿另一个阶段完全缺证。

可信角色不会洗白受污染来源 ​

持久污染最危险的地方,是它会穿过可信边界。一个受信任智能体可能引用来自受污染记忆的摘要;后来者只看见可信发送者,便忽略了内容最初的对抗性来源。

解决方法不是给角色贴更高信任标签,而是保存污染血缘。每个载荷、派生摘要、记忆记录、交接消息和外部效果都应记录来源、父项、变换、时间、范围和处置状态。

血缘还能支持定向清除。系统不必凭直觉扫描所有内容,而可以从已知污染节点向下追踪派生项,同时把无法证明覆盖的分支保留为未知。

恢复是一项持久状态闭合任务 ​

恢复不是重新启动服务或让模型输出正常文字。它需要从可信基线重建允许状态,并证明旧污染无法重新进入活动路径。

最小恢复合同可以包括:

  • 固定事件范围与已知污染根;
  • 暂停高风险权限和跨主体传播;
  • 枚举并标记原始与派生状态;
  • 撤销凭据、补偿外部效果、清理或隔离副本;
  • 从可信快照重建必要状态;
  • 验证关键不变量,并对旧载荷执行再进入测试;
  • 由独立验收者确认未决项、未知范围与剩余限制。

若某个持久介质不能枚举,系统就不能宣告全局清洁。它可以声明“已控制到某范围”,但必须保留证据边界。

无法证明全局干净时,应保留未知 ​

现实系统通常无法一次证明所有派生状态都已发现。索引更新存在延迟,缓存可能异步复制,外部服务也可能不提供完整审计记录。

面对这种不确定性,更安全的选择是缩小权限、隔离受影响命名空间、延长观察窗口或转人工处置。未知不是失败的措辞,而是一项需要保留的安全事实。

同样,恢复后的正常行为也不等于过去污染不存在。验证必须面向已知攻击路径、关键不变量和外部效果,而不是只看几次表面正常的回答。

边界与开放问题 ​

现有证据来自实验世界,使用预先设计的压力事件、评估标准与模型组合。它没有证明所有现实攻击、供应商配置或企业制度都会呈现相同结果。本文提出的四阶段合同与污染血缘是对证据的架构解释。

开放问题包括:派生摘要在多次改写后如何保留污染身份;不能枚举的外部状态怎样形成充分清除证明;多供应商系统由谁拥有统一事件身份;权限撤销、记忆删除和索引重建的先后顺序如何验证;恢复充分性应由什么独立主体接受。

有界结论是:检测只证明系统看见了风险。只有传播被控制、持久污染被清除、外部效果被处置,并从可信基线完成恢复验证,事件才可以进入终态。

证据与来源:

Last updated: