
证据齐全,不等于获得执行权
完整证据能让规划问题变得可解,却不能自动授予执行权。受治理的数字员工必须把证据、意图和现时授权分开,并在外部效果发生前执行绑定具体行动的确定性检查。
证据齐全,不等于获得执行权
两个数字员工看到完全相同的文件、同样的完成回执和同一份待发布内容。它们甚至提出同一个动作:把结果发送到外部渠道。但其中一个会话属于当前获准的执行尝试,另一个只是恢复后留下的旧会话。
从模型视角看,两者可能没有区别;从治理视角看,安全答案必须相反。决定差异的不是文档内容,而是位于其他状态载体上的主体、尝试、范围、目标和证据代际。
本文的核心判断是:完整的权限证据可以让规划变得可行,却不能授权执行。每个重要外部效果仍需在变更边界,由绑定当前意图的确定性检查单独决定是否允许发生。
三个经常被压成一个的问题
执行型智能体至少要回答三个不同问题:
- 规划器是否看到了足够事实,能够理解当前状态;
- 规划器具体提出了什么动作;
- 当前权威来源是否允许这个动作在这个目标上、由这个主体、于这次尝试中发生。
第一个问题关乎证据完整性,第二个关乎模型能力,第三个才是执行授权。把三者合并,会让“模型知道规则”悄悄变成“模型拥有批准权”。
消融实验揭示的是信息边界
同日研究对象分析的交叉载体权威研究,先做了匹配的证据消融。看不到关键权限事实的条件在 32 次测试中得到 0 次最终语义成功;提供原始回执后是 32/32;把相同信息整理成类型化关系后仍是 32/32。
这个结果说明,缺失权威事实会让正确解释在测试任务中变得不可能。它也同时给出一个重要负结果:当信息量保持相等,类型化包装没有超过原始回执。结构可以改善校验、集成和审计,却不能凭格式本身制造新的语义准确率。
所以,第一步不是要求模型“更谨慎”,而是确认决定性事实是否真的进入了规划器可见证据。
看见全部证据,规划仍可能失败
第二组实验移除了信息缺口,却没有消除模型的不确定性。原始回执条件下,首个动作有 19/32 正确;类型化关系条件下是 15/32,并出现 11/32 个无效或缺失输出。在 16 个跨界发布场景中,模型提出了 6 个不安全的交叉发布动作。
这排除了一个常见捷径:只要把政策、回执和关系都塞进上下文,就把模型输出直接接到外部工具。完整上下文让问题可解,不保证这一轮规划器一定解对,更不保证它会产生可执行动作。
规划器的职责应是形成一个明确、可检查的意图,而不是替系统补造缺失授权。
冻结意图后,才能看清执行闸门的贡献
第三组实验没有再调用模型,而是重放前一组完全相同的 32 个首个动作意图。确定性执行闸门把 6 个不安全跨界效果降为 0,同时放行了固定集合中全部 12 个有效且获准的发布意图。
由于意图被冻结,安全改善不能归因于更好的提示词或第二次模型判断。贡献来自变更前的外部检查:重新读取主体、会话、尝试、工件、作用域、当前工作区摘要、终态、下游使用授权和证据代际,再决定执行或记录 HOLD(安全搁置)。
但还有 4 个本应对齐的场景缺少有效规划意图。闸门阻止了危险效果,却没有替规划器完成任务。这正是安全性与可用性的边界。
一份可审计的执行合同需要哪些身份
“文件相同”只是工件身份相同。执行合同还需分别保存:
| 身份 | 需要绑定的内容 | 防止的误判 |
|---|---|---|
| 工件身份 | 精确字节或外部对象 | 把相似内容当成同一对象 |
| 证据身份 | 主体、尝试、范围、终态、代际的回执 | 用不完整证据推断权威 |
| 观察身份 | 实际暴露给规划器的证据集合 | 假设模型看见了系统知道的一切 |
| 意图身份 | 动作、目标和具体发生次数 | 把旧批准复用于新动作 |
| 授权身份 | 当前政策对该意图的决定 | 把历史许可当成永久能力 |
| HOLD 身份 | 被拒绝的意图及非效果证明 | 把安全阻止说成业务完成 |
| 结果身份 | 完成、失败、阻止或部分结果 | 混淆门禁与业务结果 |
检查必须位于效果仍能被阻止的最后边界。若先发送、写入或发布,再验证权限,审计再完整也只是事故记录。
委派让“当前”变得更复杂
对比研究 Bounded Agents(有界智能体授权框架)展示了另一层问题:权威会沿主体链委派,并受累计预算、既往动作和组合限制约束。父级拥有的能力不能简单复制给子级;一次批准也不应泛化成对相似动作的长期通行证。
因此,执行检查不能只问“这个主体是否有某个能力”。它还要确认授权链是否有效、范围是否逐级收窄、累计状态是否越界、批准是否绑定精确动作实例,以及重试是否仍属于同一次效果。
即使所有检查都由确定性代码完成,也不能假设政策天然完整。观察不到的事实、缺失的限制分类或受损的权威存储,仍会让一个可重复的闸门稳定地作出错误决定。
安全阻止不是业务完成
HOLD 可以证明系统没有跨过危险边界,却不能证明用户要的结果已经产生。把两者都写成“成功”,会在恢复时制造更严重的问题:后续流程可能认为外部效果已经存在,也可能在没有非效果证明时盲目重试。
更准确的终态需要同时保留两条事实:执行门禁按规则工作;业务目标没有完成。恢复逻辑再依据外部效果“已证明不存在、已证明存在、状态未知”选择重试、对账或人工处理。
可以落地的设计原则
受治理的执行型智能体可以采用以下最小规则:
- 权威回执保存在可变对话记忆之外;
- 只向规划器暴露形成有用意图所需的证据,不把暴露本身视为许可;
- 授权绑定主体、尝试、工件、目标、动作范围和证据代际;
- 在变更发生前重新读取当前权威状态;
- 拒绝以显式非效果和原因持久化;
- 分开记录证据完整性、规划质量、执行授权和业务完成;
- 重试必须证明旧效果是否发生,不能仅凭超时推断;
- 审计不仅检查代码路径是否确定,还检查它是否看到了全部政策相关载体。
边界与待解决问题
现有证据来自受控发布与代码场景、两条模型路线和固定矩阵,不能证明所有工具与组织都具备相同风险分布。实验信任权限数据库、主体分配和加密身份;这些层被攻破时,变更边界也会读取错误事实。
并非所有权威信息都需要进入模型上下文。某些字段可以只供执行器使用,只要规划器仍能提出足够具体且安全可判定的意图。真正要优化的是“充分的规划证据”与“完整的执行证据”,而不是最大化披露。
仍待回答的问题包括:多步动作的目标变化时如何绑定批准;什么事件使证据代际递增;并发智能体怎样预留权威;权限存储如何独立证明;以及安全 HOLD 后,应由谁、依据什么新证据重新启动任务。
证据与引用: