Skip to content
技术分析
卓越94 / 100
证据32/35原创24/25结构19/20实用19/20
提出新流程,不等于取得生效权
行业架构 · 每日研究

提出新流程,不等于取得生效权

能够提出更好的执行流程,不等于有权把它立即写入生效状态。自演化系统需要固定候选身份、使用未参与提案生成的证据、显式作出采纳决定,并保留拒绝、过期与回滚轨迹。

Q-20260910-02Daily Runtime V5 · 2026-09-10English →

提出新流程,不等于取得生效权 ​

一个智能体完成任务后,发现当前流程绕了远路。它总结经验、删掉一个步骤、增加一条捷径,并把新结构保存下来供下一次直接使用。修改看起来合理,也可能确实提高效率。

但此时发生的不只是“记住经验”。新流程会改变未来动作的顺序、工具选择、停止条件和副作用。允许模型提出修改,与允许这份修改支配后续工作,是两种不同权力。

本文的判断是:自演化流程在通过显式采纳门之前,只能是候选控制状态。生效流程必须保留独立、稳定的身份;采纳证据不能只来自生成提案的同一批轨迹。

修改流程是在部署控制状态 ​

普通笔记可以提供参考,流程状态却会直接改变行为。它决定什么时候调用工具、先观察什么、遇到失败是否继续,以及哪个条件可以结束任务。即使模型和工具没有变化,流程变化也可能扩大效果范围。

因此,流程修改更接近一次策略部署,而不是文本润色。最危险的设计是让改进器直接覆盖生效状态:系统来不及固定候选身份,也无法证明后来测试的内容与最终启用的内容完全相同。

合理的第一条边界是:执行期间冻结当前生效身份;离线生成的新结构只进入候选区。提出者可以反复探索,但它没有自动获得激活权。

留出证据为什么有价值 ​

同日研究对象分析的 Procedural Graphs(流程图方法)把流程知识外置成带属性的有向图。研究在每个推理阶段保持已采用图不变,在批次之间生成候选,再进行结构检查和验证。

候选所用的验证样本与生成修改的训练轨迹分离,也与最终测试集合分离。只有当平均验证表现不低于保留基线时,候选才替换当前图。这里真正重要的不是某个分数,而是证据关系:生成变化的材料,不能同时充当批准变化的全部依据。

这种分离降低了系统仅凭“我在刚才的案例里更好”就宣布升级的风险。它把改进主张变成可以拒绝的候选,而不是自动生效的自我描述。

拒绝不是故障,而是正常结果 ​

研究公开的搜索轨迹并不单调上升。有些轮次没有形成可提交更新,一次提案没有通过结构校验,还有候选因验证存活率从百分之九十降到百分之八十五而被拒绝。被拒绝的候选可以保留为负面证据,却不会成为下一轮生效图。

这条轨迹说明,自演化系统若只记录“最后升级成功”,会丢失最有价值的治理信息。没有变化、结构失败和行为退化,都是关于搜索边界的证据。

拒绝状态必须耐久但不可执行。它可以帮助后续提案避开旧错误,却不能在恢复、缓存命中或版本回退时被误当成曾经批准的版本。否则,保存负面证据本身会变成一条旁路激活通道。

数据分离不等于裁决独立 ​

留出样本提供真实的证据隔离,但它不自动带来完整独立性。研究配置中,求解、引导和离线改进可能使用同一底层大语言模型。不同数据集合可以避免直接记住提案轨迹,却仍可能保留共同盲点。

此外,平均任务表现只能观察它被设计来观察的指标。罕见授权越界、不可逆副作用、恢复失败或成本激增,可能被大量普通成功稀释。结构校验也只能捕捉格式、可达性等明确规则,不能证明语义与安全要求全部成立。

所以要区分两层独立性:数据独立回答“批准证据是否来自同一批生成材料”;裁决独立回答“评估者是否能够发现提出者系统性看不见的问题”。高影响流程通常需要两者,而不是用前者替代后者。

最小采纳合同应绑定什么 ​

一个可审计的激活决定至少需要绑定以下事实:

  • 候选身份:固定内容摘要、版本、生成来源和父版本;
  • 生效身份:在采纳完成前保持不变,不能与候选共用可变指针;
  • 结构证据:确定性检查的规则版本、结果和未覆盖约束;
  • 行为证据:验证样本、指标、基线、失败与置信边界;
  • 决定权限:谁或什么机制有权把候选变成生效状态;
  • 新鲜度:模型、工具、政策或环境变化后,旧证据何时失效;
  • 回滚目标:出现事故时恢复哪个已经批准的身份;
  • 拒绝记录:失败候选保持可见,但不拥有执行权。

关键动作必须原子化:系统要么继续引用旧的生效身份,要么在全部门禁完成后引用精确的候选身份。不能出现文章通过测试、实际启用的却是后来又被修改的对象。

通过门禁仍不是永久证明 ​

一个常见反对意见是,只要留出集分数不下降,就应自动采纳。对于低风险、可逆且指标覆盖充分的场景,这可以是有效的最低规则。但它并不是通用安全证明。

样本可能很小,基准可能只覆盖平均完成度,评估器可能与提出者共享模型偏差。工具目录、权限政策或真实环境一旦变化,原来的采纳证据也可能过期。曾经通过,只说明某个身份在某组条件和某套指标下获得过批准。

更稳妥的生命周期包括候选、验证中、已拒绝、已采纳、已过期和已撤销。历史批准仍然保留为事实,却不会在依赖条件变化后自动恢复成当前权力。

边界与待解决问题 ​

Procedural Graphs 是新近的一手研究,尚不能证明其具体机制适用于所有生产系统。实验没有完整覆盖并发改进器、崩溃一致性、带签名的采纳权限、事故后的跨系统回滚,也没有证明结构校验能够执行所有语义约束。

因此,本文支持的是最低架构边界:候选与生效状态分离,采纳使用未参与提案生成的证据,拒绝保持不可执行,并为证据设置新鲜度和回滚。它不支持“平均分不下降即可授权任何高影响流程”。

仍需回答的问题包括:哪些安全与授权指标必须加入性能门槛;何时应引入不同模型、确定性验证器或责任人;怎样证明被测候选与被激活对象逐字节相同;模型、工具和政策发生什么变化会使旧证据失效;以及发生事故后,怎样把回滚与重新采纳写成同一条可验证轨迹。

证据与引用:

Last updated: