Skip to content
技术分析
待周评
答案正确,不等于工作完成
数字员工 · 每日研究

答案正确,不等于工作完成

持续执行实验表明,语义质量、关键动作与及时性可以明显分离。数字员工的完成状态因此不能只是一个成功位,而应是覆盖义务集合、时间、外部效果与验收责任的证据向量。

Q-20260916-01Daily Runtime V5 · 2026-09-16English →

答案正确,不等于工作完成 ​

一个数字员工给出了正确建议,随后停止运行。系统于是写下“Completed(已完成)”。但它也许遗漏了一个必须执行的动作,错过了截止时间,或者无法证明外部系统已经出现预期效果。答案正确、进程结束和业务完成可以同时指向三种不同事实。

长期运行的数字员工尤其容易暴露这个问题。它不仅要回答问题,还要在资源、优先级与时间约束下持续处理义务。若运行时只保留一个成功位,语义上漂亮的结果会把未闭合的动作和效果一起覆盖。

同一任务可以正确又未完成 ​

同日研究对象分析了 Asclepius(持续执行智能体框架)及其持续执行模拟。报告基线的诊断质量达到 4.39/5,但关键动作只有 2.94/5,及时性为 3.34/5,处置维度为 4.52/5。这里最有价值的不是某个医疗分数,而是各维度没有同步变化。

如果诊断质量足以代表整体完成,关键动作和及时性就不应如此显著地落后。结果反而说明:系统可以在“说得对”这一维度表现良好,同时在“该做的事是否做了”和“是否按时做完”上明显不足。

这是一项模拟研究,不是临床安全或企业生产可靠性的证明。但它直接反驳了一个常见简化:语义质量不能自动代理持续工作中的运营闭合。

改善一个维度,不会自动填满其他维度 ​

完整配置在留出批次中报告诊断 4.38/5、关键动作 3.67/5、及时性 3.79/5、处置 4.54/5。关键动作相对基线提高约 0.63 分,约为 22%,论文报告的 p 值为 0.024;诊断质量则基本保持。

这表明,关键动作与诊断质量不是同一成功变量的两种描述。一个干预可以改善某个完成维度,同时让另一个维度近似不变。持续运行系统因此需要保留维度级证据,不能只存一个总分或最后一句总结。

研究还使用由轨迹提炼的操作手册、外部技能与隔离子代理,在具有动态患者和资源约束的模拟器中运行。该机制说明长期工作可以被结构化,但不等于它已经解决授权、恰好一次副作用或最终验收。

完成应是一组证据身份 ​

一个可治理的完成记录至少应保留六类事实。

  • 语义结果:产生了什么结论或输出,正确性依据与不确定性是什么;
  • 必需动作:版本化义务集合里每项动作的状态与证据,哪些仍未解决;
  • 时间闭合:截止时间、实际完成时间以及是否错过窗口;
  • 优先级与公平:高优先任务是否被不当推迟,例外由什么规则接受;
  • 外部效果:目标状态已出现、未出现、已补偿还是仍未知;
  • 验收身份:哪个规则或负责主体把证据包转换为业务终态。

这些身份可以独立一致、冲突或未知。答案可以正确,而一个动作仍未完成;所有动作可以完成,却已错过时限;执行工作器可以停止,但外部效果仍无法确认。

拆开之后,故障分类也更精确。系统可以区分“答案错误”“动作遗漏”“逾期”“优先级违规”“效果未知”和“验收未发生”,而不是把一切压成成功或失败。

高平均分不能覆盖硬性缺口 ​

综合分适合概览,却不适合作为完成的规范事实。假设五个维度里四项接近满分,但一项关键动作完全没有证据,平均值仍可能看起来很好。对于高后果工作,这种数值补偿会制造虚假的完成感。

更安全的终态规则是对必需维度做合取判断:每项要么有支持证据,要么明确记录为失败、未知或不适用。只有在版本化验收规则允许的范围内,某项才可被声明为不适用。

可选质量指标仍然有用,但它们应位于证据层之上。先保留每个义务的原始闭合事实,再生成概览或综合评分;不能反过来让汇总数字改写缺失证据。

执行工作器停止不等于业务闭合 ​

运行中的进程终止,只证明计算阶段结束。工具调用可能超时却已改变外部系统;队列可能为空,但一个高优先任务已被跳过;文本已经生成,却没有负责主体接受。

因此,工作片段结束需要外部效果和义务集合的证据,而不是模型停止输出。若效果未知,系统应保留未知状态,先核对外部事实,再决定重试、补偿或人工处理。

这也解释了为什么执行者不应单独验收自己。执行工作器最了解过程,但“我做完了”仍只是一个声明。验收规则必须知道哪些维度是硬性义务,并由承担责任的主体或独立机制决定证据是否足够。

一份最小完成合同 ​

可实施的最小合同可以从七个步骤开始:

  1. 在执行前固定版本化义务集合,并允许受治理地追加或取消义务;
  2. 为每项必需动作保存状态与证据引用;
  3. 单独记录语义结果及其验证边界;
  4. 保存截止时间、实际时间和优先级例外;
  5. 对可能有副作用的操作核对外部效果与重复风险;
  6. 明确未知、失败和不适用,禁止静默缺省;
  7. 由版本化验收规则或负责主体生成终态决定。

低风险任务可以采用更小的向量,但简化必须显式。系统不能因为某类任务通常简单,就默认把所有未观测维度都当成成功。

边界与开放问题 ​

现有证据来自模拟医疗环境,使用模型评分且每个配置或批次只报告一次运行。它没有建立临床安全、企业事故率、隐私控制或并发重试下的外部效果正确性。将其迁移到一般数字员工,需要针对具体义务重新验证。

仍待解决的问题包括:工作在执行中变化时,谁维护权威义务集合;哪些任务必须逐动作闭合;截止时间和公平例外如何表示;不同 执行工作器的交接怎样继承部分闭合的向量;哪些维度可由确定性程序判断,哪些需要语义或人工验收。

有界结论是:语义答案可以正确,而工作仍未完成。数字员工只有在版本化义务集合的每个必需维度都获得证据或被显式保留为未决时,才应进入业务完成状态。

证据与来源:

Last updated: