
任务完成,不等于团队可靠
三名 Agent(智能体)最终交出一份正确报告。看终稿,团队成功了;看执行过程,两名 Agent 重复研究同一来源,另一名在前置证据完成前开始综合,最后一次交接还靠人工补救。
终态没有错,但协调并不可靠。总体成功只能说明目标最终到达,不能证明分配、顺序、互斥和交接都满足了各自的运行义务。
四种协调不是同一种能力
同日研究对象分析了 CoCoBench(多智能体协调能力基准)的一手研究。该基准构造 897 个经 Oracle(判定器)验证的可执行任务,比较 11 个多模态模型,并把 Coordination(协调)拆成四类:
- 任务分配:待办工作是否有清晰所有者,是否发生无意义重复;
- 顺序约束:依赖动作是否在前置条件满足后执行;
- 互斥安全:共享且排他的资源是否被串行使用;
- 交接连续性:生产者的状态是否完整移交并由接收者接受。
它们不是同一能力的四个名称。重复分配主要浪费容量;顺序违例可能使下游结果失效;互斥失败可能破坏共享状态;交接失败会让责任悬空。相同的终态成功率无法表达这些差异。
研究报告模型表现具有明显的 Construct-specific(按结构区分)特征。团队可能擅长分工,却不擅长互斥;也可能最终完成任务,却在交接上效率很低。
正确结果也能来自错误轨迹
终态评分有一个根本盲点:它只检查“有没有到达”,而不检查“怎样到达”。
一个团队可能先违反顺序,再靠重做得到正确结果;可能同时争用共享资源,但恰好没有触发可见损坏;可能丢失一次交接,却由另一个 Agent 偶然补上。若只看最终文件,这些运行时风险都会消失。
这并不意味着终态成功没有价值。它仍是结果事实,也是用户最直接关心的输出。问题在于把它扩大成可靠性证明。一次正确结果无法说明同一协议在更大团队、更高并发或不可逆业务动作上仍安全。
CoCoBench 的可执行环境和判定结构让轨迹约束可以被检查,这比只依赖自然语言自评更具体。但它研究的是家庭任务与高层技能接口,不能直接给软件工程或企业团队设定量化阈值。
可靠性必须保留为向量
更诚实的表示不是一个 team_reliability=0.84,而是一组独立状态:
[allocation, ordering, exclusion, handoff]
每一项至少记录 PASS(通过)、FAIL(失败)或 UNKNOWN(未知)。对于当前任务不适用的结构,应显式标为不适用,而不是默认为通过。总体指标可以作为摘要,但必须保留原始向量与关键性规则。
关键性尤其重要。若支付任务的互斥安全失败,优秀的分配表现不能将其平均掉;若医疗交接状态未知,较高的终态成功率也不能代替接收确认。平均值适合排序,不适合覆盖安全门禁。
四份可检查的协调合同
运行时可以把四种协调变成可审计合同。
分配合同记录工作单元、所有者、租约、重复策略,以及重新分配或放弃事件。它回答“谁在什么时候负责什么”。
顺序合同记录前置图、依赖关闭证据、实际开始与完成事件,以及违例后的恢复决定。它回答“这一步是否获得了合法的开始条件”。
互斥合同记录排他资源、持有者、获取、续约与释放事件,并检测并发访问。它回答“共享状态是否只由一个被授权主体占用”。
交接合同记录生产者、接收者、载荷或状态身份、交接提议、接收确认、超时与拒绝路径。发送完成不等于接收完成;交接必须有接收方的事实。
这些记录的价值不在于制造更多日志,而在于让失败可以归属于一种协议义务。只有知道是哪一项合同失败,恢复策略才有边界。
哪些规则可以机械执行
当事实完整可见时,一些协调义务可以 Deterministic(确定性)执行。例如,同一仓库路径只能由一个租约持有者修改;后置任务必须等待前置任务的可验证终态;同一支付键只能存在一个活跃发生。
另一些义务包含语义判断。接收者可以确认收到文件,却未必能确认内容足以继续工作;所有权可以被记录,却未必分配给了真正具备能力的 Agent。此时模型或人工判断仍有位置。
关键是不要混淆证据身份。机械事件证明“锁没有同时被两人持有”,语义评审判断“交接内容足够”,最终结果证明“目标已到达”。三者可以共同支持可靠性,但不能互相替代。
不要让平均值藏住关键弱项
研究还报告,团队规模增大时协调质量下降;集中状态汇总具有帮助;简单通信只能部分弥合差距。这说明“多说几句”并不是完整协调协议。
集中视图可以改善共享事实,却不会自动执行互斥;通信可以提醒依赖,却不保证顺序;更强模型也不必然消除所有结构的弱点。协调设计需要明确哪些约束由状态机、锁、租约或调度器承担,哪些问题留给生成式判断。
一个实用接受规则是:先列出任务相关的关键协调结构,逐项取证;任何关键项为 FAIL 时拒绝可靠性声明,为 UNKNOWN 时停止或补证。总体成功只在这些门禁之后作为结果摘要。
边界与未决问题
当前研究没有证明家庭任务中的绝对分数可以迁移到企业系统,也没有规定每类违例应当重试、补偿还是终止。四种结构也未必穷尽所有领域,例如授权更新、并发版本冲突和跨组织责任可能需要额外维度。
但结构性结论成立:任务完成是一项结果事实,团队可靠性则是一组协调合同的证据。只要某个关键义务具有不同的失败语义,就不能让它消失在一个总体数字里。
未决问题包括:最小事件模型是什么;不同风险任务怎样选择关键结构;UNKNOWN 应怎样影响终态;团队规模扩大时应如何提高门槛;不同领域的协调向量是否可以比较。
证据与来源:
- CoCoBench:多智能体协调能力基准,一手研究,2026。