Skip to content
实验报告
待周评
AI 团队失败后,谁来检查“检查者”?
开源工程观察 · 实验研究

AI 团队失败后,谁来检查“检查者”?

两道题只答对一道,评分器却给了 100%。从真实开源评分程序和公开标注出发,我们检查:帮助 AI 团队找错的工具,自己会不会先看错?

2026-09-18English →

AI 团队失败后,谁来检查“检查者”? ​

两道题,一道答对,一道答错。评分器最后给了 100%。

这不是某个 AI 自信地胡说。我们用两个合成输入,运行了一个真实开源项目的命令行评分程序:其中一道题的正确步骤是 1,预测步骤是 10。程序检查“1 是否出现在 10 里面”,于是把它算对了。按整数相等判断,这组输入应该得 50%。

当我们希望另一个 AI 帮忙查清团队为什么失败时,首先要确认的,也许是检查工具如何理解“正确”。

为什么会读到这两个项目 ​

我们在研究多 Agent 治理:任务交给多个 AI 后,怎样知道问题发生在哪个环节,而不只看到一句“已经完成”。

Lakshya A. Agrawal 参与的 MAST 研究,为团队失败建立分类;Shaokun Zhang 等人的 Who&When,进一步尝试定位失败的参与者和关键步骤。一个帮助描述问题,一个帮助寻找位置,这正是工程审查需要的线索。

我们因此追到代码与公开数据,做了一轮有界复核。没有重新调用论文中的模型,而是先检查:标注如何解释,预测怎样计分,输出正确是否意味着过程也没有问题。

“1”和“10”的差别,评分器必须认真对待 ​

Who&When 的受测评分代码使用了字符串包含判断。这个关系有方向,所以我们没有只试一个例子。

正确步骤预测步骤原评分器整数精确匹配
11正确正确
110正确错误
101错误错误
210错误错误

随后,我们把一个误匹配题和一个正确题写成预测文件,经原命令行入口读取、解析和评分,得到开头的 100%。这一步确认差异不仅出现在直接调用函数时,也能穿过该评分入口。

相同两个合成输入在两种评分规则下得到不同分数

图 1:同一组两个合成样本,原程序计为 100%,整数相等计为 50%。来源:本轮 attribution-cli-control.json 与原入口对照实验;这不是原论文准确率重算。

这个问题已有研究者在 Issue #14 提出。本轮是在复核和补充控制实验,不是宣布首次发现,更不是推翻论文。

我们还检查了仓库的 184 条参考标注。在其中 22 条的历史长度范围内,能构造一个不同步骤编号,让它仍包含正确编号的数字。22 表示存在这样的输入组合,不表示模型真的犯了 22 次错误。 没有对应的原始预测,就不能知道论文成绩因此改变多少。

这恰好提醒我们:标签文件、预测文件和评分代码是三个不同的证据。少了任何一项,结论都可能走得太远。

分类编号相同,含义也可能不同 ​

MAST 的数据带来了另一种容易忽略的情况。

我们固定版本下载公开的人工标注文件,共 19 条记录。它保留了研究过程中的不同轮次:第一轮每条有 18 类,第二、三轮各有 17 类,最后一组有 14 类。每组记录数分别为 5、5、5、4。

这些不是可以直接叠在一起的同一张分类表。例如,编号 1.2 在早期轮次指推理与动作不一致,在最后一组却指违反角色职责。如果只按编号统计,就会把不同问题装进同一列。

上游 Issue #18 已指出分类版本问题,我们的固定版本数据检查与之相符。分类在研究中演进很正常;下游需要知道哪个版本被使用,以及旧标签能否可靠映射到新标签。

因此,本轮没有强行把这些数据转换为一张“多 Agent 最常见失败排行榜”。首先保留各版本,才能避免得到一个整齐却难以解释的数字。

答案正确,过程仍可能值得追问 ​

在仓库另一个明确限定的样本中,我们读取了 AG2 目录下 31 条直接以 human.json 结尾的记录。这些记录使用 22 项旧标签,不能与前面的 14 类直接混算。

原标注中,7 条指出没有尝试验证结果,19 条指出评估者缺乏批判检查。两类可能重叠,不能相加变成失败率。还有一条记录同时标记了答案正确、没有识别停止条件,以及忽略另一位 Agent 的建议。

对普通使用者来说,这种情况并不陌生:AI 已经解释清楚资料不足,另一个角色却继续要求它完成;最终回答未必错误,协作过程仍然浪费时间、失去停止依据。

这里没有重跑 Agent,也没有重新标注;它是对公开历史记录的复查。其价值在于让我们把两个问题分开问:答案是否正确?团队是否以可控、可解释的方式完成工作?

真正有用的检查,要允许别人检查 ​

失败分类和自动归因都很有价值。它们让“AI 不可靠”这种笼统感受,变成能够定位和讨论的问题。但在把评分交给决策者之前,至少应保留四样东西:数据版本、标签定义、原始预测和评分规则。

还有一个很便宜的动作:准备几道已知答案的控制题,故意包含相似编号、缺失预测和不同标签版本。先验证检查者会不会误判,再把它的结论用于更重要的工作。

下一步值得向研究者追问的是:能否把标签映射和精确匹配评分一起发布,使下游可以比较不同版本?对于实际使用者,我们也想知道:你是否遇过最终答案正确,但 AI 团队重复工作、不肯停下,或者没有验证过程的情况?记录下具体交接,比笼统地说“它失控了”更有帮助。

这轮实验支持的是检查证据链的方法,并不证明某一种治理协议已经解决了这些问题。

研究于 2026-09-17 完成。固定提交、数据哈希、脚本与完整限制见 实验报告。文中合成评分、公开标注复查和上游已有讨论已分别标明;没有复算论文完整成绩。

研究仓库

Last updated: