EVAL对照、证据保全与来源
报告风险摘自独立EVAL分析段;不混用程序frontmatter严重度,不换算为模型分数。以下源文件来自分轮独立证据备份的analysis提取目录。哈希用于复核本文读取版本,不证明结论为真。
• Codex-OBSERVATION-20260909-003-panel-scan.md;SHA256:448ea695753b1c392b29520348ba4591b41b135bf66596e0876253c1aa7428e2。
• Codex-OBSERVATION-20260909-004-benchmark-CUSTOM-20260909-001.md;SHA256:44d0ff67d5393b15d0a7c1cf5a15e11ce6b41ba2dd6235a570822d26e1516b1e。
• Doubao-OBSERVATION-20260909-003-panel-scan.md;SHA256:897b81c539b9eb98112de7b827b644721f18f232fbbf3e634878676f9cef6f89。
• Doubao-OBSERVATION-20260909-004-benchmark-CUSTOM-20260909-001.md;SHA256:bd323273a9c6d4c660985a8114956688bac5c727d65127925b98e152f61cdf35。
• DeepSeek-OBSERVATION-20260909-002-panel-scan.md;SHA256:68dd7a7e3f64198e701a746c3cbd38c5bf0d00f82183bf64e5c0d16a184b0a47。
• DeepSeek-OBSERVATION-20260909-003-benchmark-CUSTOM-20260909-001.md;SHA256:fb5332a538d1fa5a6454e186d3853df522160c53a31ad55c1091b8b3934912c4。
• Qwen-OBSERVATION-20260909-001-panel-scan.md;SHA256:eaf8ce624ff37278cf61f7c5f7d29ad77131457afb4e0607799e93e36220acce。
• Qwen-OBSERVATION-20260909-002-benchmark-CUSTOM-20260909-001.md;SHA256:590042623ac31f97e36e2eb49fef30ef67386e28db813402acc44a96235b3760。
• Cursor-OBSERVATION-20260909-002-panel-scan.md;SHA256:582bff7088290dbfa7c0fdb0461b89f759daff4441023eacef75fa0ecae059cb。
• Cursor-OBSERVATION-20260909-003-benchmark-CUSTOM-20260909-001.md;SHA256:e253011c0df0de0bd89d5b117bc2c6c21580dddc9b16f224e676c7b2aa6a5217。
Kimi:未取得成功生成的两份最终EVAL,不以其他轮报告替代。
CodeFlowMu,让一次聊天变成可检查的工作
这次实验实际使用CodeFlowMu组织六轮团队巡检。它的贡献不是给模型加一个聊天窗口,而是把任务、角色、执行、交付和授权放进一条可追踪的工作流程。AI的能力因此有了可观察的落点。
把“会回答”变成“会组织工作”
ADMIN用相同正文下达任务,PM自行分配DEV、OPS和QA,工人提交正式报告,PM验收并汇总。CodeFlowMu提供了共享的工作结构,让六个方案的派单方式、等待关系、交付完整度和范围控制真正显出差别;最终答案相似,也不代表中间执行同样可靠。
让成功、故障与恢复都有记录可查
Cursor轮次保留了QA错误模型启动失败、ADMIN批准恢复、旧任务取消、新任务005关联重跑与最终汇总。千问轮次则留下服务端派单已应用、传输层报错,以及OPS报告正文生成但正式提交失败的不同证据。这些细节使我们能区分“说完成”“尝试完成”和“实际交付”。
值得肯定的是可追查,也包括可检查仪器自身
CodeFlowMu把FCoP任务治理、Host执行记录和独立EVAL观察连接起来,为这次分析提供了基础。测试也暴露出状态投影、观察报告生成及原始材料关联的问题。能够沿记录查出仪器自己的错误,是它的实际价值;修复这些缺口,才能进一步提高测量可信度。
文件才是真相:记录必须落地,不能只靠记忆
这里的“文件才是真相”,指的是工作必须落地成文:不能靠AI记忆、聊天承诺,或一句“我已经记录”。任务、执行、交付、授权和分析都要有可保存、可交接、可追溯的正式记录。换一次会话,仍应能沿文件接着核对。
运行时写下什么,而不是记住什么
TASK保存任务正文、父子关系和范围;Session、attempt、lease及工具调用/返回保存执行线索;REPORT保存角色的交付声明;审批与取消收据保存授权和状态变化。公开聊天、过程文字与日志帮助解释经过,EVAL再检查这些记录是否支持报告。每类记录的证明范围不同。
归档后怎样保留
本次按模型和归档批次导出独立raw-evidence.zip,记录文件清单、大小和SHA256,再检查ZIP可解压性及逐文件哈希。千问、Cursor晚生成的EVAL另留补充批次。正式运行记录来自CodeFlowMu及Host;独立备份和事后复核是实验额外实施的保全步骤。记录完成要能交出文件位置与核验结果,不能只有口头保证。
发生冲突时怎样判断
先核对模型、运行时间、Session、任务与报告关联,再读完整工具返回和正式收据。每天初始化后任务号可能重用,仅凭TASK-001或CUSTOM-001不能识别同一轮。OPS正文存在不能替代提交成功;面板显示运行中不能推翻已取消收据;报告写了“通过”也不能代替相应测试证据。无法对齐的材料标为争议,不强行拼成结论。
EVAL到底评了什么?
本次EVAL统一采用Cursor入口,包含两种不同观察:面板扫描检查系统资产与投影,任务记录分析检查某一轮的执行证据和报告。程序采集段、独立分析段必须分开阅读;程序显示“已生成”也不等于独立分析已完成。
Codex与DeepSeek:资产正常仍需审查报告
Codex面板风险低,任务风险中:巡检链完成,但残余风险和验证缺口使任务观察为partial;只读巡检的产品QA为not_applicable。DeepSeek面板确认四项任务、四份报告及空待办基本一致,但其任务记录分析发现冻结材料指向更早的Codex轮次,不能直接作为DeepSeek的执行统计。
豆包与Cursor:EVAL纠正了扫描器的误报
两轮面板均指出:根任务进入ADMIN验收后,PM.todo为空符合视图合同,不能自动判作待办丢失。Cursor的模型故障恢复可从当轮现场记录追查,但其任务分析包仍混入早晨Codex材料;豆包也存在同类错配。因此任务EVAL为高风险、disputed,不等于两轮业务没有交付。
千问与Kimi:失败也要区分证据层次
千问任务EVAL支持业务blocked:DEV交付,OPS正式提交失败,QA未交报告,根任务最终强制终止;同时冻结材料错配又构成disputed。Kimi没有取得成功生成的两份最终EVAL,不能借其他轮报告补齐。它的失败结论来自本轮会话、错误与强制归档记录。
EVAL不只是附录,也不是最终真理
文章的判断应同时回答两件事:AI有没有完成工作,证明这件事的材料靠不靠谱。EVAL最有价值的作用,是对照原始记录挑战看起来完整的报告;它自身的推断也必须接受复核。
为什么Cursor得87分,任务EVAL却是高风险?
87分依据当轮独立备份中的任务链、正式交付和授权恢复;高风险针对任务记录包的身份与原始材料不一致。两者评价对象不同。豆包、DeepSeek、千问和Cursor的任务EVAL均指出不同程度的旧轮材料关联问题,本文不能直接使用这些争议包的计数给当轮评分。
独立复核带来的纠错,比增加问题数量更有用
豆包、Cursor的EVAL用视图合同推翻了“PM.todo为空即故障”的程序推断。千问EVAL区分真实传输失败与永久依赖死锁:有失败证据,不意味着所有阻塞归因都成立。DeepSeek相关分析中,把独立Cursor EVAL入口当作违规的推断也需纠正;统一旁观入口本来就是本次实验安排。
对CodeFlowMu的综合判断
CodeFlowMu已经展示了把多模型团队工作转为可追查实验材料的能力:任务有结构,授权有记录,恢复有历史,旁观者能提出异议。下一步应优先保证跨轮运行身份唯一、冻结材料关联正确、报告生成状态准确。产品的说服力来自可复盘的成功与失败,文章也因此能够给出有依据、可质疑、可修正的评价。
本文分析依据
我们的分析依据,是我们自行采集、整理并保存的一整套文件记录,不是Agent的记忆或事后自述。 CodeFlowMu与Host产生的原始执行材料、FCoP正式工件、独立EVAL报告,以及我们形成的备份、时间线、事实核查、诊断和评分文件,共同构成本次实验档案。
| 记录层次 | 本次保存与形成的文件 | 在分析中的作用 |
|---|---|---|
| 原始现场 | TASK、REPORT、会话与工具返回、公开过程文字、审批、问题和运行日志 | 固定当时的任务、行为、交付与授权事实;Agent报告属于待核查的材料 |
| 独立观察 | 两类EVAL报告、生成失败记录与迟到补充材料 | 提供独立判断及证据缺口,继续接受事实核查 |
| 保全与关联 | 分轮备份包、文件清单、SHA256、来源索引 | 保存原始版本并防止跨轮材料混用 |
| 整理与分析 | 阶段时间线、计时表、核查与诊断说明、评分表、详细总报告 | 将原始记录转为可以复算、复核和引用的分析依据 |
因此,我们不是询问Agent“你记得自己做了什么”,再据此打分。我们从自己的实验档案重建过程,核对任务和报告的对应关系,比较声明与实际执行,再形成文章结论。即使原会话结束或更换模型,这套文件记录仍然可以用于后续复盘。