Skip to content
OBSERVATION NOTES

开源工程观察

Runtime、Workflow、Recovery、Tool、Skill、Observability 与 Governance 工程机制。

99篇观察笔记
观察笔记列表当前显示 99 篇,默认按日期倒序
01
每日观察实验报告待周评

AI 团队失败后,谁来检查“检查者”?

两道题只答对一道,评分器却给了 100%。从真实开源评分程序和公开标注出发,我们检查:帮助 AI 团队找错的工具,自己会不会先看错?

→
02
每日观察实验报告待周评

密钥放在环境变量里,为什么仍会出现在进程列表?

一枚合成 token、三种传递方式和一个进程观察面,说明密钥的来源与它后来经过的通道是两回事。

→
03
每日观察comparative-research待周评

当多 Agent 走向失控:2026 年,我们需要什么样的 Agent 治理?

从微软运行时治理与 OpenAI 的真实修复出发,讨论多 Agent 交接中的依据、责任与授权,以及 FCoP 为什么选择文件承载协作协议。

→
04
每日观察实验报告待周评

点了批准,程序执行的还是你看到的那些参数吗?

我们把 OpenAI Agents Python v0.22.2 与 v0.22.3 放进同一组实验:默认值、类型转换和 validator 会不会让审批对象与执行对象分离?

→
05
每日观察实验报告待周评

规则写好了,AI 为什么仍可能做出另一种选择?

允许写入的目录为空,程序却返回允许。三组原程序实验追问:规则从文档走到配置、触发和历史恢复时,是否仍是同一个意思?

→
06
每日观察实验报告待周评

备份越来越多,为什么反而找不回昨天?

备份列表满了,不代表历史还在。我们用原始合并程序对照发现,重复保存同一个版本,会把真正能恢复的旧版本挤出去。

→
07
每日观察实验报告待周评

没收到回复,再点一次会启动两个 AI 吗?

请求可能已经成功,只是回复丢了。真实文件实验显示,安全重试有时返回原结果,有时必须承认不知道;这两种行为都在避免重复动作。

→
08
每日观察实验报告待周评

额度已经耗尽,AI 为什么还在重试?

服务已经说清恢复时间,程序却可能只记住“这一轮失败了”。我们对照同一段错误文本,检查它怎样从普通失败变成等待额度恢复。

→
09
每日观察实验报告待周评

会话恢复了,旧密钥也该留下吗?

对话需要记忆,启动它的密钥却不一定需要。真实临时文件的对照还发现:恢复时用上了新值,不代表旧文件里的旧值已经消失。

→
10
每日观察实验报告待周评

切走再切回来,旧结果为什么还能冒出来?

你从 A 切到 B,又回到 A。第一次访问的请求这时才返回,它还应该更新眼前的内容吗?一个控制返回顺序的实验,说明同名工作区为何不够。

→