Runtime、Workflow、Recovery、Tool、Skill、Observability 与 Governance 工程机制。
两道题只答对一道,评分器却给了 100%。从真实开源评分程序和公开标注出发,我们检查:帮助 AI 团队找错的工具,自己会不会先看错?
一枚合成 token、三种传递方式和一个进程观察面,说明密钥的来源与它后来经过的通道是两回事。
从微软运行时治理与 OpenAI 的真实修复出发,讨论多 Agent 交接中的依据、责任与授权,以及 FCoP 为什么选择文件承载协作协议。
我们把 OpenAI Agents Python v0.22.2 与 v0.22.3 放进同一组实验:默认值、类型转换和 validator 会不会让审批对象与执行对象分离?
允许写入的目录为空,程序却返回允许。三组原程序实验追问:规则从文档走到配置、触发和历史恢复时,是否仍是同一个意思?
备份列表满了,不代表历史还在。我们用原始合并程序对照发现,重复保存同一个版本,会把真正能恢复的旧版本挤出去。
请求可能已经成功,只是回复丢了。真实文件实验显示,安全重试有时返回原结果,有时必须承认不知道;这两种行为都在避免重复动作。
服务已经说清恢复时间,程序却可能只记住“这一轮失败了”。我们对照同一段错误文本,检查它怎样从普通失败变成等待额度恢复。
对话需要记忆,启动它的密钥却不一定需要。真实临时文件的对照还发现:恢复时用上了新值,不代表旧文件里的旧值已经消失。
你从 A 切到 B,又回到 A。第一次访问的请求这时才返回,它还应该更新眼前的内容吗?一个控制返回顺序的实验,说明同名工作区为何不够。