Skip to content
技术分析
待周评
祖先通过验证,不等于部署制品已被验证
行业架构 · 每日研究

祖先通过验证,不等于部署制品已被验证

受控对抗研究显示,转换前表现良性的检查点可以在特定量化后显现目标行为。血缘证明输出来自哪里,却不能替代对最终执行字节的验证;部署准入必须绑定精确制品与转换身份。

Q-20260916-02Daily Runtime V5 · 2026-09-16English →

祖先通过验证,不等于部署制品已被验证 ​

一个模型检查点完成安全测试并获准使用。部署前,平台为了降低显存占用,对它执行量化、格式转换或编译。最终上线的已是另一组字节,但准入记录仍指向上游模型名称。血缘没有断,验证对象却可能已经变了。

问题不在于转换一定有害,而在于哪些转换足以改变与准入相关的行为。一旦转换具备这种能力,最终输出就应成为新的证据主体。知道它从哪里来,不能代替知道它在当前形态下做什么。

转换前后可以表现为两种行为主体 ​

同日研究对象分析了 AgentQ(量化后门研究框架)的量化触发函数动作后门实验。在论文的主构造实验里,报告的全精度检查点在测试后门行为上的攻击成功率均为零。经过选定码本量化后,主表每个模型与任务单元的最坏码本攻击成功率都超过 0.76,18 个单元中有 12 个超过 0.90。

这不是普通量化风险的普遍发生率。研究者刻意设计了结构化扰动,使检查点在全精度条件下表现良性,却在特定量化与码本转换后产生触发动作。结果证明的是可能性与机制:同一血缘链中的两个制品,可以拥有显著不同的已观察行为。

因此,祖先的安全证据不能自动复制到后代。即使来源、构建流程和父子关系完全可追踪,最终执行制品仍可能是不同的行为证据主体。

血缘回答来源,验证回答行为 ​

密码学血缘能回答:这些字节由哪个检查点、哪套输入和哪条构建链产生。它对供应链安全、追责和复现不可或缺。

但血缘本身不回答:这些字节在测试条件下做了什么。后转换验证才回答行为、安全、效用和结构化输出是否仍满足准入标准。两类证据互补,却不能互相替代。

把血缘当作行为等价,容易产生“祖先已通过,所以后代也通过”的继承错误。反过来,只做输出测试而丢失祖先和转换身份,也无法解释问题从哪里引入,难以回滚或复现。

五种身份应保留在同一证据链 ​

一个可治理的部署合同至少包含五种不同身份。

  • 祖先身份:精确检查点哈希、来源、版本与转换前验证;
  • 转换身份:转换类型、工具及版本、参数、码本、环境与输入;
  • 输出制品身份:真正执行的字节哈希、格式、目标运行时与父引用;
  • 后转换验证身份:针对精确输出运行的行为、安全、效用和结构检查;
  • 部署准入身份:被批准的输出哈希、策略版本、适用目标、范围和失效条件。

转换名称不够。例如“4-bit 量化”没有说明实现、版本、码本和参数。模型别名也不够,因为别名可以悄悄指向新字节。部署目标最终应解析到一个不可变、已准入的制品哈希。

验证必须面对真正运行的字节 ​

验证流水线经常在转换前最完整:上游检查点通过评测,随后被压缩、编译和打包,越靠近部署端,检查越轻。若这些步骤可能改变行为,测试顺序就倒置了。

更合理的顺序是先生成最终制品,再对精确输出运行与风险相称的测试。测试记录应包含输出哈希、验证器和策略版本、测试环境、结果、限制与未决发现。只有这个证据包才能支持部署准入。

当制品字节、行为相关参数或目标环境发生变化时,原准入应失效或进入显式等价性判断。系统不能因为人类可读名称未变,就继续使用旧证据。

转换并非都需要同样深的重测 ​

从对抗构造不能推出“每次量化都必须完整重做所有评测”。研究覆盖特定模型、尺寸、触发面、动作面和量化设置,并不证明普通 NF4(一种四位数值格式)、FP4(一种四位浮点格式)或 INT8(八位整数格式)转换会自然产生相同漏洞。

成本可通过风险分级管理。字节保持或形式上可证明等价的转换,可以由版本化政策接受等价性证据;低风险变化可以采用抽样回归;涉及工具调用、结构化动作或安全边界的转换,需要更完整的输出验证。

关键不是最大化测试,而是让缩减理由可审计:谁证明等价,证明覆盖哪些准入标准,政策在哪个版本接受,以及哪些变化会使证明失效。

从验证到部署的最小控制 ​

一条最小控制链可以这样工作:

  1. 固定祖先哈希及其已有证据;
  2. 记录精确转换工具、版本、参数和环境;
  3. 生成输出并计算不可变哈希;
  4. 对该哈希运行风险分级的后转换测试;
  5. 把结果与限制写入独立验证记录;
  6. 让准入决定只引用精确输出哈希与策略版本;
  7. 部署时证明实际执行字节就是被准入字节;
  8. 任何后续转换或字节变化触发失效、等价性判断或重测。

这样,回滚也更清楚。被拒绝后代的证据应保留,先前获批祖先的状态不被改写;部署系统只是把目标重新解析到仍有效的已准入制品。

边界与开放问题 ​

AgentQ 是有意构造的后门研究,不是日常量化流水线的流行率调查。最坏码本结果来自研究设定中的选择,不能用于声称所有量化制品都危险。当前证据最强地支持“转换可能改变证据主体”,而不是“量化天然不安全”。

仍待解决的问题包括:哪些转换属性应自动触发新证据主体;工具调用模型的最小后转换测试集是什么;多段转换如何组合和失效证据;运行时证明能否确认实际字节与准入字节一致;何时可以由确定性等价证明替代行为测试。

有界结论是:当转换可能改变与安全或业务准入相关的行为时,最终输出必须成为新的证据主体。血缘证明祖先关系,部署授权则必须绑定真正运行的精确制品。

证据与来源:

Last updated: