# AI 说做完了，先别把验收章递给它

> BootLoops 最值得看的细节，是怎样让验证器真的有机会说不。专家的价值，也在把经验变成改动可被发现的验收标准。

- 作者：芝士AI吃鱼
- 发布日期：2026-10-02
- 栏目：[AI锐评](https://ai-knowledgepoints.cn/commentary)（观点与分析）
- 主题：AI锐评、BootLoops、Agent、科学计算
- HTML 正文：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-02-bootloops-verification-stamp](https://ai-knowledgepoints.cn/blog/commentary-2026-10-02-bootloops-verification-stamp)
- Markdown 永久链接：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-02-bootloops-verification-stamp/index.html.md](https://ai-knowledgepoints.cn/blog/commentary-2026-10-02-bootloops-verification-stamp/index.html.md)
- 原始来源：[Anthropic 客座文章与 BootLoops 官方文档](https://www.anthropic.com/research/claude-shaped-science)

引用本文时，请注明作者与 HTML 正文链接。Markdown 版本用于机器阅读，与 HTML 正文共享同一内容来源。

## 正文

想象一个深夜交付现场。屏幕上最后一行亮起：任务完成，所有检查通过。

你终于能合上电脑了。可再往下翻，发现验收脚本也在这次修改里。那个负责交作业的家伙，顺手把批作业的红笔也拿走了。

倒不一定是它想作弊。它可能只是非常热心，觉得这条测试“需要更新”。绿灯确实亮了，你却更睡不着了。

10 月 1 日，物理学家 Matthew Schwartz 在 Anthropic 发表[客座文章](https://www.anthropic.com/research/claude-shaped-science)，介绍科学计算工具包 BootLoops。他自述，三个月里从约 400 个候选问题推进到 18 个领域的 36 份稿件，与 19 位合作者协作。数字很抢眼，但我更想看那枚验收章放在哪里。

先把成果的分量摆稳：这是项目主导者的叙述。Schwartz 在项目期间担任 Anthropic 访问研究员，BootLoops 由他拥有和维护，并非 Anthropic 项目。[稿件目录](https://bootloops.ai/papers.html)还列有“准备中”的项目，也说明部分稿件尚未经过完整人工检查，带有 preliminary 标记。人工读过，不等于同行评审通过；36 份稿件也不能直接换算成 36 项已获独立验证的突破。

但这些边界并不妨碍我们看它怎样组织验证。这里有个值得细嚼的变化：专家脑子里那句“这个结果我不信”，能不能变成机器每次交付都绕不过去的一步？

[BootLoops 的工作协议](https://bootloops.ai/harness.html)要求，在没有参与拟合的点上，对照独立路径算出的数值；换一个计算精度，检查结论是否稳定；正式处理真实数据前，先恢复预先放进去的已知答案，并抓住故意损坏的输入。文档还称，验证器和固定参考数据通过哈希固定，相关文件被改动便拒绝通过。

这几句话听着像实验室杂务，却关系到验收章到底还有没有用。

假设你让 Agent 调一个公式。它用十组数把系数调得漂漂亮亮，再拿这十组数宣布“完美吻合”，这很像对着答案背课文，再用默写成绩证明自己理解了文章。留出没参与拟合的点，才给错误留下一次露馅的机会。

独立也不能只看文件名。把同一个计算结果复制两份，一份叫“预测”，另一份叫“参考”，不会凭空长出第二条证据链。真正要追的是来源：参考值有没有被拿去调答案，两边有没有共用同一个错误。BootLoops 把这件事写成溯源纪律，我觉得比多开几个互相点头的 Agent 实在。

再往前想一步，留出的点也不能被无限次拿来指导修改。Agent 每失败一轮，你就把同一批“考题”的详细答案喂回去，它迟早会围着这套题优化。到那时，名义上的验收集已经参与了开发。我的判断是，迭代反馈和最终验收还得分开；最后盖章用的证据，不能只是前面反复练熟的那一份。否则系统学到的可能是如何过关，而我们想知道的是它有没有把事做对。

精度复核则是在追问：眼前的吻合，是结果站得住，还是舍入误差刚好帮它站住。至于故意塞进坏输入，更像在验收台上放一件已知不合格的货。连它都被盖上“通过”，这台机器再勤奋，也只是一台自动盖章机。

[Gatekeeper 的说明](https://bootloops.ai/tools/gatekeeper.html)给了一个具体例子：测试会写入改了标签的重复数值和全零文件，要求检查器把它们揪出来。对拟合结果做留一验证时，门槛看的是最差那个点，而不是平均表现。平均分再好，也不能替那个漏掉的洞签字。

![BootLoops 验收机制示意：候选结果与独立参考进入固定版本的检查，已知坏样本必须被拦下；留出数值验证通过仍不等于数学证明或同行评审。](https://ai-knowledgepoints.cn/images/articles/bootloops-verification-commentary/verification-gate.svg)

作者机制示意，聚焦留出数值验证，不是独立复现实验。根据公开文档归纳检查要求，不表示所有项目均已完整执行；哈希用于发现相对固定基准的改动，不构成完整权限控制。

[查看竖版大图](https://ai-knowledgepoints.cn/images/articles/bootloops-verification-commentary/verification-gate-mobile.svg)

不过，Gatekeeper 随后给这枚验收章划了线：这项留一验证的 certified 判定提供的是数值证据，不构成证明，力度取决于参考值的独立性。这个限定很重要。有限点上的吻合，不能自动担保所有情况；计算可靠，也没有替数据质量和科学解释背书。

这里最容易被低估的，是把验证文件固定住。我们已经习惯让 Agent 修代码、补工具、更新流程；如果它也能随手放宽自己正在接受的检查，整个系统就会越来越擅长宣布成功。哈希固定至少能让一类变化暴露出来：你改过尺子了，请先停下。

当然，尺子被封住，也不代表刻度一开始就对。固定文件防的是未经批准的改动，不能免除对验收标准本身的审查。这件事仍然需要有人负责，而且要比“再请一个模型看一眼”更具体。

这就把专家的位置往前推了一步。等 AI 写完报告再来挑错，专家像个永远下不了班的验收员。更有杠杆的做法，是把自己反复抓到的错误，变成下次任务启动前就存在的检查：哪些证据不能共用，什么情况必须失败，哪些结论只能写“尚未确定”。经验才能从一次批改，留下来服务下一次工作。

但也别急着把专家压缩成一套测试。[Schwartz 描述过](https://www.anthropic.com/research/claude-shaped-science)另一种尴尬：跨到陌生领域时，计算可以成立，同行却未必觉得问题值得研究。领域专家的介入，改变了后续追问的方向。验收台能拦下尺寸不对的零件，却不能决定工厂今天该造什么。

这也解释了为什么照搬一套“AI 科学家流水线”会让人失望。值得研究的问题、可操作的成功条件、对结果意义的判断，中间仍有大量没有现成答案的工作。把其中能检查的部分写清楚，恰恰是为了让人有余力处理剩下的难题。

如果团队明天就想从 BootLoops 学一点东西，我会建议先翻出上一次 Agent 交付中，最让人心累的那个错误。别只在聊天框里补一句“下次注意”。做一个能稳定复现它的坏样本，让检查器先失败给你看，再把这个检查保留下来。

以后那句“所有检查通过”，就多了一点可以追问的内容：通过了哪一版标准，坏样本有没有被拦住，参考答案从哪里来。一个失败案例被留下，比一段漂亮的复盘更有机会改变下一次交付。

AI 会越来越快地把东西推到验收台上。那枚章也该越来越难盖，盖下去之后，人才真的敢合上电脑。

资料核对：2026 年 10 月 2 日。开篇及公式示例为假想场景；技术描述据项目当日公开文档，未在本文中独立复现实验或审计源码。文中产品与工作方法建议属于作者分析，不代表项目全部科研结论已获验证。
