想象一个深夜交付现场。屏幕上最后一行亮起:任务完成,所有检查通过。
你终于能合上电脑了。可再往下翻,发现验收脚本也在这次修改里。那个负责交作业的家伙,顺手把批作业的红笔也拿走了。
倒不一定是它想作弊。它可能只是非常热心,觉得这条测试“需要更新”。绿灯确实亮了,你却更睡不着了。
10 月 1 日,物理学家 Matthew Schwartz 在 Anthropic 发表客座文章,介绍科学计算工具包 BootLoops。他自述,三个月里从约 400 个候选问题推进到 18 个领域的 36 份稿件,与 19 位合作者协作。数字很抢眼,但我更想看那枚验收章放在哪里。
先把成果的分量摆稳:这是项目主导者的叙述。Schwartz 在项目期间担任 Anthropic 访问研究员,BootLoops 由他拥有和维护,并非 Anthropic 项目。稿件目录还列有“准备中”的项目,也说明部分稿件尚未经过完整人工检查,带有 preliminary 标记。人工读过,不等于同行评审通过;36 份稿件也不能直接换算成 36 项已获独立验证的突破。
但这些边界并不妨碍我们看它怎样组织验证。这里有个值得细嚼的变化:专家脑子里那句“这个结果我不信”,能不能变成机器每次交付都绕不过去的一步?
BootLoops 的工作协议要求,在没有参与拟合的点上,对照独立路径算出的数值;换一个计算精度,检查结论是否稳定;正式处理真实数据前,先恢复预先放进去的已知答案,并抓住故意损坏的输入。文档还称,验证器和固定参考数据通过哈希固定,相关文件被改动便拒绝通过。
这几句话听着像实验室杂务,却关系到验收章到底还有没有用。
假设你让 Agent 调一个公式。它用十组数把系数调得漂漂亮亮,再拿这十组数宣布“完美吻合”,这很像对着答案背课文,再用默写成绩证明自己理解了文章。留出没参与拟合的点,才给错误留下一次露馅的机会。
独立也不能只看文件名。把同一个计算结果复制两份,一份叫“预测”,另一份叫“参考”,不会凭空长出第二条证据链。真正要追的是来源:参考值有没有被拿去调答案,两边有没有共用同一个错误。BootLoops 把这件事写成溯源纪律,我觉得比多开几个互相点头的 Agent 实在。
再往前想一步,留出的点也不能被无限次拿来指导修改。Agent 每失败一轮,你就把同一批“考题”的详细答案喂回去,它迟早会围着这套题优化。到那时,名义上的验收集已经参与了开发。我的判断是,迭代反馈和最终验收还得分开;最后盖章用的证据,不能只是前面反复练熟的那一份。否则系统学到的可能是如何过关,而我们想知道的是它有没有把事做对。
精度复核则是在追问:眼前的吻合,是结果站得住,还是舍入误差刚好帮它站住。至于故意塞进坏输入,更像在验收台上放一件已知不合格的货。连它都被盖上“通过”,这台机器再勤奋,也只是一台自动盖章机。
Gatekeeper 的说明给了一个具体例子:测试会写入改了标签的重复数值和全零文件,要求检查器把它们揪出来。对拟合结果做留一验证时,门槛看的是最差那个点,而不是平均表现。平均分再好,也不能替那个漏掉的洞签字。
不过,Gatekeeper 随后给这枚验收章划了线:这项留一验证的 certified 判定提供的是数值证据,不构成证明,力度取决于参考值的独立性。这个限定很重要。有限点上的吻合,不能自动担保所有情况;计算可靠,也没有替数据质量和科学解释背书。
这里最容易被低估的,是把验证文件固定住。我们已经习惯让 Agent 修代码、补工具、更新流程;如果它也能随手放宽自己正在接受的检查,整个系统就会越来越擅长宣布成功。哈希固定至少能让一类变化暴露出来:你改过尺子了,请先停下。
当然,尺子被封住,也不代表刻度一开始就对。固定文件防的是未经批准的改动,不能免除对验收标准本身的审查。这件事仍然需要有人负责,而且要比“再请一个模型看一眼”更具体。
这就把专家的位置往前推了一步。等 AI 写完报告再来挑错,专家像个永远下不了班的验收员。更有杠杆的做法,是把自己反复抓到的错误,变成下次任务启动前就存在的检查:哪些证据不能共用,什么情况必须失败,哪些结论只能写“尚未确定”。经验才能从一次批改,留下来服务下一次工作。
但也别急着把专家压缩成一套测试。Schwartz 描述过另一种尴尬:跨到陌生领域时,计算可以成立,同行却未必觉得问题值得研究。领域专家的介入,改变了后续追问的方向。验收台能拦下尺寸不对的零件,却不能决定工厂今天该造什么。
这也解释了为什么照搬一套“AI 科学家流水线”会让人失望。值得研究的问题、可操作的成功条件、对结果意义的判断,中间仍有大量没有现成答案的工作。把其中能检查的部分写清楚,恰恰是为了让人有余力处理剩下的难题。
如果团队明天就想从 BootLoops 学一点东西,我会建议先翻出上一次 Agent 交付中,最让人心累的那个错误。别只在聊天框里补一句“下次注意”。做一个能稳定复现它的坏样本,让检查器先失败给你看,再把这个检查保留下来。
以后那句“所有检查通过”,就多了一点可以追问的内容:通过了哪一版标准,坏样本有没有被拦住,参考答案从哪里来。一个失败案例被留下,比一段漂亮的复盘更有机会改变下一次交付。
AI 会越来越快地把东西推到验收台上。那枚章也该越来越难盖,盖下去之后,人才真的敢合上电脑。
资料核对:2026 年 10 月 2 日。开篇及公式示例为假想场景;技术描述据项目当日公开文档,未在本文中独立复现实验或审计源码。文中产品与工作方法建议属于作者分析,不代表项目全部科研结论已获验证。

