你看了一场跑步比赛,冠军很猛,于是花钱把他请进队里。
到了自己的训练场,他跑输了。你开始怀疑宣传视频剪过,教练开始怀疑预算批少了。大家争了半天,才发现原来那双鞋没跟着来,新鞋还磨脚。
这是个假想场景,却很适合用来读 Agent 榜单。截图里模型名字又大又亮,脚下那套运行框架,经常被缩成一行备注。等到接入自己的系统,备注突然成了主角。
10 月 1 日提交的预印本 Finding the Right Fit,把这个麻烦摆到了台面上。作者将模型和 harness 交叉组合,再换任务集比较。这里的 harness,可以理解成模型干活时用的整套运行安排:工具怎么调用,旧信息怎么保留,遇到错误如何继续。
最扎眼的一组结果来自 Terminal-Bench 4 的同一批 63 道非 H100 任务:在 OpenHands 下,Claude Opus 5 做成 36 道,GPT-6 Astra 做成 31 道;换到 PI,分别变成 19 道和 38 道。论文第 4.1 节报告了这次排名反转。
光看第一场,可以写“Claude 领先”;只截第二场,又能写“GPT 优势明显”。两句话各自有数据,删掉运行条件以后,却很容易被读成互相打架的模型结论。麻烦就出在那条被裁掉的备注里。
这值得让做选型的人稍微紧张一下。接一个新模型时,常见操作是保留现有工具、提示词和工作流,只替换模型名称。这样测出来的结果当然有用:它回答了这个模型放进现有系统能不能工作。但把结果写成模型的普遍能力排名,推论就跨大了。
鞋合不合脚,不能靠运动员名气判断。
作者仓库给出了更完整的试穿记录:四套可配置 harness 配五个模型,在三个任务集上形成 60 个条目,再加六个原生搭配参考,共 66 个配置结果。Claude Code 只与 Claude 配对,Codex 只与 GPT 配对,并没有把每个模型都塞进每套产品。
这张表里也没有一双包打天下的鞋。按作者报告,五个模型中有四个在不同任务集上换了最高分搭配;Kimi K3 则在三个任务集里都以 openJiuwen 得分最高。在这三个任务集里,最高分搭配保持一致的情况确实存在,不能把论文读成“所有排名都没意义”。它更像是在提醒:一个名次能带到多远,需要证据。
但这里还有一处容易滑倒。看到排名反转,就宣布“某个框架设计导致模型能力提升”,仍然跑得太快。
论文自己的局限性一节写得很清楚:每题只计一次运行,未测重复运行的波动;工具、设置与执行预算没有完全对齐,结果不能分离单个组件的因果作用。前面的数字是作者报告的配置表现,本文没有独立复现。
这两种比较都值得做,只是回答不同的问题。把整套系统搬来比赛,是在比较可用的组合;想知道到底哪项设计起作用,则需要把其他条件尽量固定,一次改变一个因素。跑鞋、场地、训练安排一起换了,成绩确实变好,也不能立刻把功劳全部记到鞋带上。
因此,这篇研究最有用的读法,并不是抄一份新排名替换旧排名。它给团队提了个更难糊弄的问题:你这次到底想选整套系统,还是想判断模型本身?
如果目标是替现有产品升级模型,保留生产环境的约束很合理。那份报告就该老实写“在我们这套配置下”。如果目标是挑一个新 Agent 产品,也该让候选方案用各自实际会部署的设置,再比较完整组合。为了追求表面统一,把某套系统赖以工作的东西拆掉,同样可能测偏。
真正需要控制变量的地方,是解释成败的时候。发现某组搭配差,先别急着给模型贴上“不会用工具”的标签。抽出失败任务,固定模型版本和题目,检查工具返回了什么、调用停在哪里,再针对可疑环节做对照。一个具体故障能否被某项改动稳定改变,比一段笼统的“智商退化”更能指导下一步。
论文里有个很具体的配对案例:Kimi 在同一道图像任务中遇到 GIMP 命令挂起。PI 那次调用没有设置超时,一直没把结果送回来;openJiuwen 则返回超时信号,让模型有机会诊断并继续。这里可以看到一种失败路径,但不能据此宣布“加超时就能解释全部分差”。配对轨迹数量有限,案例说明的机制,还需要专门对照去确认。
对产品团队而言,这个差别相当现实:一次没有得到反馈的失败,与看见错误仍处理不了,应该分开记录。两者最后都可能是零分,下一步该修的地方却未必相同。只保存成败标签,就把排查所需的信息提前扔掉了。
这些是从研究中延伸出的实验建议,不是论文已经替所有团队验证过的配方。
还有一个很实用的要求:选型报告最好同时保留两种视角。一张表记录最终交付的组合表现,另一份记录列出配置差异和逐题输赢。前者帮助决定用什么,后者避免以后换了版本、换了任务,还拿旧名次解释新问题。
最怕的恰恰是只剩一个总分。团队争论了两个小时谁更聪明,最后没人记得当时跑的工具版本。运动员的名字记得很牢,鞋丢哪儿了,没人负责。
当然,没必要因此要求每家公司重跑一个庞大矩阵。可以先从真正影响业务的任务出发,选少量有理由的搭配,在可承受的预算里重复运行,把波动和具体失败留下来。探索用过的题目,也别原样当作最后宣布胜出的全部依据。否则越调越合脚,可能只是越来越熟悉这一小段跑道。
这种做法未必会产出漂亮的“全球第一”海报,却能少制造一些很贵的误会:模型换了,运行方式没有跟上;任务换了,过去的优势不再适用;一次好运,被当成了稳定能力。
榜单可以继续看,冠军也值得关注。只是下次有人递来那张排名截图,别急着问冠军多少钱。
先把照片往下拉一点,看看他穿的什么鞋。
资料核对:2026 年 10 月 3 日。论文为 10 月 1 日提交的 v1 预印本,以上实验结果来自作者报告,不代表独立复现或上游官方榜单成绩。开篇为假想场景,选型与实验建议为本文分析;结论限于所述模型、配置和任务集,不能直接外推到其他版本或所有生产任务。

