返回 AI锐评
AI锐评 · 行业变化#AI锐评#Agent#Harness#模型评测

模型排行榜,别把鞋藏起来

芝士AI吃鱼2026年10月3日8 分钟阅读阅读统计加载中

事实来源:Finding the Right Fit 预印本与作者仓库

你看了一场跑步比赛,冠军很猛,于是花钱把他请进队里。

到了自己的训练场,他跑输了。你开始怀疑宣传视频剪过,教练开始怀疑预算批少了。大家争了半天,才发现原来那双鞋没跟着来,新鞋还磨脚。

这是个假想场景,却很适合用来读 Agent 榜单。截图里模型名字又大又亮,脚下那套运行框架,经常被缩成一行备注。等到接入自己的系统,备注突然成了主角。

10 月 1 日提交的预印本 Finding the Right Fit,把这个麻烦摆到了台面上。作者将模型和 harness 交叉组合,再换任务集比较。这里的 harness,可以理解成模型干活时用的整套运行安排:工具怎么调用,旧信息怎么保留,遇到错误如何继续。

最扎眼的一组结果来自 Terminal-Bench 4 的同一批 63 道非 H100 任务:在 OpenHands 下,Claude Opus 5 做成 36 道,GPT-6 Astra 做成 31 道;换到 PI,分别变成 19 道和 38 道。论文第 4.1 节报告了这次排名反转。

光看第一场,可以写“Claude 领先”;只截第二场,又能写“GPT 优势明显”。两句话各自有数据,删掉运行条件以后,却很容易被读成互相打架的模型结论。麻烦就出在那条被裁掉的备注里。

这值得让做选型的人稍微紧张一下。接一个新模型时,常见操作是保留现有工具、提示词和工作流,只替换模型名称。这样测出来的结果当然有用:它回答了这个模型放进现有系统能不能工作。但把结果写成模型的普遍能力排名,推论就跨大了。

鞋合不合脚,不能靠运动员名气判断。

作者仓库给出了更完整的试穿记录:四套可配置 harness 配五个模型,在三个任务集上形成 60 个条目,再加六个原生搭配参考,共 66 个配置结果。Claude Code 只与 Claude 配对,Codex 只与 GPT 配对,并没有把每个模型都塞进每套产品。

这张表里也没有一双包打天下的鞋。按作者报告,五个模型中有四个在不同任务集上换了最高分搭配;Kimi K3 则在三个任务集里都以 openJiuwen 得分最高。在这三个任务集里,最高分搭配保持一致的情况确实存在,不能把论文读成“所有排名都没意义”。它更像是在提醒:一个名次能带到多远,需要证据。

作者报告的同63道Terminal-Bench 4非H100题:OpenHands下Claude Opus 5成功36题、GPT-6 Astra成功31题;PI下分别19题和38题。名次在这两个配置之间反转,每题只计一次,未测运行方差,非本文复现。
据论文第4.1节原创重绘。四条均从零起、满量程63题,仅说明该任务子集中的配置表现;设置未完全配平,不能归因到单个组件。作者报告,非本文复现。 查看大图 ↗

但这里还有一处容易滑倒。看到排名反转,就宣布“某个框架设计导致模型能力提升”,仍然跑得太快。

论文自己的局限性一节写得很清楚:每题只计一次运行,未测重复运行的波动;工具、设置与执行预算没有完全对齐,结果不能分离单个组件的因果作用。前面的数字是作者报告的配置表现,本文没有独立复现。

这两种比较都值得做,只是回答不同的问题。把整套系统搬来比赛,是在比较可用的组合;想知道到底哪项设计起作用,则需要把其他条件尽量固定,一次改变一个因素。跑鞋、场地、训练安排一起换了,成绩确实变好,也不能立刻把功劳全部记到鞋带上。

因此,这篇研究最有用的读法,并不是抄一份新排名替换旧排名。它给团队提了个更难糊弄的问题:你这次到底想选整套系统,还是想判断模型本身?

如果目标是替现有产品升级模型,保留生产环境的约束很合理。那份报告就该老实写“在我们这套配置下”。如果目标是挑一个新 Agent 产品,也该让候选方案用各自实际会部署的设置,再比较完整组合。为了追求表面统一,把某套系统赖以工作的东西拆掉,同样可能测偏。

真正需要控制变量的地方,是解释成败的时候。发现某组搭配差,先别急着给模型贴上“不会用工具”的标签。抽出失败任务,固定模型版本和题目,检查工具返回了什么、调用停在哪里,再针对可疑环节做对照。一个具体故障能否被某项改动稳定改变,比一段笼统的“智商退化”更能指导下一步。

论文里有个很具体的配对案例:Kimi 在同一道图像任务中遇到 GIMP 命令挂起。PI 那次调用没有设置超时,一直没把结果送回来;openJiuwen 则返回超时信号,让模型有机会诊断并继续。这里可以看到一种失败路径,但不能据此宣布“加超时就能解释全部分差”。配对轨迹数量有限,案例说明的机制,还需要专门对照去确认。

对产品团队而言,这个差别相当现实:一次没有得到反馈的失败,与看见错误仍处理不了,应该分开记录。两者最后都可能是零分,下一步该修的地方却未必相同。只保存成败标签,就把排查所需的信息提前扔掉了。

这些是从研究中延伸出的实验建议,不是论文已经替所有团队验证过的配方。

还有一个很实用的要求:选型报告最好同时保留两种视角。一张表记录最终交付的组合表现,另一份记录列出配置差异和逐题输赢。前者帮助决定用什么,后者避免以后换了版本、换了任务,还拿旧名次解释新问题。

最怕的恰恰是只剩一个总分。团队争论了两个小时谁更聪明,最后没人记得当时跑的工具版本。运动员的名字记得很牢,鞋丢哪儿了,没人负责。

当然,没必要因此要求每家公司重跑一个庞大矩阵。可以先从真正影响业务的任务出发,选少量有理由的搭配,在可承受的预算里重复运行,把波动和具体失败留下来。探索用过的题目,也别原样当作最后宣布胜出的全部依据。否则越调越合脚,可能只是越来越熟悉这一小段跑道。

这种做法未必会产出漂亮的“全球第一”海报,却能少制造一些很贵的误会:模型换了,运行方式没有跟上;任务换了,过去的优势不再适用;一次好运,被当成了稳定能力。

榜单可以继续看,冠军也值得关注。只是下次有人递来那张排名截图,别急着问冠军多少钱。

先把照片往下拉一点,看看他穿的什么鞋。

资料核对:2026 年 10 月 3 日。论文为 10 月 1 日提交的 v1 预印本,以上实验结果来自作者报告,不代表独立复现或上游官方榜单成绩。开篇为假想场景,选型与实验建议为本文分析;结论限于所述模型、配置和任务集,不能直接外推到其他版本或所有生产任务。

想继续拆解 Agent 的工程细节,可以看 AI 实践路线;公众号入口在关于页。

AI 实践

想把本文的问题继续做深一点?

知识星球里会继续整理相关案例、工程约束和问题讨论;具体内容以当前社区页面为准。

AI 实践知识星球加入海报,包含可扫描二维码
芝士AI吃鱼公众号二维码

关注「芝士AI吃鱼」公众号持续更新

在这里,我用「人话」和「漫画」拆解 AI 技术。公众号更新会同步整理到本站,方便继续阅读、检索和订阅。

点击二维码可放大,使用微信扫码关注。

芝士AI吃鱼

有出处的事实,有理由的判断。

更多锐评