# 模型排行榜，别把鞋藏起来

> 同一组模型、同一批题，换套 Agent 运行框架，领先者就可能反过来。Finding the Right Fit 提醒我们：榜单上的名次，得连同脚下那双鞋一起读。

- 作者：芝士AI吃鱼
- 发布日期：2026-10-03
- 栏目：[AI锐评](https://ai-knowledgepoints.cn/commentary)（观点与分析）
- 主题：AI锐评、Agent、Harness、模型评测
- HTML 正文：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-03-model-harness-fit](https://ai-knowledgepoints.cn/blog/commentary-2026-10-03-model-harness-fit)
- Markdown 永久链接：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-03-model-harness-fit/index.html.md](https://ai-knowledgepoints.cn/blog/commentary-2026-10-03-model-harness-fit/index.html.md)
- 原始来源：[Finding the Right Fit 预印本与作者仓库](https://arxiv.org/abs/2610.00917)

引用本文时，请注明作者与 HTML 正文链接。Markdown 版本用于机器阅读，与 HTML 正文共享同一内容来源。

## 正文

你看了一场跑步比赛，冠军很猛，于是花钱把他请进队里。

到了自己的训练场，他跑输了。你开始怀疑宣传视频剪过，教练开始怀疑预算批少了。大家争了半天，才发现原来那双鞋没跟着来，新鞋还磨脚。

这是个假想场景，却很适合用来读 Agent 榜单。截图里模型名字又大又亮，脚下那套运行框架，经常被缩成一行备注。等到接入自己的系统，备注突然成了主角。

10 月 1 日提交的预印本 [Finding the Right Fit](https://arxiv.org/abs/2610.00917)，把这个麻烦摆到了台面上。作者将模型和 harness 交叉组合，再换任务集比较。这里的 harness，可以理解成模型干活时用的整套运行安排：工具怎么调用，旧信息怎么保留，遇到错误如何继续。

最扎眼的一组结果来自 Terminal-Bench 4 的同一批 63 道非 H100 任务：在 OpenHands 下，Claude Opus 5 做成 36 道，GPT-6 Astra 做成 31 道；换到 PI，分别变成 19 道和 38 道。[论文第 4.1 节](https://arxiv.org/html/2610.00917v1#S4.SS1)报告了这次排名反转。

光看第一场，可以写“Claude 领先”；只截第二场，又能写“GPT 优势明显”。两句话各自有数据，删掉运行条件以后，却很容易被读成互相打架的模型结论。麻烦就出在那条被裁掉的备注里。

这值得让做选型的人稍微紧张一下。接一个新模型时，常见操作是保留现有工具、提示词和工作流，只替换模型名称。这样测出来的结果当然有用：它回答了这个模型放进现有系统能不能工作。但把结果写成模型的普遍能力排名，推论就跨大了。

鞋合不合脚，不能靠运动员名气判断。

[作者仓库](https://github.com/liyix/finding-the-right-fit)给出了更完整的试穿记录：四套可配置 harness 配五个模型，在三个任务集上形成 60 个条目，再加六个原生搭配参考，共 66 个配置结果。Claude Code 只与 Claude 配对，Codex 只与 GPT 配对，并没有把每个模型都塞进每套产品。

这张表里也没有一双包打天下的鞋。按作者报告，五个模型中有四个在不同任务集上换了最高分搭配；Kimi K3 则在三个任务集里都以 openJiuwen 得分最高。在这三个任务集里，最高分搭配保持一致的情况确实存在，不能把论文读成“所有排名都没意义”。它更像是在提醒：一个名次能带到多远，需要证据。

![作者报告的同63道Terminal-Bench 4非H100题：OpenHands下Claude Opus 5成功36题、GPT-6 Astra成功31题；PI下分别19题和38题。名次在这两个配置之间反转，每题只计一次，未测运行方差，非本文复现。](https://ai-knowledgepoints.cn/images/articles/harness-fit-commentary/ranking-reversal.svg)

据论文第4.1节原创重绘。四条均从零起、满量程63题，仅说明该任务子集中的配置表现；设置未完全配平，不能归因到单个组件。作者报告，非本文复现。

[查看竖版大图](https://ai-knowledgepoints.cn/images/articles/harness-fit-commentary/ranking-reversal-mobile.svg)

但这里还有一处容易滑倒。看到排名反转，就宣布“某个框架设计导致模型能力提升”，仍然跑得太快。

论文自己的[局限性一节](https://arxiv.org/html/2610.00917v1#S7)写得很清楚：每题只计一次运行，未测重复运行的波动；工具、设置与执行预算没有完全对齐，结果不能分离单个组件的因果作用。前面的数字是作者报告的配置表现，本文没有独立复现。

这两种比较都值得做，只是回答不同的问题。把整套系统搬来比赛，是在比较可用的组合；想知道到底哪项设计起作用，则需要把其他条件尽量固定，一次改变一个因素。跑鞋、场地、训练安排一起换了，成绩确实变好，也不能立刻把功劳全部记到鞋带上。

因此，这篇研究最有用的读法，并不是抄一份新排名替换旧排名。它给团队提了个更难糊弄的问题：你这次到底想选整套系统，还是想判断模型本身？

如果目标是替现有产品升级模型，保留生产环境的约束很合理。那份报告就该老实写“在我们这套配置下”。如果目标是挑一个新 Agent 产品，也该让候选方案用各自实际会部署的设置，再比较完整组合。为了追求表面统一，把某套系统赖以工作的东西拆掉，同样可能测偏。

真正需要控制变量的地方，是解释成败的时候。发现某组搭配差，先别急着给模型贴上“不会用工具”的标签。抽出失败任务，固定模型版本和题目，检查工具返回了什么、调用停在哪里，再针对可疑环节做对照。一个具体故障能否被某项改动稳定改变，比一段笼统的“智商退化”更能指导下一步。

论文里有个很具体的[配对案例](https://arxiv.org/html/2610.00917v1#S5.SS1)：Kimi 在同一道图像任务中遇到 GIMP 命令挂起。PI 那次调用没有设置超时，一直没把结果送回来；openJiuwen 则返回超时信号，让模型有机会诊断并继续。这里可以看到一种失败路径，但不能据此宣布“加超时就能解释全部分差”。配对轨迹数量有限，案例说明的机制，还需要专门对照去确认。

对产品团队而言，这个差别相当现实：一次没有得到反馈的失败，与看见错误仍处理不了，应该分开记录。两者最后都可能是零分，下一步该修的地方却未必相同。只保存成败标签，就把排查所需的信息提前扔掉了。

这些是从研究中延伸出的实验建议，不是论文已经替所有团队验证过的配方。

还有一个很实用的要求：选型报告最好同时保留两种视角。一张表记录最终交付的组合表现，另一份记录列出配置差异和逐题输赢。前者帮助决定用什么，后者避免以后换了版本、换了任务，还拿旧名次解释新问题。

最怕的恰恰是只剩一个总分。团队争论了两个小时谁更聪明，最后没人记得当时跑的工具版本。运动员的名字记得很牢，鞋丢哪儿了，没人负责。

当然，没必要因此要求每家公司重跑一个庞大矩阵。可以先从真正影响业务的任务出发，选少量有理由的搭配，在可承受的预算里重复运行，把波动和具体失败留下来。探索用过的题目，也别原样当作最后宣布胜出的全部依据。否则越调越合脚，可能只是越来越熟悉这一小段跑道。

这种做法未必会产出漂亮的“全球第一”海报，却能少制造一些很贵的误会：模型换了，运行方式没有跟上；任务换了，过去的优势不再适用；一次好运，被当成了稳定能力。

榜单可以继续看，冠军也值得关注。只是下次有人递来那张排名截图，别急着问冠军多少钱。

先把照片往下拉一点，看看他穿的什么鞋。

资料核对：2026 年 10 月 3 日。论文为 10 月 1 日提交的 v1 预印本，以上实验结果来自作者报告，不代表独立复现或上游官方榜单成绩。开篇为假想场景，选型与实验建议为本文分析；结论限于所述模型、配置和任务集，不能直接外推到其他版本或所有生产任务。

想继续拆解 Agent 的工程细节，可以看 [AI 实践路线](https://ai-knowledgepoints.cn/planet)；公众号入口在[关于页](https://ai-knowledgepoints.cn/about#wechat)。
