# 别让 AI 为了省房租，天天搬家

> 便宜模型接过长会话，可能先收到一张缓存重建账单。Jev 把选模型和推理强度交给路由器，也让一个问题更值得问：它替你省的是单价，还是做完这件事的钱？

- 作者：芝士AI吃鱼
- 发布日期：2026-10-01
- 栏目：[AI锐评](https://ai-knowledgepoints.cn/commentary)（观点与分析）
- 主题：AI锐评、模型路由、上下文工程、Agent
- HTML 正文：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-01-model-routing-moving-cost](https://ai-knowledgepoints.cn/blog/commentary-2026-10-01-model-routing-moving-cost)
- Markdown 永久链接：[https://ai-knowledgepoints.cn/blog/commentary-2026-10-01-model-routing-moving-cost/index.html.md](https://ai-knowledgepoints.cn/blog/commentary-2026-10-01-model-routing-moving-cost/index.html.md)
- 原始来源：[OpenRouter Jev Router 官方文档](https://openrouter.ai/docs/guides/routing/routers/jev-router)

引用本文时，请注明作者与 HTML 正文链接。Markdown 版本用于机器阅读，与 HTML 正文共享同一内容来源。

## 正文

想象一个特别会省钱的租房助手。

早上发现隔壁房租便宜，催你搬。下午找到更便宜的一间，又催你搬。床垫刚抬上楼，手机再震一下：恭喜，发现更优方案。

房租越来越低，人越来越想把它卸载。搬家师傅倒是挺支持这个产品。

给 AI 自动挑模型，也得防着这种精明。尤其当你交给它的，已经是一个聊了很久、读了很多文件、还在不停调用工具的任务。

OpenRouter 的 [Jev Router 文档](https://openrouter.ai/docs/guides/routing/routers/jev-router)写得很诱人：读取对话，判断任务类型、难度和更强模型能带来多少帮助，再选择满足要求的较便宜候选，同时选择推理强度。用户少纠结一次下拉菜单，确实是好事。

但“这句话交给谁便宜”和“把这件事做完要花多少钱”，中间隔着一辆搬家货车。

你在聊天框里只敲了一句“继续”，后台发出去的未必只有这两个字。编程 Agent 往往还得带上项目说明、此前对话、读过的代码和工具结果。查完一个文件，再把结果带回模型，任务才往前走一步。对话越长，这份随身行李通常越重。

提示词缓存能减轻这笔开销：满足条件的重复前缀可以复用，读取按相应的缓存价格计费。可这份优惠有适用范围。不能把 A 模型已经处理过的一大段内容，当成 B 模型也能直接使用的缓存。

9 月 24 日提交、26 日修订的 [《Harness Tokenomics》](https://arxiv.org/html/2609.28919v2)，专门讨论了这笔“搬家费”：在其研究的模型级缓存机制下，中途换模型需要重建缓存，后面省下的调用费用得先填平这笔支出。论文据此提出，在新会话等合适边界做选择，少折腾正在运行的长任务。

这里也得把论文的分量说准。它用合成任务和公开会话中的行为做仿真，没有在一家万人员工企业里实际部署并验证节省；模拟器和场景目录也没有公开。它提供了一套值得检查的账法，不能给任何团队开节省保证书。

这件事还有产品层面的佐证。[GitHub 的 Copilot 自动选模说明](https://docs.github.com/en/copilot/concepts/models/auto-model-selection)明确写到，路由会沿自然缓存边界，以及对话复杂度发生较大变化的位置进行，以避免没有质量收益的额外缓存成本。一个会省钱的调度器，有时就该忍住那一下切换。

![模型路由的缓存成本：长会话切到没有可用缓存的模型时需重读历史前缀；在合适的任务边界选模型，并按整项任务验收。](https://ai-knowledgepoints.cn/images/articles/routing-cache-commentary/routing-cache-cost.svg)

作者机制示意，不是实测结果。适用于不能跨模型复用缓存的场景；是否回本取决于后续工作与实际缓存状态，不表示每次切换都会增加总成本。

[查看竖版大图](https://ai-knowledgepoints.cn/images/articles/routing-cache-commentary/routing-cache-cost-mobile.svg)

当然，换房也可能划算。刚开一个新任务，行李还没拆；接下来会在便宜模型上连续工作很久；或者眼前这件小事可以带着少量资料独立完成，这些情况都值得重新算。原模型做不动，换一个能解决问题的，更有实际意义。把模型焊死，也算不上节约。

同一个模型也有门道。[OpenRouter 的缓存文档](https://openrouter.ai/docs/guides/best-practices/prompt-caching)介绍了供应商黏性路由：发生缓存使用后，让同一会话中同模型的后续请求尽量回到同一个供应商端点。模型名字一样，不代表换个服务入口还能享受原来的缓存。缓存还会过期，前缀也可能改变；具体优惠得看账单，光看聊天窗口看不出来。

所以，一个自动选模功能如果只告诉我“本轮选到了便宜模型”，这张成绩单还缺半页。至少得能查到实际用了谁，多少输入命中了缓存，多少需要新写入，以及任务最终有没有做成。OpenRouter 已提供缓存读写用量字段，Jev 也能返回所选模型和路由元数据。这些信息值得放到用户能检查的地方。

文档里还有个容易看漏的细节：Jev 的包含列表如果一个候选都没匹配上，会被忽略，转回整个候选池，排除列表仍然生效；如果排除列表把全部候选排光，请求则报错。把包含列表当成绝不会越过的硬边界，就可能理解错它的行为。自动选择越方便，边界越该读清楚。[来源：Jev 列表规则](https://openrouter.ai/docs/guides/routing/routers/jev-router)

还有一层别扭：做选择的时候，任务往往还没结束。路由器只能估计接下来要读多少、写多少、还要跑几轮。展示一个很精确的低价，不会让这些未知数自动消失。愿意把估计和实际账单摆在一起，我才更愿意把选择权交出去。

做产品的人也别只展示“平均每百万 token 便宜了多少”。我更想看同一类任务的完整账单：缓存重建、重试、补救都算进去，再看合格结果有没有变少。否则路由器把单价降下来，后面多折腾几轮，省钱只是换了个页面消失。

自动选模值得做，它能替用户接住越来越复杂的选择。但“智能”二字要落在总账上。长任务已经住得好好的，就别每看见一条低价广告，都把上下文拖出去重新安家。

房租可以便宜，搬家师傅也不能天天来。

资料核对：2026 年 10 月 1 日。Jev、OpenRouter 缓存及 GitHub 文档为当日版本，本文不将核对日期视为功能首发日期。开篇为假想场景，文中判断为基于所列资料的作者分析，没有声称亲测节省效果。
