想象一个特别会省钱的租房助手。
早上发现隔壁房租便宜,催你搬。下午找到更便宜的一间,又催你搬。床垫刚抬上楼,手机再震一下:恭喜,发现更优方案。
房租越来越低,人越来越想把它卸载。搬家师傅倒是挺支持这个产品。
给 AI 自动挑模型,也得防着这种精明。尤其当你交给它的,已经是一个聊了很久、读了很多文件、还在不停调用工具的任务。
OpenRouter 的 Jev Router 文档写得很诱人:读取对话,判断任务类型、难度和更强模型能带来多少帮助,再选择满足要求的较便宜候选,同时选择推理强度。用户少纠结一次下拉菜单,确实是好事。
但“这句话交给谁便宜”和“把这件事做完要花多少钱”,中间隔着一辆搬家货车。
你在聊天框里只敲了一句“继续”,后台发出去的未必只有这两个字。编程 Agent 往往还得带上项目说明、此前对话、读过的代码和工具结果。查完一个文件,再把结果带回模型,任务才往前走一步。对话越长,这份随身行李通常越重。
提示词缓存能减轻这笔开销:满足条件的重复前缀可以复用,读取按相应的缓存价格计费。可这份优惠有适用范围。不能把 A 模型已经处理过的一大段内容,当成 B 模型也能直接使用的缓存。
9 月 24 日提交、26 日修订的 《Harness Tokenomics》,专门讨论了这笔“搬家费”:在其研究的模型级缓存机制下,中途换模型需要重建缓存,后面省下的调用费用得先填平这笔支出。论文据此提出,在新会话等合适边界做选择,少折腾正在运行的长任务。
这里也得把论文的分量说准。它用合成任务和公开会话中的行为做仿真,没有在一家万人员工企业里实际部署并验证节省;模拟器和场景目录也没有公开。它提供了一套值得检查的账法,不能给任何团队开节省保证书。
这件事还有产品层面的佐证。GitHub 的 Copilot 自动选模说明明确写到,路由会沿自然缓存边界,以及对话复杂度发生较大变化的位置进行,以避免没有质量收益的额外缓存成本。一个会省钱的调度器,有时就该忍住那一下切换。
当然,换房也可能划算。刚开一个新任务,行李还没拆;接下来会在便宜模型上连续工作很久;或者眼前这件小事可以带着少量资料独立完成,这些情况都值得重新算。原模型做不动,换一个能解决问题的,更有实际意义。把模型焊死,也算不上节约。
同一个模型也有门道。OpenRouter 的缓存文档介绍了供应商黏性路由:发生缓存使用后,让同一会话中同模型的后续请求尽量回到同一个供应商端点。模型名字一样,不代表换个服务入口还能享受原来的缓存。缓存还会过期,前缀也可能改变;具体优惠得看账单,光看聊天窗口看不出来。
所以,一个自动选模功能如果只告诉我“本轮选到了便宜模型”,这张成绩单还缺半页。至少得能查到实际用了谁,多少输入命中了缓存,多少需要新写入,以及任务最终有没有做成。OpenRouter 已提供缓存读写用量字段,Jev 也能返回所选模型和路由元数据。这些信息值得放到用户能检查的地方。
文档里还有个容易看漏的细节:Jev 的包含列表如果一个候选都没匹配上,会被忽略,转回整个候选池,排除列表仍然生效;如果排除列表把全部候选排光,请求则报错。把包含列表当成绝不会越过的硬边界,就可能理解错它的行为。自动选择越方便,边界越该读清楚。来源:Jev 列表规则
还有一层别扭:做选择的时候,任务往往还没结束。路由器只能估计接下来要读多少、写多少、还要跑几轮。展示一个很精确的低价,不会让这些未知数自动消失。愿意把估计和实际账单摆在一起,我才更愿意把选择权交出去。
做产品的人也别只展示“平均每百万 token 便宜了多少”。我更想看同一类任务的完整账单:缓存重建、重试、补救都算进去,再看合格结果有没有变少。否则路由器把单价降下来,后面多折腾几轮,省钱只是换了个页面消失。
自动选模值得做,它能替用户接住越来越复杂的选择。但“智能”二字要落在总账上。长任务已经住得好好的,就别每看见一条低价广告,都把上下文拖出去重新安家。
房租可以便宜,搬家师傅也不能天天来。
资料核对:2026 年 10 月 1 日。Jev、OpenRouter 缓存及 GitHub 文档为当日版本,本文不将核对日期视为功能首发日期。开篇为假想场景,文中判断为基于所列资料的作者分析,没有声称亲测节省效果。

