评估与 LLMOps

模型路由:把简单问题交给便宜的模型

路由是 LLM 系统里杠杆最大的成本控制手段,却几乎总是最后才被实现——在为那些小模型回答得一模一样的问题付了十八个月高价之后。

发生了什么

一个团队把所有请求都跑在最强模型上,因为项目初期这是最安全的选择,之后再没人回头看过。十八个月后,账单成了项目最大的一笔支出,而分析显示:大部分请求其实是查表、改写和分类,用小一个数量级的模型处理,结果完全相同。

为什么落地团队要在意

一刀切的模型选择是对谨慎征收的税。不同档位之间的成本差通常有十到三十倍,而在简单任务上的质量差异往往无法区分。路由能在完全不碰困难case的前提下拿回这个差价的大部分,这也是为什么它每小时投入的回报高于其他任何成本杠杆。

怎么建

不要一上来就用一个「路由模型」——那会增加延迟,也增加一种失效模式。先用规则,因为分类你早就知道:短事实查询、分类、抽取走小模型;多步推理、需要跨文档综合的、以及小模型置信度低的,走大模型。然后再做测量:把一部分线上流量同时送给两档,用你的评测集分别打分,只有在分数守得住的类别上,才把它移交给小模型。

护栏

留一条底线:小模型连续两次拒绝的请求,不要再路由给它。记录每次请求由哪一档服务,这样质量投诉能追溯到某次路由决策,而不是靠猜。另外,任一档模型升级后都重跑一次对比——针对上个季度模型建的路由表,描述的是你已经不再使用的模型。