一项用 LangChain 145 个智能体任务做的对比显示,只要在前沿模型和 30B 规模的开源模型之间加一层路由,总成本就能压掉 74%,准确率只从 100% 掉到约 93%。
拆开看更扎心:在所有交互轮次里,真正被路由到前沿模型的只有 7%,但这 7% 轮次承载了 68% 的账。也就是说,你为智能体花的钱里,接近三分之二被压在了本来不需要最强模型的那几次判断上。
实际操作并不复杂。NVIDIA 开源的 NeMo Switchyard 会在每一轮调用前先发一个更便宜的裁判模型判一下难度,只有真正复杂的环节才升级到 Claude Opus 4.8,剩下 93% 的轮次交回本地能跑的 30B 模型。代码改造成本主要是接路由层,业务侧几乎无感。
省下来的钱不白捡。代价是大约 6 个百分点的准确率损失,而且这 6 个点在不同任务上分布并不均匀——长链推理、需要外部工具组合的步骤,更容易掉分。LangChain 的结论也留了边界:只有当两种模型的价格差足够大,路由才划算;如果都走云端 API、单价接近,这套策略反而会亏,因为裁判模型本身也是要花钱的。
说白了,一刀切把每轮都交给最强模型,是个安稳但昂贵的默认设置。路由适合那种明确区分“高难度”和“日常杂活”的智能体,调用量大、且愿意接受一点容错的场景。
你们现在的智能体里,哪一类调用是一直全程用最强模型、你心里其实最怀疑不一定必要的?
