{"title": "模型路由新方法:成本降低20%至80%","body": "
Not Diamond近日公开了其模型路由方法背后的评估体系,该方法宣称在达到Opus xhigh质量水平的同时,能将智能体(agent)的运行成本降低20%至80%。
对于长时间运行的编码智能体而言,模型路由的决策难度显著增加。Not Diamond在模拟用户多轮交互、任务复杂度变化以及可能导致KV缓存过期的响应延迟等条件下,对路由器进行了基准测试。这些动态因素正是静态基准测试所无法覆盖的。
![]()
路由决策的复杂性
表面上看,路由是在多个模型之间进行选择,但实际操作中面临挑战:若切换模型过于频繁,KV缓存可能被丢弃,导致前期计算失效;若从开场提示词就固定使用单一模型,则需假设整个会话期间任务复杂度保持不变,这在真实编码场景中往往不成立。
这两种极端做法均存在明显缺陷。频繁切换会因缓存失效带来性能损失,而固定模型则无法适应任务复杂度的动态变化。Not Diamond的解决方案是将路由视为一个序列决策问题。
序列决策方法
具体而言,Not Diamond的路由器在每一步都会基于当前及之前的会话状态、消息和token数量、任务复杂度、KV缓存状态以及中间奖励信号,预测特定模型和推理努力程度对应的未来回报与成本。这意味着路由不再是静态的一次性选择,而是随会话推进不断调整的动态过程。
该设计思路的核心在于:路由决策的评估不应仅关注单次调用的质量,而应着眼于整个会话周期内的成本累积。Not Diamond在技术报告中详细阐述了这一评估方法,并强调交互式基准测试比静态基准测试更能真实反映智能体的成本累积情况。
Pareto占优的结果
根据Not Diamond公布的数据,在多个主流基准测试中,其方案实现了Pareto占优——即在达到Opus xhigh质量水平的同时,成本降低20%至80%。这一结果意味着在质量和成本两个维度上,该方案均优于对比对象,而非简单的取舍。
当然,20%至80%的成本降幅区间跨度较大,实际效果取决于具体使用场景和任务类型。对于编码智能体这类长时间运行、多轮交互的应用,路由决策的优化空间确实更大。
这套方法论的价值在于,它将模型路由从“选择哪个模型”的静态问题,升级为“每一步如何选择”的动态优化问题。对于正在构建复杂智能体应用的团队而言,这种思路可能比单纯追求单次调用的质量上限更具实际意义。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.