一个AI智能体在跑长任务时,每切换一次模型,都可能把之前积累的KV缓存(键值缓存,用于加速推理的中间数据)全部丢掉。但如果不切换,又可能因为任务复杂度变化而浪费算力。这个两难问题,正是模型路由(model routing)要解决的。
Not Diamond 最近公开了其模型路由的评估方法论。据其发布的技术报告,这套方法在多个主流基准测试上实现了帕累托最优(Pareto-dominance),即在达到 Opus xhigh 级别质量的同时,将智能体成本降低了20%到80%。
![]()
长任务场景下的路由难题
对于运行时间较长的编码智能体(coding agents)来说,模型路由的决策难度会显著上升。Not Diamond 在模拟用户多轮交互的场景下对路由器进行了基准测试,测试中涵盖了任务复杂度的动态变化,以及可能导致KV缓存过期的响应延迟。
问题比表面看起来更复杂。如果过于激进地切换模型,可能会丢弃已有的KV缓存,造成计算资源的浪费;而如果从开场提示词开始就锁定单一模型,则意味着假设整个会话期间任务复杂度保持不变——这在真实场景中几乎不成立。
把路由当作序列决策问题
Not Diamond 的解法是把路由问题重新定义为序列决策问题(sequential decision problem)。在每一步中,路由器会基于当前及历史会话状态、消息与令牌数量、任务复杂度、KV缓存状态以及中间奖励信号,来预测某个特定模型和推理强度(reasoning effort)的未来回报与成本。
这种设计思路的核心在于:不再把每次模型选择当作孤立事件,而是放在整个会话的上下文里做动态权衡。每一步的决策都会影响后续步骤的缓存状态和成本累积,因此需要全局视角。
静态基准的局限与交互式评估
Not Diamond 在发布中特别强调,传统的静态基准测试(static benchmarks)无法真实反映智能体的成本累积情况。为此,他们推出了基于交互式基准(interactive benchmarks)的评估方法论,以更贴近实际运行场景的方式衡量路由器的表现。
从公开的技术报告来看,这套交互式评估框架覆盖了多轮对话模拟、任务复杂度变化和延迟影响等多个维度。据其公布的数据,在领先的基准测试中,该方法实现了帕累托优势——即在不牺牲质量的前提下,成本显著低于原有方案。
成本优化的实际意义
对于依赖大模型API的开发者来说,成本控制一直是核心痛点。Not Diamond 声称的20%到80%成本削减,如果能在实际生产环境中复现,将直接改变智能体类应用的商业模型。尤其是那些需要长时间运行、多轮推理的编码助手类产品,路由策略的优化空间可能比模型本身的升级更有价值。
当然,这套方法论目前仍处于技术报告阶段,其基准测试结果能否在真实生产环境中稳定复现,还需要更多第三方验证。但将路由问题从"单点选择"升级为"序列决策",这个思路本身就给行业提供了一个新的优化方向。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.