通过极致协同设计实现最低的每 Token 成本,从而在智能体时代将后训练的每美元智能最大化。
![]()
想象一下职业运动员。真正让顶尖选手脱颖而出的,往往是赛场之外的功夫:他们持续打磨自己,针对新对手调整战术,并根据上一场比赛暴露出的问题来不断调整。
智能体 AI 的运作逻辑如出一辙。我们不再仅仅是向模型索要一个答案,而是给它设定一个目标,让它在环境变化、边缘情况出现以及工具更迭时,不断自我调整。与仅需对提示词做出响应的生成式模型不同,智能体模型必须学会规划、调用多种工具,并在运行过程中遇到问题时能够自我恢复。
这就是为什么后训练,即在原始数据上完成初始训练后对模型进行优化的阶段,已不再是一次性的收尾步骤,而是变成了一项持续性的工作。这是因为智能体模型所处的运行环境变化极快。智能体使用的工具可能每周都在更新;生产环境中会不断遇到测试集未曾出现过的边缘情况;而且每一次部署,都会面临各自独特的代码库、策略和环境。
随着生产环境中不断出现新问题,后训练会持续接收生产反馈,并进入新一轮循环。计算需求之所以越来越大,并不是因为单次运行的规模更大,而是因为这种训练持续不断地循环执行。智能体 AI 为后训练引入了一种全新的计算模式,使其成为智能体时代的核心工作负载,也是决定每美元智能的首要驱动力。
后训练的目标,是通过最大化持续学习循环中每一次前向传播和反向传播的收益,来实现每美元智能的最大化。其中,前向传播,即推理的效率是用每 Token 成本来衡量的。这意味着,每一次降低每 Token 成本,都将直接转化为每美元智能的提升。
为何每美元智能是对每 Token 成本的超越与延伸
如果说推理是创造收入的引擎,那么后训练就是乘数:模型的能力越强,每 Token 的价值就越高。
每 Token 成本是推理工厂的核心指标,即生成 100 万个 Token 的总体成本。而每美元智能则处于更高的维度,它回答的是一个截然不同的问题:构建一个值得被部署的模型需要花费多少成本?并且,随着环境的不断变化,如何持续保持它的价值?
这两者是相互嵌套,而非相互竞争的关系。能够降低每 Token 成本的 AI 基础设施,同样也会降低构建模型中每一次智能提升的成本。反过来,模型智能的每一次提升,又会提升推理工厂所交付的每 Token 价值。
换句话说,每 Token 成本衡量的是运营效率;而每美元智能衡量的则是:模型智能投入,是否带来了相应的回报。
以上为摘要内容,点击链接阅读完整内容:NVIDIA Vera Rubin 在后训练工作负载中实现每美元智能最大化 —— 这是智能体 AI 的关键指标 | NVIDIA 英伟达博客
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.