网易首页 > 网易号 > 正文 申请入驻

Token 账单正在失控!从 token maxxing 到 ROI 回归,企业 AI 的价值逻辑彻底变了

0
分享至


  • Token 账单正在失控!从 token maxxing 到 ROI 回归,企业 AI 的价值逻辑彻底变了

  • 别再拿 token 用量当 AI 业绩了!80% 企业正在为无效算力买单

  • 烧钱换不来价值:为什么 AI 行业正在集体抛弃 token maxxing

  • Token 烧得越多,AI 就越有价值吗?企业正在用 ROI 纠偏

这两个月,AI 圈里有个词被频繁提起,叫token maxxing。

它最早像是一种带点戏谑意味的内部黑话,后来却越来越像企业推进 AI 的一套指标逻辑。

谁用的 token 多,谁就更像在积极拥抱 AI;哪个团队 token 消耗快,哪个团队就更像跑在转型前面。再往前走一步,token 甚至被默认为某种“AI 工作量”。

问题也恰恰出在这里。

作为模型时代的计量单位,token不太适合作为价值单位,也不太适合于企业经营里的产出单位。

把 token 使用量和员工工作、流程效率、组织先进性直接挂钩,本质上是在把“消耗了多少算力”,错当成“创造了多少结果”。

这套叙事刚开始看起来很热血,真到了企业预算、采购、财务和交付环节,就会迅速露出问题。

说白了,企业愿意为 AI 花钱,但不愿意为“看起来很忙”的 token 账单买单。

最近这股风向变化,已经越来越明显。围绕 token 的狂热,正在回到 ROI 的地面上。

而且这次推动转向的,不只是客户企业,也包括 ServiceNow、Salesforce 这样的厂商自己。

为什么 token maxxing 会热起来

先得承认,token maxxing不是凭空冒出来的。

一方面,大模型厂商的商业模式天然建立在 token 消耗之上。调用越多、上下文越长、输出越复杂,平台收入越高。

另一方面,企业在引入大模型早期,又确实需要一个足够简单、足够直观的 adoption 指标。于是 token 这种原本属于底层核算层的东西,被抬到了管理层视野里。

华尔街日报对这种现象有过专门报道,一些公司甚至会把 token 使用做成内部排行榜。任何新技术进入组织,都会先被指标化、看板化、竞赛化。因为只有这样,管理者才觉得自己抓得住。

但抓得住,不等于抓得对。


token 这个指标最大的问题,在于它太像“工作量”,却又不是“结果量”。你让一个团队把所有事情都丢给大模型,它的 token 消耗一定会上升;可这并不自动意味着它更高效,更不意味着它比原来的流程更省钱。

更麻烦的是,这个指标天然会制造激励扭曲。工程师可能会为了证明自己“善用 AI”而增加调用,业务团队可能会把原本可以用脚本、模板或规则完成的动作也塞给大模型,管理层则可能把 token 曲线误读成组织智能化水平。

最后形成的,不是生产力飞轮,而是账单飞轮。

这就是 token maxxing 最核心的悖论:它衡量的是消耗,不是完成;是调用强度,不是业务闭环。

Token 为什么不是价值单位

学界已经开始把这件事讲得很明白。

在论文 [AI Tokenomics] 看来,token 是基础模型服务时代的一个核算单位,它连接了计算、延迟、内存、能耗和定价,但它本身不是经济价值。

扩展阅读:https://arxiv.org/abs/2606.24616

企业真正关心的,是 marginal productivity,也就是边际产出,是这个 token 花在流程哪一段、带来了多大结果、有没有后续放大效应,以及伴随了什么风险。

这个判断特别关键。因为它相当于把很多企业现在的 AI 误区,一下子点破了。


有些团队把一个原本可以用 Python 脚本、规则引擎、数据库过滤、RPA 或模板系统完成的动作,也强行改造成大模型参与的流程。

表面看,系统更“智能”了;实际看,是把原本几乎确定、几乎零边际成本的事情,交给了最贵、最不稳定、最难审计的一层。

这不是智能化,这是成本结构劣化。

另一篇研究 [How Do AI Agents Spend Your Money?]也对 agentic coding 的 token 开销做了系统分析,结论非常扎眼:某些 Agent 任务的 token 消耗可能比普通代码问答高出 1000 倍,同一任务不同运行之间的差异还能达到 30 倍。

更重要的是,更高 token 消耗并不稳定带来更高准确率。

扩展阅读:https://arxiv.org/abs/2604.22750

这意味着什么?

这意味着,企业如果把 token 用量当成 AI 成效的agent指标,极容易掉进 Goodhart 定律。一个指标一旦成为目标,它就不再是好指标。

员工会为了“使用 AI”而使用 AI,团队会为了“看起来更先进”而增加调用,平台会为了“更深度推理”而鼓励更长上下文。

一句话说,这种逻辑很容易把“模型烧得更狠”,误判成“业务做得更好”。

为什么行业又开始回到 ROI

现在企业不再只问“有没有上 AI”,而是在问“这笔钱值不值”。这不是保守,而是经营理性开始回归。

ITPro 在 2026 年 6 月 29 日的报道提到,Accenture 已经在内部提醒员工减少不必要的 AI 使用,原因很直接,token 支出涨得太快。管理层追问的也不是“大家为什么没多用点 AI”,而是“这些花出去的钱,究竟换回了什么”。

这才是大企业进入 AI 深水区后的正常反应。


更值得玩味的是,连厂商自己都开始公开给 tokenmaxxing 降温。

ServiceNow 首席客户官 Chris Bedi 直接把 tokenmaxxing 称为一个短期 hype cycle,并给了一个很形象的比喻:衡量一家餐厅,不能看它买了多少食材,而要看它最后做出了什么菜、服务得怎么样。

这个比喻非常到位。因为 token 就像食材成本,它当然重要,但没人会把食材消耗量直接当成餐厅价值。

关键的是,ServiceNow 并不只是口头批评。报道里提到,它已经把 ROI、Agent 行为追踪和治理能力放进了 A.I. Control Tower 这样的产品叙事里。

也就是说,厂商自己都在把客户关注点,从“用了多少模型”往“创造了多少业务结果”上引。

Salesforce 的动作更典型,而且这次已经有了更明确的公开口径。

Salesforce 高管在解释其Agentic Work Units时明确表示,token 不是合适的价值估算方式,原话甚至是,“你可以烧掉一百万个 token,却没有给公司创造任何正向结果”。

这个表态非常重要。因为它等于承认了两件事:第一,token 可以衡量使用,但不能衡量价值;第二,企业最终仍然会回到业务 KPI,而不是停留在模型调用量。

再往前一步,Salesforce 已经开始把这种思路落到定价上。根据 科技媒体CIO报道,Salesforce 推出了 Agentforce Help Agent,并采用pay-per-resolution模式,按每次成功解决收费,价格是每个成功解决 2 美元。

文章里还明确写到,所谓“成功解决”,是不需要人工升级、用户也没有明确表示问题未解决。

同样的变化也被 Salesforce Ben 在 2026 年 6 月 26 日的报道中进一步强调了。它点出了这个定价变化的实质:客户不再为 activity 买单,而是为 outcome 买单;如果客户要求转人工,或者结果不满意,就不收费。

看到这里,行业方向已经非常清楚了。

如果 token 真能代表价值,厂商没有必要主动把叙事改成 outcome。

今天越来越多企业软件厂商愿意按解决、按完成、按验证过的结果来收费,恰恰说明 CFO 们已经不再接受“你用了很多 token,所以你得到了很多价值”这套逻辑。

模型厂商自己也在帮企业省 token

再看模型厂商自己的动作,方向也很一致。OpenAI 在 [Prompt Caching 文档]里明确写到,缓存可以把输入成本最高降到 10%,延迟最高降低 80%。

扩展阅读:https://developers.openai.com/api/docs/guides/prompt-caching

Anthropic 在 [Prompt Caching 文档]里把 cache write、cache read 和 base input 的价格系数拆得非常细。

扩展阅读:https://platform.claude.com/docs/en/build-with-claude/prompt-caching

Google Cloud 在 [Gemini Agent Platform 定价页]也把 input、output、cached input、grounding、search 成本分开计费。

扩展阅读:https://cloud.google.com/gemini-enterprise-agent-platform/generative-ai/pricing


这些厂商为什么要这么做?

因为它们比谁都清楚,企业真正买不起的,不是模型,而是失控的调用链。

只要进入 Agent、工具调用、检索增强、多轮对话、跨系统执行这些复杂场景,成本就不再只是单次对话成本,而是一整条任务链成本。

当平台开始系统性奖励缓存、复用、上下文压缩、搜索控制和推理克制时,这本身就在说明一件事:行业的主命题已经不是“怎么让 token 再涨一点”,而是“怎么让每个 token 更值钱一点”。

企业真正需要的,不是全面模型化,而是任务分层

讲到这里,问题就很清楚了。

企业不是不能多用模型,而是不能不分青红皂白地让模型参与一切。很多流程里,大模型根本没必要全程在场。

有些步骤只需要结构化抽取,有些步骤只需要规则判断,有些步骤只需要 SQL、脚本、接口编排或者简单工具调用。

只有到了模糊判断、跨源整合、自然语言生成、复杂例外处理这些环节,大模型才真正值得上场。


这件事,用一句更直接的话说就是:

AI 系统的成熟,不是让模型干100% 的活,而是让模型只干那些最需要模型的活。

也就是说,你同样可以把二八原则、721格局等量化方法论应用于AI流程与非AI流程。

比如最近我构建的几个应用于个人工作流程的skill,都加上了这个原则:尽量做到20%使用模型,80%使用python代码。

很多简单的业务流程更适合于代码处理,这就不需要模型参与,token也就省了。把这个逻辑放大到企业运营中,其实就是传统业务流程与大模型、智能体的选择性问题。

大模型与智能体肯定要用的,传统业务流程也有它们的优势。把大模型引进来在简单的可控的逻辑中替代人类的推理与监督,让智能体、智能工作流和传统业务流程有序分工,并且按部就班地运行。

这是当前技术背景下的合理解决方案,毕竟token的价格都超过人工的价格了,不是吗?

所以我一直觉得,很多团队该把注意力从 prompt 炼丹,转回到 harness engineering。

harness,不只是调用大模型的那层胶水代码,更是整套任务编排、工具路由、上下文治理、缓存复用、失败回退、权限控制和成本监控体系。

它解决的是一个比模型能力更企业化的问题:同一个业务目标,能不能用更少的 token、更短的路径、更高的可审计性做出来。

如果把这个思路再说得更实操一点,成熟企业至少要先做四层拆分:

层级

更适合的能力

确定性执行层

Python、SQL、规则引擎、工作流、RPA

数据访问层

检索、过滤、缓存、向量召回、权限校验

模糊判断层

大模型推理、摘要、改写、归纳、生成

治理回路层

监控、审计、回退、成本控制、人工升级

我最近开发 skill 时强调“代码与模型按二八原则协作”,其实就是这个方向。

能由代码完成的,不交给模型;能由工具确定性完成的,不交给推理;能由局部上下文完成的,不上全量长上下文;能缓存的,不重复烧 token。

这不是舍不得烧token的保守,这是工程成熟的思维。

从 Token KPI,转向 Outcome KPI

很多企业接下来最需要改的,不是模型参数,而是指标体系。

如果继续盯着 token 用量,组织最后优化出来的,只会是更会花 token。真正应该看的,是另一组指标:

旧指标

新指标

token 消耗量

单次完成成本

调用次数

成功解决率

上下文长度

平均处理时长

模型参与比例

自动化闭环率

部门 AI 使用率

人工节省工时

推理深度

异常升级准确率

从这个角度看,token 最多只能算二级运营指标,适合放在工程优化层,不适合放在经营决策层。

企业真正在意的,是一个客服问题有没有更快解决,一张发票有没有更稳地核对,一次风控判断有没有减少误报,一条交付链路有没有少掉人工回填。

如果 AI 账单已经接近一个员工的工资,却没有产生接近一个员工的有效产出,那这笔钱在经营上就是站不住的。


更现实一点说,企业不会长期接受“再雇一个数字员工,同时再保留原来的人类员工”的双倍成本结构。

所以 ROI 回归,不是唱空 AI,而是在把 AI 从概念消费拉回经营学。

Token maxxing 是不是伪命题?

Token maxxing 到底是不是伪命题?

王吉伟频道的答案是,至少在企业场景里,它确实有很强的伪命题色彩。

因为企业从来不会为 token 本身付费,企业是为结果、效率、风险可控和经营弹性付费。

token 再多,如果没有形成结果闭环,就是高成本噪音;token 再少,只要完成度更高、路径更短、可审计性更强,它就是更好的企业 AI。


所以这轮行业回摆,很可能不是短期现象,而是一条更长的主线。接下来真正有竞争力的厂商,不是最会鼓励用户多烧 token 的厂商,而是最会帮客户把 token 用在刀刃上的厂商。

真正成熟的企业,也不是内部 token 排行榜最好看的企业,而是最先完成“代码、工具、规则、检索、模型”协同分工的企业。

一句话收尾:

AI 时代当然要算 token,但企业不能活在 token 里。把 token 当成本变量,把 ROI 当经营目标,把 harness 当核心工程,把模型使用保持克制,这才是下一阶段企业 AI 最像样的打法。

token使用量,把token的使用数量和人类工作挂钩,却并没有应有的产出。以致于token消耗量的费用居高不下,甚至比人类职员工资还要高,相当于双倍工资雇佣一个人类职员。

这显然不符合企业运营经济学。

所以token使用量本身就有伪命题的一面。好在,现在终于又开始从token使用量叙事回到ROI量化方向。

就连大模型厂商也在采取prompt精简优化策略以节省更多的token,从侧面反映了企业对于AI使用的认真思考而谨慎态度。

其实很多业务流程中,并不需要大模型参与全部,有的只需要大模型参与很少的部分。有些任务用python代码等更合适,有些任务只要简单的工具就能胜任,那就没必要的让大模型参与其中。

今后,harness中对提升token效率、降低token消耗的要求,也该适当提权了。

而过去被众星捧月的 token工厂、token制造机 之类的标签,怕是在以后也要被慢慢撕毁了。

token maxxing 的退潮,不是 AI 热度的降温,而是行业从概念期进入落地期的必然标志。企业 AI 的核心命题,从来不是「用了多少模型」,而是「用模型创造了多少可量化的业务价值」。

从 token KPI 转向 outcome KPI,从全流程模型覆盖转向分层任务适配,从比拼调用强度转向打磨 Harness 工程体系,这是接下来所有企业 AI 落地的必经之路。

公众号后台回复关键词:TokenROI,免费获取扩展阅读资料包。

后续会持续更新 AI 成本优化、Harness 工程落地、Agent 治理体系等深度内容。欢迎点赞 + 在看 + 星标账号,在 AI 落地深水区保持清醒的经营判断。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

全文完

王吉伟频道图书《一本书讲透Agentic AI》已出版,完整构建Agentic AI在企业应用中的全景式知识体系,内容跨越 “基础认知-技术原理-业务应用-组织战略-实操指南” 五大板块,为读者提供从认知共识、技术解构、业务对接到组织变革的端到端路线图,欢迎大家关注。

【赠书福利进行中】

感谢大家的长期关注与支持。欢迎小伙伴们在文末留言与转发,王吉伟频道会随机选取读者,《一本书讲透Agentic AI》包邮到家。

【 文末福利1 】:后台发消息研报2026,获取15篇 2026年 AI Agent研报 。


【文末福利2】: 后台发消息Workflow,获取 Agentic Workflow 相关25篇论文。


【文末福利3】:后 台发消息agentic,获取Agentic AI相关资源 。


【文末福利4】:后台发消息RPA Agent,获取 相关论文和研报。


1、

2、

3、

4、

5、

6、

7、

8、

8、

10、

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
知名投资人曝刘欢真实死因是肝癌!8月底他曾在餐厅吃饭状态不错

知名投资人曝刘欢真实死因是肝癌!8月底他曾在餐厅吃饭状态不错

一个小豹子
2026-09-27 09:40:19
美国农场主4千美元买中国三轮车,拆箱想退货,半月后狂定12台

美国农场主4千美元买中国三轮车,拆箱想退货,半月后狂定12台

爱下厨的阿酾
2026-09-28 02:30:59
无谢震业苏炳添,中国接力38秒41压日本,强在哪?

无谢震业苏炳添,中国接力38秒41压日本,强在哪?

宝哥精彩赛事
2026-09-28 14:58:12
印尼一个小岛,正制造全球约70%的苹果AirTag

印尼一个小岛,正制造全球约70%的苹果AirTag

爆角追踪
2026-09-28 07:24:17
曾对着裁判爆粗中国篮球被你们吹掉了!浙江官宣:免除方俊总经理

曾对着裁判爆粗中国篮球被你们吹掉了!浙江官宣:免除方俊总经理

狼叔评论
2026-09-28 17:44:02
施魏因斯泰格:德国队已不再是顶级球队,只是一支平庸的球队

施魏因斯泰格:德国队已不再是顶级球队,只是一支平庸的球队

懂球帝
2026-09-28 06:10:15
63岁刘欢离世仅1天,令人担心的事还是发生,巨额遗产分配引争议

63岁刘欢离世仅1天,令人担心的事还是发生,巨额遗产分配引争议

风月得自难寻
2026-09-27 21:58:39
普通孩子唯一能改命的机会就是:死磕三年高中,熬过去便是一生坦途;若是偷懒,往后几十年都得用来弥补这三年留下的遗憾

普通孩子唯一能改命的机会就是:死磕三年高中,熬过去便是一生坦途;若是偷懒,往后几十年都得用来弥补这三年留下的遗憾

好爸育儿
2026-09-27 08:29:37
妈妈走后我才发现,我越来越像她了

妈妈走后我才发现,我越来越像她了

晚风寄温柔
2026-09-27 17:49:07
4-3险胜,林诗栋男单决赛战王楚钦!王皓当场亲额头!全场却给林昀儒加油!

4-3险胜,林诗栋男单决赛战王楚钦!王皓当场亲额头!全场却给林昀儒加油!

好乒乓
2026-09-28 17:39:01
毛阿敏“沉默”送别刘欢:没发一条悼念,却悄悄做完了所有事

毛阿敏“沉默”送别刘欢:没发一条悼念,却悄悄做完了所有事

风月得自难寻
2026-09-28 08:15:16
美财长称中方提议达成“更大的协议”包含哪些内容?外交部:建议询问主管部门

美财长称中方提议达成“更大的协议”包含哪些内容?外交部:建议询问主管部门

澎湃新闻
2026-09-28 15:46:26
凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

凌晨一点的北京家属院里,72岁的濮存昕用一根绳子,将自己与94岁患阿尔茨海默症的母亲紧紧系在一起

笨鸟摘文
2026-09-19 21:35:47
武契奇时代结束,河北拯救了塞尔维亚

武契奇时代结束,河北拯救了塞尔维亚

凤眼论
2026-09-27 20:45:06
莎拉·布莱曼悼念刘欢称他才华横溢,两人曾演唱北京奥运会开幕式主题曲《我和你》;妻子澄清刘欢“嗜酒致病” ,上个月被网友偶遇状态还好

莎拉·布莱曼悼念刘欢称他才华横溢,两人曾演唱北京奥运会开幕式主题曲《我和你》;妻子澄清刘欢“嗜酒致病” ,上个月被网友偶遇状态还好

极目新闻
2026-09-28 11:24:10
“最风流”央视女主持:把两个有妇之夫玩弄于股掌,如今怎样了

“最风流”央视女主持:把两个有妇之夫玩弄于股掌,如今怎样了

有范又有料
2026-09-28 18:44:24
三星S27 Ultra顶配实锤:强到离谱,却不是谁都该买

三星S27 Ultra顶配实锤:强到离谱,却不是谁都该买

小柱解说游戏
2026-09-28 17:26:43
中国5大通血管食物,洋葱排第5,第1名超市很常见,很多人不懂吃

中国5大通血管食物,洋葱排第5,第1名超市很常见,很多人不懂吃

医学科普汇
2026-08-01 21:25:06
中美峰会结束后,美国前驻华大使挑战特朗普,罕见提及台湾问题

中美峰会结束后,美国前驻华大使挑战特朗普,罕见提及台湾问题

DS北风
2026-09-28 15:38:06
母亲节儿子给我红包100,给丈母娘5万,我把留给他的商铺卖掉他慌了

母亲节儿子给我红包100,给丈母娘5万,我把留给他的商铺卖掉他慌了

雨仔讲故事
2025-06-17 18:52:07
2026-09-28 19:47:00
王吉伟
王吉伟
关注互联网+与行业转型
874文章数 8584关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

日本前外相岩屋毅率约50人访华 系一个多月来第三波

头条要闻

日本前外相岩屋毅率约50人访华 系一个多月来第三波

体育要闻

114项指控成立,曼城已经完蛋了吗?

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

一天近2亿人次在路上:钱会在哪里停留?

汽车要闻

越野级的方盒子 北汽星钽5X 17万级还配华为乾崑智驾

态度原创

旅游
本地
教育
时尚
公开课

旅游要闻

中秋国庆双节叠加 成都捧出丰盛文旅菜单|成都发展

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

一年级的数学,能有多难呢

秋季,用丝巾把基础款穿出新意!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版