网易首页 > 网易号 > 正文 申请入驻

告别Token焦虑,千问办公定义了 Agent 的斩杀线

0
分享至

用上 AI 这几年,我一直没有看额度的习惯。订阅的服务太多,这个那个摊开来,怎么用都够,压根想不起来去查还剩多少。

这个习惯是最近才被打破的。起因是我把整条工作流搬到了一个 AI 办公工具上——说得直白点,是搬到了一个智能体集群上——从那以后,看一眼今天烧了多少 Token,成了我每天都要干的事,因为那个数字跑得太快了。快到我这么一个仅仅在用它干些自动化程度并不那么高的活儿的人,都得盯着看。

比我焦虑的人多的很。2026年春天,一家三十五人的工程团队算了算当月的 AI 支出,八万七千美元。LeanOps 的调查里,重度使用 Claude Code 或 Cursor 的开发者,月均要在 AI 上花四百到一千五百美元,跑得凶的几天就烧掉四千。国内也一样,有人到处寻找便宜的API,自嘲成了"AI 时代的下沉市场人群"。大家的普遍感觉是,工具的确好用了,但积分烧完会焦虑,续费又心疼。

王坚打过一个比方:早期的 AI 应用像点电灯,耗电有限;以 OpenClaw 为代表的这一代智能体像开空调,耗电指数级地涨。他后面还跟了一句——"电价不降,老百姓用不起空调。"

8月26日晚上,千问办公推出标准模式,做的就是“降电价”。它首发了刚刚发布的 Qwen3.8-Flash,实现Token 消耗减少约 75%,生成速度差不多翻了一倍,同时任务质量还有保障,这也意味着,95% 的日常任务在标准模式下就能跑完。

但如果只把这当成"Agent又上线了一个新模型",就完全失焦了——千问办公想做的更大——给眼下这场 AI 办公大战划一条斩杀线:论性价比我比你高,论功能我比你全,论价格我也比你便宜。用户为什么要走?

——导语

但它凭什么敢这么讲?

先说一件这半年硅谷和国内都在争、大众媒体却没讲透的事:同一个模型,套在不同的"驾驭层"里,效能差距大得离谱。

驾驭层,行业里叫 harness,就是围绕模型搭起来的那套东西:工具怎么调、上下文怎么管、任务怎么拆、出错了怎么兜。这个词不性感,但它常常比换一个更贵的模型更能左右结果。

Cursor 的研究团队做过一组对比:同一个底座模型,换不同的 Agent 框架去跑,得分从 46% 拉到了 80%。模型一个字节没改,只是框架换了,成绩差了将近一倍。

Harness-Bench 的结论也很类似:不动模型、只换框架,同一批任务的分数能差出 23.8 分。在 SWE-bench 上,同一个模型因为 harness 配置不同,解题率从个位数跳到三成以上。

山姆·奥特曼跟 Ben Thompson 聊的时候说过一句话:他已经没法把模型和驾驭层看成两个独立的东西了,当 Codex 表现好的时候,他自己都分不清功劳归谁。他还有一个更干脆的判断:多数 Codex 失败是上下文问题,不是模型能力问题。

国内这边,清华刘知远团队提出的"密度定律"(Densing Law)从另一个角度讲了同样的事:大模型的能力密度大约每一百天翻一倍,换句话说,每过三个多月,你用一半参数就能跑到当前最强模型的水平。



这其实是一个很清醒的判断,就是单纯堆参数的红利在快速收窄,把模型用好的红利才是结构性的。就像手机芯片一样,如果你6个月就更新一次,其实意义不大。如何把芯片调教到性能释放极致,才知真功夫。

这几件事放到一起,说的其实是同一件事:一个好模型如果不跟工具链深度整合,就是法拉利的发动机配了一小面包车的底盘和传动系统,发动机再好也跑不出该有的成绩。这叫暴殄天物。

千问办公这次的更新正是踩在这个判断上。光有好模型不够,模型得长在 Agent 里面。千问办公上线的是和千问大模型团队联合设计的专属版Qwen3.8-Flash,所以在原有模型的基础之上,获得了更高的性能收益。

可有人会说,模型一旦长进 Agent 里,账单就开始不受控制。

前面我已经讲过AI工具带来的token焦虑。但是要从底层理解 Token 焦虑,要先理解 Agent 和普通对话的结构性差异。

一个人跟 AI 聊一个小时,撑死十几二十轮。而一个智能体后台跑一小时,为了完成任务可能来回交互几千轮。一次看上去轻飘飘的"帮我整理一下会议纪要",背后触发的是多轮工具调用、上下文检索、自我纠错、格式重排,实际消耗可以是一次普通问答的十到五十倍。

Anthropic 自己也承认,Agent Teams 模式下消耗大约是标准会话的七倍,“三个 Agent 跑一小时,顶一个 Agent 跑一整天”。IDC 给了一个更长周期的数据:企业智能体的 Token 消耗年均增幅超过 30 倍。

原来按对话设计的那套成本结构,撑不住这种量级。

所以千问办公出手的时机就在于,此刻,正是AI工具的放量期,且Agent工具正在趋同。谁能拿出一款"量大管饱"的模型和Agent组合,谁就在这场仗里握住了“取胜之匙”。千问办公首发 Qwen3.8-Flash 的底层意图在这里。



但光说便宜还不够——因为这场竞争里还横着另一个问题:慢。

很多文章在谈模型质量的时候只说“聪不聪明”,很少说“快不快”。但在真实的办公场景里,快不快才是体感最直接的那个维度。

那些公认更强的模型,因为参数大,往往也更慢。大不是问题,要命的是大带来的慢。

用过 Claude MAX模式或者 Kimi K3极致模式的人都有体会:坐在那里,盯着它一圈一圈地转,进度条好像粘住了,什么都干不了。你以为你在用一个强大的助手,其实你只是在等。对于那种高密度、连续性很强的办公场景来说,这种"坐等"非常致命,它打断的是人的心流。

对 Agent 工具来说,慢的代价还会被放大。它不像人可以边读边等,每一步都要等上一步的完整输出才能继续,延迟一层层累加。

有一组对比可以说明问题:一个三十万 Token 规模的复杂任务,在每秒一百个 Token 的速度下要跑将近五十分钟;拉到每秒四百个,只要十二分钟。省下来的那三十八分钟,就是一个人留在心流里还是切出去刷手机的分界线。

密度定律有一条推论:模型的推理开销会随时间指数级下降。高质量和慢,不需要永远绑在一起。千问办公把速度拉高一倍,解决的就是这个问题。让办公真正流动起来,而不是卡在一个转圈圈的等待里。



可便宜和快,都会被追平。真正的斩杀线,得往别处找。

驾驭层到底是不是护城河?

有一派很有分量的声音说不是。

TechCrunch 最近的报道就援引了 AI 领域那条著名的“苦涩教训”:从长远看,更强的通用模型终究会把外围那些精巧的工程一口吞掉。他们还举了个例子。Databricks 的实测里,一个叫 Pi 的开源极简 harness,用着和 Codex 完全相同的底座模型,成绩反而更好。在这一派看来,harness 是一根"随着模型变强而不断贬值的拐杖"。

这个反问很尖锐。但它恰恰指向了千问办公真正在做的事:斩杀线从来不靠某一个单点。模型会被追平,这是事实。驾驭层会随模型进步而贬值,这也是事实。但如果你能把三样东西同时叠到一起,取一个相对最优解,局面就不一样了。

第一,是模型和 Agent 的双向协同优化。模型在训练阶段就专门为 Agent 场景调过,Agent 框架又反过来围绕这个模型的特性做调度,两边互相优化、互相迁就。这件事情,“通用模型加一层薄封装”的产品做不到。你手里得同时握着自研模型和自研 Agent。

第二,是靠一版一版磨出来的工程沉淀。上下文压缩、会话恢复、长程任务里的目标保持,单拎出来都不性感,但极难复制。

第三样最吃劲:生态和上下文。千问办公把钉钉和 MyContext 接了进来,可以帮助企业构建一个Agent 的专属上下文,让Agent更懂业务工作流。模型可以下载,框架可以模仿,但一家企业沉淀在你这里的上下文,组织的记忆、业务的习惯,换一个产品带不走。业界有个说法叫"替换测试":悄悄把背后的模型换掉,用户还是离不开你,那才叫护城河。



三张牌叠在一起,就是千问办公说的"斩杀线"。它不靠哪一张牌去碾压谁,只是把对手可能进攻的每个方向都堵上了。性价比更高,功能更全,价格也不更贵。那你告诉我,客户凭什么走?

至此,阿里也成了全球第一个把"模型、办公平台、企业 IM、上下文层"打通的公司。这条全栈链路本身,就是壁垒的一部分。

但对我这样的用户来说,判断它有没有走对,还有个更土的标准——等哪天我又变回那个懒得看额度的人,就说明它做成了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本真上不得台面,亚运会给世界上了一课:没中国,就办不成生意

日本真上不得台面,亚运会给世界上了一课:没中国,就办不成生意

補懂事的孩紙
2026-09-09 17:31:53
大降价果然立竿见影!8月奔驰E级又交付9200台!市场成绩确实优秀

大降价果然立竿见影!8月奔驰E级又交付9200台!市场成绩确实优秀

沙雕小琳琳
2026-09-09 08:19:51
9日凌晨美网,2-0,2-1,萨巴伦卡18连胜,中国金花惨败无缘四强

9日凌晨美网,2-0,2-1,萨巴伦卡18连胜,中国金花惨败无缘四强

娱说瑜悦
2026-09-09 14:49:27
马卡报修改“齐达内100投票给梅西”的报道,内容改成梅西是历史最佳

马卡报修改“齐达内100投票给梅西”的报道,内容改成梅西是历史最佳

懂球帝
2026-09-10 00:18:06
深夜大涨,芯片巨头创新高!油价飙升,美联储加息突变

深夜大涨,芯片巨头创新高!油价飙升,美联储加息突变

证券时报
2026-09-09 23:06:02
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
隧道内,一女子突然从副驾车窗翻到车顶跳车!今天这段视频热传,嘉兴交警:正在展开后续处置

隧道内,一女子突然从副驾车窗翻到车顶跳车!今天这段视频热传,嘉兴交警:正在展开后续处置

都市快报橙柿互动
2026-09-09 19:55:56
乌克兰外长曝料泽连斯基战时住所:地下100米,红酒配好莱坞

乌克兰外长曝料泽连斯基战时住所:地下100米,红酒配好莱坞

麓谷隐士
2026-09-09 00:10:03
英国政府让老百姓囤罐头了!环境大臣警告:史上最大厄尔尼诺来袭 今冬可能引发持续断水断电

英国政府让老百姓囤罐头了!环境大臣警告:史上最大厄尔尼诺来袭 今冬可能引发持续断水断电

每日经济新闻
2026-09-09 23:28:18
涉嫌严重违法,中山市古镇镇城市更新和建设服务中心工作人员钟由杰被查

涉嫌严重违法,中山市古镇镇城市更新和建设服务中心工作人员钟由杰被查

广东建设报围城
2026-09-09 11:07:42
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
越扒越精彩!星宇90%都是临时工,副总经理也暴雷,人社局再出手

越扒越精彩!星宇90%都是临时工,副总经理也暴雷,人社局再出手

乐天闲聊
2026-09-09 18:44:29
这个污蔑中国的恶毒谣言,被粉碎!

这个污蔑中国的恶毒谣言,被粉碎!

海外网
2026-09-08 14:35:07
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-09-09 16:20:12
4岁男童事件最痛的真相:成年人的监护失职,为何要让全社会和孩童买单?

4岁男童事件最痛的真相:成年人的监护失职,为何要让全社会和孩童买单?

浪子的烟火人间
2026-09-09 14:55:23
律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

律师公开广西朱广成涉黑案中大规模刑讯逼供细节:有人被逼到撞墙自杀,有人在庭审期间死亡

追月数星
2026-09-08 14:09:40
孙绍骋被开除党籍和公职

孙绍骋被开除党籍和公职

新京报
2026-09-09 17:11:36
克宫表示,俄罗斯没有发起战争,俄罗斯在对乌克兰的战争中“非常接近”胜利

克宫表示,俄罗斯没有发起战争,俄罗斯在对乌克兰的战争中“非常接近”胜利

山河路口
2026-09-08 21:16:15
为什么和亲公主嫁到匈奴很少生育?匈奴的这一习俗,让她们不能忍受

为什么和亲公主嫁到匈奴很少生育?匈奴的这一习俗,让她们不能忍受

磊子讲史
2026-09-02 14:57:54
原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

原主悔到心肝疼!网友213元买板卡内藏3块2TB固态:价值超万元

快科技
2026-09-07 19:36:21
2026-09-10 00:55:00
胡说成理 incentive-icons
胡说成理
一个记录胡喆和他的朋友们,关于智能时代和智能时代的生意逻辑的小天地。
245文章数 30关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

头条要闻

男子资助女生5年后停止 遭质问"快打过来 不然曝光你"

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

腾势Z9GT易三方闪充尊越型32.98万元上市

态度原创

时尚
本地
健康
手机
军事航空

女人不管多大,都可以看看这些“条纹T恤”,非常减龄又简约

本地新闻

宁波,中国制造的隐藏大佬

中风康复为何像“抽丝剥茧”?

手机要闻

荣旗科技:公司参与了苹果折叠屏手机VC散热的检测环节

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版