网易首页 > 网易号 > 正文 申请入驻

CPU在智能体AI时代迎来复兴?

0
分享至

设置星标★关注,从此你的世界多点科学~


今年5月,亚马逊旗下子公司,亚马逊网络服务公司(AWS)的管理层向工程师下达一项新指令:不惜一切代价节省中央处理器(CPU)周期。

据报道,由于AI工作负载给公司的云基础设施带来巨大压力,AWS的CPU服务器资源排队等待时间激增。此问题似乎令AWS措手不及,而这不无原因。

要知道,AI热潮带动图形处理器(GPU)需求暴涨,随后内存需求也水涨船高,但CPU却几乎身处局外,因为它们的并行化程度相对不足,不适用于推理,即AI模型收到提问后生成答案的过程。

但智能体AI(agentic AI)系统的崛起正改变局面。这类系统允许AI模型自主运行,并调用子智能体。

马特·金博尔(Matt Kimball)现为美国摩尔洞察与战略咨询公司(Moor Insights & Strategy)的副总裁兼首席数据中心分析师。金博尔表示,2026年CPU需求急剧攀升,其中很大一部分增量来自智能体AI。AI智能体(AI agent)要调用计算机,计算机则离不开CPU。

“设想有一个智能体工作负载,能生成一百个智能体。如果企业大规模部署该系统,一百个智能体就能变出数万、数十万乃至上百万个智能体。智能体会不断生成子智能体,调用应用程序编程接口(API),并通过Anthropic公司的模型上下文协议与更多智能体进行交互。”

——马特·金博尔

那么,AI是如何调用计算机的?这就涉及一系列“工具调用”操作了……

AI能体要用计算机,而计算机要用CPU

所谓工具调用,是指大语言模型(LLM)访问互联网、打开桌面本地文件以及使用各类软件完成任务的能力。

大语言模型经过工具调用专项训练,能学会调用其他软件。而它们发起的工具调用任务通常交由CPU处理——尽管其推理过程主要在GPU或类似AI加速器上完成。

英特尔高级首席研究科学家苏维克·昆杜(Souvik Kundu)解释道:“智能体AI任务的诸多组成部分,本质上就是基于CPU的任务。CPU负责解析输出、判断调用哪项工具、发起API调用或运行代码、收集结果,再把结果反馈给大模型。”

举例来说,一个被指派了软件编写任务的LLM,可能发起工具调用——把代码写入文件、移动或替换文件、下载所需软件包,以及在LLM认定前置准备工作已完成后构建该软件。

昆杜曾与佐治亚理工学院的研究人员合著了一篇关于智能体AI优化的论文。团队发现,当大语言模型的推理在GPU上执行时,CPU常处于空闲状态;反过来,当CPU处理工具调用任务时,GPU又往往无事可做。

针对该问题,昆杜等人提出调度优化方案。该方案可在持续负载下,将端到端延迟,即智能体任务从开始到结束的时间,最多降低到原来的5/9。

上述成果只是行业在新方向上发力的初始尝试,但我们也要知道,性能提升的进度落后于日新月异的现实。智能体系统以机器的速度生成任务,任务量持续倍增。OpenAI曾经历失控调用Hugging Face的事故:模型每小时发起多达300次操作,单个智能体还会衍生子智能体,子智能体再发起自己的工具调用……

随着模型变得越发复杂,另一项关键因素可能增加CPU的工作负载,那就是安全护栏(safety guardrails)。

昆杜介绍,针对智能体行为的安全与策略校验,大多是用于检查语法、日志文件的特定规则。安全护栏也会使用参数量小于10亿的小型模型来分析任务复杂度或模型意图。这些检查任务理论上可由GPU处理,但通常都留在CPU上执行,一方面是因为模型规模小,另一方面原因则是需求尽可能降低延迟。

“分词”任务将CPU推向性能瓶颈

佐治亚理工学院博士生郑义俊(音译,Euijun Chung)近期参与撰写了另一篇论文,其结论和昆杜的成果互为补充。

郑义俊等人发现:当服务器的CPU核心数量过少时,它会来不及向GPU派发任务,这导致GPU因等待指令而陷入空闲停滞。

除此之外,论文还探讨了大语言模型工作负载的另一核心环节,即分词(tokenization)。

分词是大语言模型推理的首个关键步骤。它把文本转换成可供模型运算的整数型词元ID(token ID)。不同于大语言模型推理中所需的大部分矩阵运算,分词是分支繁多、依赖数据的串行字符串操作。虽然可通过文本分块(chunking)实现一定程度的并行化,但它不像LLM推理的主体部分那样具备大规模并行性。

针对简短提示词的分词任务相对简单,即便是入门级CPU也能轻松应对。但一个会发起工具调用的智能体模型,必须对调用返回的结果进行解析和分词,如此工作量对CPU而言可谓繁重。

“智能体的每一次工具调用,都要求执行一次分词。举例来说,假设有个已增长到10万词元长度的上下文序列,而某次工具调用的返回结果新增了1000个词元,由此,分词器必须再对全部序列重新分词。”

——郑义俊

显然,这既提高了分词操作的执行频次,也增加了所涉及词元的数量。未来分词技术或可寻得解题之法,但当前这道难题确实阻碍着LLM推理的发展。

郑义俊团队在论文中指出:首词元时延(TTFT),即从用户提出问题到模型回复第一个词的时间,会随着序列长度增加而大大延长;针对该问题的解决方案之一,就是提高CPU芯片的核心数量。在长序列测试场景下,通过增加CPU核心,可将TTFT降低至原来的大约2/3到1/7。


如图所示,增加可用CPU核心的数量可显著降低大模型Llama-8B在较长序列长度下的响应延迟

受硬件条件限制,团队仅测试了规模较小的模型,例如阿里通义千问系列的Qwen3‑30B和Meta公司的 Llama 3.1‑70B。他们推测:更大规模模型的GPU需求更高,CPU瓶颈带来的影响反倒会减弱;不过与此同时,智能体AI会把上下文序列长度(总词元数)推升至远超他们此前测试达到的长度上限。

“以Anthropic公司的Claude模型为例,序列长度轻松达到50万乃至100万个词元。在智能体AI 时代,平均序列长度只会不断增长。因此我预计,面对未来的工作负载,CPU瓶颈问题将愈发严重。”

——郑义俊

CPU市场库存告急

亚马逊严控CPU资源使用,只是现实世界里CPU资源紧张的信号之一,昆杜与郑义俊的工作也表明,该问题极具现实意义。

英特尔方面,其服务器CPU目前已无对外可售余量,至少到2026年底前,都不再向新客户供货。

美国超威半导体公司则上调业绩预期,将服务器CPU的预测出货量翻倍。

两家芯片设计巨头,ARM与高通均发布了专为加速智能体AI而设计的新型CPU。

值得一提的是,连英伟达也已将Vera列为重点发展项目;Vera是一款基于ARM架构(由ARM公司开发)、面向智能体AI的CPU,隶属于英伟达Vera Rubin平台。

金博尔表示,各种动向都表明AI行业越发重视CPU性能,相关需求激增可视作某种“绝对信号”,CPU 已成为智能体AI系统的核心组成部分。

另一方面,正如此前GPU和内存所遭遇的,CPU市场也很可能出现大范围缺货与价格上涨。

“从某种意义上说,现在的CPU资源已经告急了。看看市场上的各种供给限制吧!库存紧缺甚至已蔓延至消费级市场。英特尔全新的18A制程工艺带动了客户端产品线的业务营收增长,但该企业仍在削减客户端CPU产能,以优先保障服务器CPU生产。我们知道,CPU厂商的投入重心,即是大需求与大利润所在。”

——马特·金博尔

资料来源:


《世界科学》杂志版在售中 欢迎订阅

月刊定价

15元/期

全年订阅价

180元

点击左侧图片或以下方订阅方式选购

方式一

扫描二维码,“杂志铺”(第三方平台)订阅有折扣~

方式二

全国各地邮局订阅 邮发代号:4-263

方式三

机构订阅,请拨打

021-53300839;

021-53300838

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
闹大了!山西大学女生只因食堂打饭给男生打得更多,认为被轻视公然批判,​食堂阿姨委屈发帖回应

闹大了!山西大学女生只因食堂打饭给男生打得更多,认为被轻视公然批判,​食堂阿姨委屈发帖回应

火山詩话
2026-09-12 14:14:12
妻子出轨,丈夫将15公分蜡烛塞进妻子的阴道内

妻子出轨,丈夫将15公分蜡烛塞进妻子的阴道内

胖胖侃咖
2025-04-13 08:00:08
亚运男篮八强定6席!中国男篮赢4分获1号位,韩国17分大胜日本

亚运男篮八强定6席!中国男篮赢4分获1号位,韩国17分大胜日本

乒烧泳球
2026-09-13 20:08:07
华为三折叠新机开售即售罄,各配色及版本均已断货,起售价19999元

华为三折叠新机开售即售罄,各配色及版本均已断货,起售价19999元

鲁中晨报
2026-09-12 16:03:05
全家搬回英国没多久,梅根突然单独回美国,没带哈里和孩子引猜测

全家搬回英国没多久,梅根突然单独回美国,没带哈里和孩子引猜测

东方不败然多多
2026-09-14 09:09:38
全球集体撕破脸!一场针对中国的跨国收割大戏,彻底摊牌了

全球集体撕破脸!一场针对中国的跨国收割大戏,彻底摊牌了

流苏晚晴
2026-09-13 14:13:53
胖东来官宣:今后招人全部“学员性质”,合同四年不续签!这是培养还是变相裁员?

胖东来官宣:今后招人全部“学员性质”,合同四年不续签!这是培养还是变相裁员?

二宝妈妈谈教育
2026-09-14 14:54:43
摸一下胸,拘留5天,图啥?

摸一下胸,拘留5天,图啥?

张晓磊
2026-08-22 11:37:55
5大洲奥运门票全出炉,中国女排世界杯好签,两大主力若回归,门票稳了

5大洲奥运门票全出炉,中国女排世界杯好签,两大主力若回归,门票稳了

章民解说体育
2026-09-14 10:12:07
凌晨战报:连爆大冷中国1胜1负淘汰了世界第8,但5-6惜败世界第25

凌晨战报:连爆大冷中国1胜1负淘汰了世界第8,但5-6惜败世界第25

黄谋仕
2026-09-14 15:13:54
司美格鲁肽: 肝病,拿下!

司美格鲁肽: 肝病,拿下!

医药魔方
2026-09-11 08:01:53
大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

白米饭怎么吃
2026-08-04 20:31:41
65岁徐锦江携妻街头漫步,身高差萌翻众人!怪发妻子抢镜十足

65岁徐锦江携妻街头漫步,身高差萌翻众人!怪发妻子抢镜十足

落雪听梅a
2026-09-07 02:57:10
特朗普爆惊天丑闻!美顶级学者痛批:他有精神病,不适合管理美国

特朗普爆惊天丑闻!美顶级学者痛批:他有精神病,不适合管理美国

乌克兰小静
2026-09-13 07:48:20
马思纯:以前不知道欧豪的好,如今分开8年,才发现他是块宝

马思纯:以前不知道欧豪的好,如今分开8年,才发现他是块宝

乡野小珥
2026-09-13 14:41:46
再这么错下去,中产的崩溃是迟早的事!

再这么错下去,中产的崩溃是迟早的事!

纽约君
2026-09-09 22:01:41
美媒:就算没收美国最富有的400人的全部财富,你依然付不起账单

美媒:就算没收美国最富有的400人的全部财富,你依然付不起账单

麓谷隐士
2026-09-14 00:20:03
失控的屁股

失控的屁股

中产先生
2026-09-09 00:52:15
浙江男生去年考上北大,放弃了!今年又拼了一次,爸爸说当时全家100个反对,网友评价他“清醒到发狠”

浙江男生去年考上北大,放弃了!今年又拼了一次,爸爸说当时全家100个反对,网友评价他“清醒到发狠”

都市快报橙柿互动
2026-09-12 21:29:17
广东一连锁店管理规定出现“公司宪法”引质疑,回应:仅在内部培训使用,律师解读

广东一连锁店管理规定出现“公司宪法”引质疑,回应:仅在内部培训使用,律师解读

潇湘晨报
2026-09-14 12:57:12
2026-09-14 16:23:00
世界科学 incentive-icons
世界科学
《世界科学》编辑部运营账号
1951文章数 26958关注度
往期回顾 全部

科技要闻

记者问AI要不要踩刹车,特朗普先想到中国

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

头条要闻

"卖发动机的Tina"让外国人疯狂 "抽象"视频火遍TikTok

体育要闻

兹维列夫,从三十年0冠到一百天2冠

娱乐要闻

敬一丹去世仅1天,蔡磊实现口碑暴增

财经要闻

蔡昉:农民工落户可释放万亿消费潜力

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

手机
本地
家居
数码
公开课

手机要闻

荣耀Magic9/Pro Max手机规格曝光

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

Bose电视音响II国行发布,2499元

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版