高通在骁龙峰会前连续放了三轮料,CPU、GPU、NPU各一篇。今天,把这三块拼到一起看,会发现这代平台的升级逻辑和以前不太一样了——不是某个模块单独猛堆参数,而是三大引擎围绕AI智能体这个场景重新分工了。
应对内存挑战
根据高通最新放出的NPU相关信息,全新的Hexagon NPU有两个核心创新。第一个是Element Accelerator,专门为Transformer工作负载打造。它结合了向量计算单元和标量计算单元,加速大模型中最关键的运算。要知道现在的大语言模型本质上都是Transformer架构,所以这个新单元理论上可以让这类模型在手机上跑得更快、更省电。
![]()
第二个是大容量共享内存扩容50%。大语言模型推理时需要维护一个叫KV-cache的东西,用来保存之前的对话上下文。以前这个缓存经常要往系统内存里倒腾,现在扩容后可以更多地留在NPU内部,减少DDR访问次数,延迟降了,也给其他任务腾出了内存带宽。
高通给出的数据是,INT4模型预填充速度提升50%,首个词元生成时间低于1.5秒。预填充速度决定了AI读懂你的问题和上下文有多快。这样的提升表现,基本就是你刚问完它就开始答了。
值得关注的是,高通正在和内存、模型厂商合作,试图把300亿参数规模的MoE模型搬上手机。要知道现在手机的DDR内存根本装不下300亿参数的模型。高通的解法是——模型存在闪存里,需要哪个就加载哪个。
![]()
MoE模型的特点是,虽然总参数有300亿,但每次生成一个词元时,只激活其中被路由选中的约30亿参数。配合闪存到内存的智能加载管理机制,就能以低功耗、低内存占用的方式,获得数百亿参数模型的能力。
这件事的意义在于,端侧AI的天花板被大幅抬高了。以前手机上跑个70亿参数模型就已经很吃力,现在300亿参数级别的体验成为可能。模型越大,推理和规划能力越强,智能体才能真正干复杂的活。
此外,新NPU支持从INT2、INT4、INT8到FP8、FP16的全精度范围,开发者可以根据任务需求在性能、内存、模型质量和功耗之间灵活取舍。
CPU、GPU都是算力的一部分
CPU方面,新平台引入了Oryon FlexCache架构。传统CPU的缓存是每个核心固定分配,大核用大核的,小核用小核的。FlexCache让所有核心共享一个动态缓存池,高负载任务跑在大核上时可以几乎占用整个缓存池,任务在核心间切换时数据也不用重新加载。
因为智能体不是跑一个单一任务,它要频繁地在线程之间迁移,调用运行在不同核心上的工具。如果每次切换都要重新从内存读数据,响应速度就垮了。FlexCache让智能体在跑高负载任务的同时不会降低响应速度。
![]()
新一代Adreno GPU也有一个重要的硬件变化,即首次加入Adreno Matrix Cores。Matrix Cores是GPU里专门的AI加速核心。加上它之后,高通平台里NPU、CPU、GPU三个引擎全都具备了Matrix加速能力——AI不再是NPU一个模块的事,而是整个平台的基础能力。
![]()
基于Matrix Cores推出的Adreno Neural Fusion,把AI超分辨率和AI帧生成直接做进了GPU图形管线,不用再把数据搬到NPU处理。对游戏来说,这意味着更低的功耗、更少的画面伪影、更稳的帧率。高通内部demo数据显示功耗可降低40%。
放在智能体场景下,GPU也不只是负责画面。当多个模型同时在终端侧运行时,Hexagon NPU和Adreno GPU会共同承担AI推理任务。GPU的Matrix Cores在这里也派上了用场,不是NPU的替补,而是协同算力的一部分。
AI成了芯片底色
把CPU、NPU、GPU放到一起,这代平台的智能体工作流是这样的:传感器中枢(Sensing Hub)始终保持低功耗的环境语音感知,收到下达指令后,Oryon CPU被唤醒,负责理解意图、拆解任务、规划工作流。如果某个步骤需要调用云端API,CPU负责调度路由。如果是端侧就能搞定的推理,CPU决定交给谁。
Hexagon NPU是推理主力,大语言模型、图像理解这些主要靠它。300亿参数MoE模型的支持让它能处理更复杂的规划和推理。Adreno GPU一方面负责渲染画面(比如游戏、视频),另一方面在多模型并发场景下和NPU一起分担AI推理。
![]()
整个过程中,FlexCache让CPU调度不卡顿,HPM和NPU共享内存让数据尽量留在芯片内部,减少对DDR的依赖。高通反复提到内存资源是行业挑战,这代平台的几乎每一项创新都在围绕减少内存访问做文章。
不难发现,以前每代升级,大家最关心的是安兔兔跑分涨了多少、CPU多核性能提升百分之几。这代平台虽然也有5GHz、GPU频率提升这些硬参数,但高通花了更多篇幅讲的是——CPU怎么编排任务、NPU怎么跑大模型、GPU怎么参与AI推理、三者怎么协同。
至少从目前披露的信息来看,高通的思路很明确:AI不再是某个功能,而是整个芯片的底层工作方式。9月22日到24日,夏威夷骁龙峰会,新平台会正式发布。到时候具体的性能增幅、实际演示效果,以及首批合作的游戏和应用名单都会揭晓。这代骁龙不是为跑分而生的,它是为智能体而生的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.