![]()
在云栖大会上,阿里巴巴集团CEO吴泳铭发布新一代真武V900,并称其为当前中国算力性能最强的AI芯片,性能达到M890的3倍。仅隔一天,平头哥又公布了AI软件栈T-Head SAIL的最新开源进展,进一步扩大框架适配、加速库、工具链和通信库的开放范围。
表面上看,这是一次“硬件发布+软件开源”的组合动作;更深一层看,它释放出一个明确信号:国产AI芯片的竞争,正在从单颗芯片的峰值算力,转向软件生态、开发者迁移和全栈协同能力的比拼。对大厂造芯而言,交付芯片只是起点,能否让客户把已有代码、工具和经验带过来,并愿意留下来共同开发,才是决定市场空间的关键。
算力峰值不是终点,迁移成本才是第一道门槛
真武V900的发布,把平头哥的硬件能力推到了聚光灯下。但对真正考虑换用真武的客户来说,第一件要确认的事并不是峰值算力有多高,而是过去多年积累的模型代码、训练框架、调优工具和团队经验,能不能平滑迁移。
这正是T-Head SAIL要解决的问题。它承担的是类似CUDA的角色:向下连接真武硬件,向上对接PyTorch等主流AI框架,负责模型迁移、编译执行、计算加速和开发调试。今年7月WAIC上,平头哥已启动SAIL开源,向开发者提供SDK、驱动、性能分析与调试工具以及技术文档。两个多月后的云栖大会,开源范围进一步扩大,已覆盖PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等计算加速项目。
这些工具回应的,是开发者最现实的三个问题:迁移成本有多大、模型跑起来后性能能不能继续优化、新模型发布后能否尽快甚至Day 0可用。尤其是在模型几周一更新的节奏下,如果适配慢一轮,业务团队尝试新技术的时间就会整体后移。平头哥披露,其在ModelScope上已提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次;TensorFlow、JAX适配版本、自研推理引擎以及PCCL、DeepEP-for-sail等通信组件和调试监控工具也在推进开源。
对国产算力而言,迁移成本往往是替代过程中最大的摩擦。芯片性能再强,如果客户需要重写大量代码、重新培养工具链习惯,实际落地就会被拖慢。SAIL开源的意义,首先是把“换芯片”从一次推倒重来,变成一次可管理的工程迁移。
把性能优化权交给开发者,生态才会真正转动
迁移跑通,只是第一步。如果换用新芯片后效率只剩原来的30%到40%,即便模型能运行,真实业务也很难接受。因此,开发者接下来一定会追问:同一个模型,能不能跑得更快?资源能不能更省?
这时候,仅靠芯片厂商把工具做好已经不够。DeepGEMM-for-sail、FlashAttention-for-sail等加速项目开源后,开发者不只可以下载现成工具,还能看到内部实现,并根据自己的模型结构和业务负载继续修改。过去需要交回芯片厂商定位的问题,现在业务团队有机会自己分析、自己优化。更了解模型的人,可以直接参与决定模型怎样在芯片上运行。
这种变化已经在客户实践中出现。小鹏借助SAIL,将原先运行在GPU平台上的业务模型迁到真武云端集群,开展智能驾驶模型训练,并利用性能分析工具定位训练瓶颈,围绕算子和框架继续优化。SAIL支持C++、Triton、TileLang等开发方式,降低了团队重新学习的负担。蚂蚁集团推理服务团队则基于SAIL,在真武810E和M890上完成主要前沿模型的推理适配,并继续推进量化、推理阶段分离、专家并行负载均衡、稀疏注意力接入等工作。小红书走得更远,基于SAIL开源代码开发了模型迁移与算子优化Agent,以自动化方式加速生成式推荐模型在真武上的部署。
这里还涉及一个长期矛盾:客户希望针对芯片开发高性能算子,但又需要保护自己的算法和知识产权。算法细节不方便完全交给芯片厂商,而芯片厂商又需要理解这些细节才能代为优化。开放软件代码和硬件架构信息后,客户有条件自己完成这项工作:核心业务逻辑留在内部,团队根据公开硬件信息编写定制算子,再检查和调整软件实现。
平头哥为此建立了贡献流程:开发者可以提出问题、修改代码、提交贡献,经过自动化测试和维护者、社区评审后合入主线,并随版本发布。据了解,SAIL开源后,已有阿里内部和外部客户提交代码贡献。这意味着,SAIL不再只是一个软件下载入口,而是在尝试形成“厂商提供基础能力、客户注入业务经验、社区反向贡献”的生态飞轮。
为什么是现在?客户规模与长期维护账共同推动
理解平头哥此时扩大开放,需要回到芯片本身。只有足够多的人拿到硬件、用进业务,适配和优化需求才会真正出现。
从2019年的含光800,到2021年的倚天710,再到如今的真武系列,平头哥走了多年。其路径相对清晰:从业务需求出发设计芯片,先在阿里内部验证,再通过云服务外部客户。淘宝、搜索、推荐、广告等业务承担了早期生产验证角色,经过实际流量和集群稳定性考验后,产品再逐步向外推广。外部客户接触新芯片时,常会先确认一件事:阿里自己用过没有?到真武M890阶段,平头哥已完成两代完整芯片交付。
目前,真武AI芯片已服务20多个行业的650多家客户,蚂蚁、小红书、小鹏汽车等头部企业已经开始使用T-Head SAIL。客户规模扩大,意味着产品得到验证,也意味着厂商要面对越来越多不同的问题。汽车企业训练模型,互联网企业优化推荐,模型团队尝试新算法,各自的计算方式和性能瓶颈并不相同。同一套基础软件之上,还会有大量贴近具体业务的开发。客户越多,把这些工作全部留给芯片厂商就越难持续。
此外,还有一笔长期维护账。芯片厂商基于主流框架做适配,通常需要修改部分代码。如果长期维护独立版本,上游每次更新,都要重新同步、处理差异、测试验证。独立版本与上游分开时间越长,维护负担越重。把适配和优化提交回PyTorch、vLLM、Triton等上游社区,是为了让真武支持能够随主流软件一起演进,也减少重复维护,把精力腾出来支持更多模型和业务。
当然,开放之后,厂商的工作并未减少。原先统一发布的软件包拆成多个独立组件,需要新的检查和测试安排;社区提交的改动,也需要有人评审、维护并对质量负责。开放能扩大参与范围,也要求平头哥建立长期协作能力。这既是生态建设的门槛,也是国产算力从“可用”走向“好用”的必经阶段。
从芯片到AI云,国产算力需要全栈协同
再把视线拉远,SAIL的选择与阿里整体AI布局紧密相连。吴泳铭已明确提出,阿里将长期投入AI模型、AI芯片和AI云。早在2025年2月,阿里就宣布三年内至少投入3800亿元建设云和AI基础设施,随后又提出将进一步增加投入。模型带来新的算法、计算精度和并行需求,芯片提供计算、内存和互联能力,SAIL则通过编译器、算子库和通信库,让模型需求在硬件上落地,再由云将整套计算能力组织成服务交付给用户。
这层软件能否及时跟上,直接影响新模型多快能用上硬件性能,也影响云上业务的运行效率。平头哥正在与千问团队合作,探索让模型生成高性能算子。生成功能正确的代码相对容易,要让它充分发挥芯片性能,还需要模型理解底层架构。但千问的需求无法覆盖所有行业,小红书的生成式推荐、小鹏的智能驾驶训练,各有自己的模型、数据和优化目标。SAIL进一步开放,就是让这些团队也能参与连接模型与硬件的软件开发,把业务理解转化为具体实现。
对通信行业而言,这一变化同样值得关注。随着智算中心、算力网络和云网融合持续推进,AI芯片不再只是服务器里的器件,而是算力底座的一部分。芯片软件栈的开放程度,会影响异构算力调度、行业模型部署和边缘推理的效率。国产算力要进入通信、汽车、互联网等真实场景,既需要硬件性能,也需要主流框架兼容、上游社区协同和开发者迁移便利。
从全球竞争看,英伟达的真正护城河从来不只是GPU峰值,而是CUDA多年积累的开发者生态、库和工具链。国产AI芯片要缩小差距,不能只靠单点参数追赶,更要在框架适配、算子开发、通信库、调优工具和社区治理上形成持续演进能力。平头哥此次扩大SAIL开源,本质上是在把“芯片交付”推进到“生态共建”。
SAIL的全称是Seed of AI Library。每一行开源代码,都是一颗种子。芯片已经进入真实业务,接下来要看的,是这些种子能否在更多开发者手里,长出平头哥未曾预设的工具、优化和应用。国产算力的下一阶段竞争,也将不只是比谁的芯片更强,而是比谁能把开发者、客户、上游社区和云服务组织成更紧密的生态。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.