网易首页 > 网易号 > 正文 申请入驻

AMD把AI模型刻进硅片,英伟达的GPU神话还能撑多久?

0
分享至

编者按:好家伙,AMD又出手了。这次不是跟英伟达拼算力,而是直接掀桌子——把AI模型权重蚀刻进硅片,彻底甩掉高带宽内存(HBM)这根拐杖。英伟达去年刚花200亿美元买下Groq,AMD七个月后就掏出一手模型专用集成电路(MSIC),两家巨头在推理芯片赛道上的火药味已经浓到呛鼻子。问题是,这种一锤子买卖的芯片路线,到底是真革命还是一场昂贵的赌博?苏妈这次押的注,可能比收购ZT Systems那49亿美元还要刺激。



48倍碾压:这不是跑分,这是打脸

今年2月,Taalas发布了首款测试芯片HC1,台积电6纳米工艺,不是什么尖端制程,甚至可以说是成熟工艺里的老熟人。但就是这么一块光罩尺寸的芯片,跑起Meta的Llama 3.1 8B模型来,速度飙到每秒16960个token。

16960 token/秒是什么概念?

英伟达Blackwell架构的B200 GPU,跑同型号模型大概每秒350个token。Cerebras的晶圆级加速器,号称数据流架构的颠覆者,也就每秒2000个token左右。Taalas HC1的速度,是英伟达GPU的48倍,是Cerebras的8.5倍。

我的妈呀,这已经不是跑分领先了,这是直接按在地上摩擦。

更离谱的是功耗。传统GPU为了通用性,预留了大量运算单元和调度逻辑,冗余大到离谱。Taalas把模型权重直接刻进掩膜ROM,KV缓存和微调适配器塞进SRAM,整个芯片就两个区域,简单粗暴到让人怀疑人生。结果就是:速度快了几十倍,功耗降到传统方案的十分之一。

十张HC1卡加起来,空气冷却只需要2.5千瓦。英伟达一个DGX机柜的功耗是多少?自己去查吧,反正数字说出来有点伤人。

当然,Llama 3.1 8B以现在的标准看确实不算新模型了,GPT-4o、Claude 3.5、DeepSeek-V3这些怪物随便一个参数都是它的几十倍上百倍。但Taalas自己也说了,HC1只是验证技术概念,今年夏天要推的HC2芯片,单芯片支持参数量直接拉到200亿。

200亿听起来还是不够看?别急。Taalas的方案可以通过流水线并行把权重分布在多个加速器上运行。单芯片200亿参数,50颗加速器就能支持万亿参数级别的大模型。AMD手里恰好有Helios机架级计算平台和内部系统设计团队,这配合打得,简直是量身定制。

相比之下,英伟达刚发布的LPX系统,跑同等规模模型需要数十颗GPU和至少2000颗Groq LPU。空间占用和功耗效率的差距,已经不是一代两代的问题,而是根本性的架构代差。



苏妈的阳谋:不是跟英伟达拼算力,是换赛道

AMD人工智能高级副总裁Vamsi Boppana在声明里说了一句特别有意思的话:AMD正在构建全栈式AI平台,为客户提供灵活性,使其能够为每一项AI工作负载部署最合适的计算解决方案。

翻译成人话就是:老子不跟你在GPU训练赛道上死磕了,推理这块蛋糕,我要用另一种吃法。

英伟达去年12月花200亿美元收购Groq,创下公司史上最大收购纪录。Groq的LPU架构走的是数据流路线,靠极致的片上SRAM和确定性执行来压榨推理性能。结果AMD七个月后掏出的Taalas,路线比Groq还要激进——Groq好歹还是通用加速器,只是针对推理做了深度优化;Taalas直接做成模型专用集成电路,一颗芯片只为一个模型而生。

这就像是,英伟达在造跑车,Groq在造赛车,Taalas直接给F1车手定制了一副义肢——除了这位车手,别人用不了,但用起来就是人车合一。

AMD的计划也很清晰:基于Taalas技术的芯片跟Instinct系列的Helios机架配对,形成分离式架构。计算密集型的提示词处理由GPU负责,token生成任务卸载到Taalas加速器上。另一种玩法是,客户先在Instinct加速器上部署验证模型,确认效果满意后再迁移到Taalas加速器,形成类似tick-tock的迭代节奏。

说白了,AMD在下一盘大棋:训练用Instinct MI系列跟英伟达H100/B200正面刚,推理用Taalas走差异化路线打侧翼。你英伟达GPU是万金油,我AMD给你来个专精怪,各有各的活法。

而且AMD跟OpenAI、Anthropic、Meta这些主流模型厂商的关系一直不差。未来看到GPT或者Claude系列模型部署在Taalas与Instinct混合架构上,真不是什么意外的事。Taalas自己还放话说,把模型权重蚀刻进硅片的成本,比训练前沿模型低100倍。这话听着有点吹牛的成分,但就算打个对折,成本优势依然足够诱人。



致命的阿喀琉斯之踵:模型固化,怎么跟得上AI的更新速度?

好了,吹了这么多,该泼点冷水了。

Taalas这套方案最大的硬伤,也是所有人第一眼就能看出来的问题:模型权重被固化在硅片里,芯片一旦出厂,就没法换模型了。

什么意思?你今天买了块跑Llama 3.1的Taalas芯片,明天Meta发布了Llama 4,不好意思,这块芯片就成了电子垃圾——或者说,至少成了过时的专用设备。任何超出LoRA适配器规模的改动,都需要重新流片。流片一次多少钱?周期多长?业内人都知道,这玩意儿动辄几百万美元起步,周期按月甚至按季度算。

在AI模型几乎每月都有新版本推出的当下,这意味着什么?意味着采用Taalas技术的客户,必须对模型选择有充分把握。你得押注某个模型会在未来一两年里保持竞争力,否则就是血本无归。

Taalas方面的回应是:虽然新模型确实需要重新流片,但无需从头开始,只需更改两层金属层即可,成本和周期都大幅降低。而且他们号称收到未适配的模型后,仅需2个月就能把它落实到硬件上。

2个月?听着挺快。但问题是,AI模型的迭代速度是以周为单位的。OpenAI、Anthropic、Google这些大厂,新模型发布频率越来越高,功能越来越强。2个月的适配周期,意味着你永远是落后半个身位的追赶者。

这就引出了一个更深层的产业焦虑:如果推理芯片被模型版本绑定,那芯片厂商和模型厂商的关系将发生根本性变化。不再是卖通用算力平台,而是变成模型厂商的定制代工厂。AMD收购Taalas,某种程度上也是在赌未来AI模型的收敛速度——赌大模型的架构和权重分布在接下来几年里会趋于稳定,赌专用芯片的生命周期能够覆盖其商业回报周期。

这赌注不小。赌赢了,AMD在推理市场能撕开一道大口子;赌输了,Taalas的技术就成了一个昂贵的技术玩具,好看但不中用。

不过话说回来,Taalas的技术对模型开发方式本身也可能产生反噬效应。开发者近年来通过测试时缩放技术来降低模型幻觉,允许模型在回答前进行更长时间的推理,代价是消耗更多token、成本上升、用户等待时间延长。如果Taalas技术真的能把单token成本大幅降低并将输出速度提升10倍甚至20倍,模型开发商可能会反过来进一步延长推理时间以换取更高的准确性——反正快了这么多,多花点时间推理又何妨?

这就像一个闭环:专用芯片推动推理成本下降→模型开发商敢于用更长的推理链→模型质量提升→用户对专用芯片的需求增加→芯片厂商加大投入。如果这个飞轮转起来了,那Taalas的赌注可能真就押对了。

AMD把AI模型刻进硅片,这事的疯狂程度,不亚于当年乔布斯把键盘从手机上干掉。英伟达的GPU神话建立在通用性和生态壁垒之上,但Taalas正在证明:在推理这个特定场景下,极致的专用化可能比通用性更有杀伤力。

苏妈这次收购的金额没有披露,但Taalas累计融资也就2.19亿美元,AMD拿下它花的钱大概率连英伟达买Groq的零头都不到。花小钱办大事,这很AMD。

但问题是,模型固化芯片这条路,到底能不能走通?2个月的适配周期能不能跟上模型迭代的速度?客户愿不愿意为单一模型押注一颗专用芯片?

这些问题的答案,可能要到明年才能见分晓。不过有一件事是确定的:英伟达现在不能再躺着赚钱了。GPU的护城河,正在被一群疯子用完全不同的逻辑一点点蚕食。

英伟达的GPU神话还能撑多久?也许不是明天崩塌,但裂缝,已经出现了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
卡塞米罗:很高兴赢得了我在迈阿密国际的第一个冠军

卡塞米罗:很高兴赢得了我在迈阿密国际的第一个冠军

懂球帝
2026-09-17 11:17:06
新手海钓钓上2.8斤野生大黄鱼,当晚就吃了,网友算账说这一口上千块

新手海钓钓上2.8斤野生大黄鱼,当晚就吃了,网友算账说这一口上千块

雪饼说
2026-09-14 12:02:34
每体:梅西可以拥有两支俱乐部,但他必须放弃其中一家管理权

每体:梅西可以拥有两支俱乐部,但他必须放弃其中一家管理权

懂球帝
2026-09-17 02:13:13
中秋节买鱼,我只挑这3种鱼,人工无法养殖,好吃不贵上桌有排面

中秋节买鱼,我只挑这3种鱼,人工无法养殖,好吃不贵上桌有排面

花小厨
2026-09-17 11:43:06
敬一丹告别仪式现场:名嘴尼格买提现身,朱军朱迅都在,王宁哭了

敬一丹告别仪式现场:名嘴尼格买提现身,朱军朱迅都在,王宁哭了

娱说瑜悦
2026-09-17 12:56:38
泰国发现新物种“恶魔花”:几乎全黑,已知不到50株

泰国发现新物种“恶魔花”:几乎全黑,已知不到50株

Ping值焦虑
2026-09-16 17:37:44
1975年谭政出狱后还是想不通林彪为何要针对他,徐向前一语道破

1975年谭政出狱后还是想不通林彪为何要针对他,徐向前一语道破

瑾瑜聊情感
2025-06-25 15:17:42
时隔3年美联储重新加息,对我们有什么影响?

时隔3年美联储重新加息,对我们有什么影响?

吴晓波频道
2026-09-17 08:29:36
刚跌回930就炸锅!实验室突然造出860亿金原子,黄金市场要变天

刚跌回930就炸锅!实验室突然造出860亿金原子,黄金市场要变天

咸鱼金脑袋
2026-09-16 20:07:22
历史可能毁于一旦?中国苦心经营40年的战略努力,被蒙古无情摧毁

历史可能毁于一旦?中国苦心经营40年的战略努力,被蒙古无情摧毁

饭小妹说历史
2026-09-16 09:28:59
网传中国第一批高层住宅正集体走向中年危机,多少人瑟瑟发抖…

网传中国第一批高层住宅正集体走向中年危机,多少人瑟瑟发抖…

慧翔百科
2026-09-16 12:09:53
康熙得知索额图被饿死后勃然大怒,下令抄了他的家并除掉他的儿子

康熙得知索额图被饿死后勃然大怒,下令抄了他的家并除掉他的儿子

凉州辞
2026-09-17 10:15:04
王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

王健林这辈子最失败、也最后悔的投资,恐怕就是分别给了王思聪、张艺谋和董明珠每人5个亿

谈史论今1
2026-08-16 20:23:49
《兰香如故》:90% 的人没看懂,林锦岐头上的翠雀花,不仅仅是杜小姐的阴谋!

《兰香如故》:90% 的人没看懂,林锦岐头上的翠雀花,不仅仅是杜小姐的阴谋!

老吴教育课堂
2026-09-17 09:34:13
69岁张瑜将上亿资产,上海江景大平层、北京四合院全都转给外甥,一句我蛮可怜的,格外戳人心

69岁张瑜将上亿资产,上海江景大平层、北京四合院全都转给外甥,一句我蛮可怜的,格外戳人心

背包旅行
2026-09-07 14:55:30
争议升级,孙颖莎亚运会赛程曝光,王励勤被围攻教练组多人受牵连

争议升级,孙颖莎亚运会赛程曝光,王励勤被围攻教练组多人受牵连

岁月轻纱
2026-09-16 23:43:49
网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网络易不易
2026-05-17 12:29:12
今天,四个省“解渴了”

今天,四个省“解渴了”

清沐执笔
2026-09-16 22:29:08
我隐瞒家境去男友家吃饭,主座上坐着大领导,对方抬头看我一眼乐了:丫头,你藏得可够深啊

我隐瞒家境去男友家吃饭,主座上坐着大领导,对方抬头看我一眼乐了:丫头,你藏得可够深啊

晓艾故事汇
2026-09-16 10:48:07
理想i9“掀桌价”36.98万元上市 引i8车主集体破防

理想i9“掀桌价”36.98万元上市 引i8车主集体破防

TechWeb
2026-09-17 10:24:04
2026-09-17 13:59:00
互联网放大镜 incentive-icons
互联网放大镜
科技互联网知名资深媒体人!
1198文章数 2810关注度
往期回顾 全部

数码要闻

微星MEG X 超神显示器首发9599元:34寸曲面带鱼屏 配人体识别传感器

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

头条要闻

倪萍发长文追忆敬一丹:敬大姐 跟你说一声对不起

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

比起敬一丹的退而不休 章伟秋更显明智

财经要闻

缺钱的追觅 隐藏的债务?

科技要闻

赛力斯全面接盘,华为真的“撤”了吗?

汽车要闻

激光雷达+EVA机器人+爆胎稳行 星瑞L PLUS预售限时价11.57万起

态度原创

健康
时尚
艺术
手机
亲子

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

8年没换过|| 每次“垮脸”都靠它救,这笔小投资已值回本

艺术要闻

257米!“中国第一县市” 的最高楼,楼顶招牌引争议?

手机要闻

苹果防诈骗升级!iOS27 新增冒充风险检测,专克各种冒充诈骗

亲子要闻

惹事包又打翻牛奶了~看着他手足无措的小表情,到底该先安慰还是先批评呢?

无障碍浏览 进入关怀版