网易首页 > 网易号 > 正文 申请入驻

推理芯片之战:聊聊Groq、Cerebras与OpenAI三大路径与Bill Dally的设计哲学

0
分享至

文 | 硅谷101

AI芯片初创公司Groq达成技术授权协议,并吸纳其创始人Jonathan Ross等核心团队,被外界视为一次变相收购(acqui-hire);做晶圆级“大芯片”的Cerebras今年6月IPO,市值达到670亿美元;OpenAI联手博通,推出了首款自研推理芯片Jalapeño,从设计到流片仅用了9个月——加上我们之前聊过的谷歌TPU,推理芯片牌桌上的玩家越来越多。

这场推理芯片大战中,各家真正比拼的是什么?为什么走向了不同的技术路径?推理芯片未来又会向什么方向收敛?


本期硅谷101,我们请来两位AI芯片创业者,逐一拆解这些热门推理芯片在技术路径上的取舍与得失。其中嘉宾Mark是英伟达首席科学家Bill Dally的学生。Bill Dally是现代GPU并行架构最重要的奠基者之一。我们也借由Mark的视角,去了解这位芯片大师是如何思考问题和看待创新的。

以下是这次对话内容的精选:

泓君:今天跟我在一起的两位嘉宾,一位是负责推理芯片的硬件还有系统架构的Mark,还有一位是负责软件和编译器方向的子扬。大家要不要跟听众介绍一下,训练和推理对芯片的要求有什么不同?为什么可能需要两种不一样的芯片?

Mark:从成本角度看,这是商业模式决定的。训练本身没有直接回报,所以大家计算训练成本时,其实是在赌一个最强训练集群,做出最强模型,再靠未来推理把训练投入收回来。

但推理在商业上很容易算账:用户愿意为每100万个token付多少钱,我推理出这100万token要花多少成本。成本包括买GPU、消耗电等。所以推理追求的是性价比,而不是极致性能,会把成本更多考虑进来。

比较有意思的是计算密度,英文叫“arithmetic intensity”,它的缩写正好也是“AI”。训练时有海量数据,有足够并行度,可以把多余算力充分利用起来。但推理时,语言模型被认为是一个强逻辑过程,逻辑需要一定顺序完成。

所以语言模型token生产的过程,在推理里是严格意义上的线性的、或者说是严格意义上自回归的。我必须先知道当前token推出来的结果,再把它作为输入喂给模型,它才能告诉我下一个token是什么。

推理分两个阶段:prefill(预填充)阶段,有很多token可以并行处理;但decode(解码)真正产生token时,必须一个一个生成。而每生成一个token,都要把整个模型(比如1.6T参数的模型),从存储介质读到计算单元里。所以推理,尤其decode阶段,对算力和带宽的需求发生了本质变化。

泓君:我可不可以理解成,GPU在训练部分核心解决算力,在推理部分核心解决内存带宽?

徐子扬:更准确地说,训练和推理的prefill阶段,所有token都是已知的,可以用大量并行度,读取一次数据后同时做很多计算。GPU硬件本身,需要你同时做大量运算,才能把它的硬件资源用满。在这个比例下,带宽其实是不足的。

泓君:给听众一个更形象的例子吧。比如我给大模型一个问题,让它出一个采访提纲。用户把提示词输进去,它开始推理、写提纲,会用到多少GPU或推理芯片?用GPU和用专业推理芯片,在延迟、成本上有什么不同?

Mark:prefill阶段有充足并行度,只要把模型从GPU的HBM(高带宽存储器)里读到计算单元一次,就可以把你喂给它的东西同时处理完。这可以带来足够并行度,让GPU充分利用算力。

但到了decode这块,比如它要说“好的,下面是我为你准备的一份采访提纲”,这句话里每一个token、每一个词,都意味着你要把模型从存储介质里读上来一遍。读取模型次数上,大家可以清楚感受到:是一句话读一次,还是一个词读一次,读的量都是整个模型权重。

GPU不能接受把模型从HBM读到计算单元后,就只处理一个用户的token。所以它真正做的是batching(批量化处理)。它要收集1万个用户不同的推理任务,并行地把这1万个用户里的第一个词、第二个词、第三个词一起推理出来。所以从用户角度会感受到:为什么我这里推一个token这么慢?因为用GPU做这件事,你不光在等GPU推理你自己这一个token,还在等同一批里其他9999个用户的token。

GPU这种大算力密度,用HBM提供非常昂贵的带宽,导致用户体验上,不管Agent场景还是reasoning自己思考的场景,推理速度都有比较强的限制。

泓君:那如果用推理芯片呢?

Mark:推理芯片是一个非常泛的词,分太多种了。推理本身也足够复杂,分为prefill、decode;decode里因为模型不同,还分attention、FFN。

我们认为,未来理想的推理系统可能包含很多种不同芯片,能把实际decode token这个过程做得足够便宜、足够快。这可能是需要打破GPU传统架构,做更有针对性的新架构,以及使用不同于HBM的其他介质的意义所在。


泓君:从现在市面上这些说自己做推理芯片的公司来看,你觉得做得最好的是哪家?Groq怎么样?

Mark:Groq、Cerebras都在这条技术路线上。我觉得大家看到了正确的问题,它们确实已经把东西做出来,而且像Groq现在和英伟达配合的关系,确实是我们设想中比较理想的状态:GPU处理哪一部分任务,然后Groq处理哪一部分任务。

所以在大的方向上,尤其英伟达收购Groq之后,更好地做异构推理系统这个角度来讲,其实我现在是比较看好Groq的这条技术路线。


Groq LPU推理卡 图片来源:Groq

泓君:可以展开聊一下吗?

Mark:我觉得最关键两个点,第一,怎么提供高性价比带宽。包括我们最初想做现在这个项目,也是因为看中了有远比HBM要好两三个数量级、带宽性价比更高的介质。

这种介质的关键不在介质本身,而在于你要关注局部性的问题。你要提供比HBM更高一层的局部性。HBM是把存储和计算放到一个封装里,所以它的带宽能做到很高。但我们希望把局部性提升到下一层:把存储直接放到计算芯片里面。

带宽的核心是连线的密度及频率。当你把线从封装走线,变成计算芯片内部光刻出来的线,这两种线,在密度、成本、包括能耗上面,都有本质差别。

如果有些介质能让我把模型权重放到计算单元或计算芯片上,那就是质的提升。这是解决带宽问题最本质的方法。而SRAM(静态随机存取存储器)只是刚好目前阶段最成熟、最可靠、可以让你有机会把存储放到计算芯片里的一个方式。

泓君:现在Groq是这种方式吗?我知道你们要走这样的方式。

Mark:是,Groq也是这种方式。另一个关键点是“异构”。我觉得Groq比Cerebras稍好一点,就在于它和GPU可以更好地结合起来。因为推理不是钢板一块,里面有算力密集的部分,那部分GPU做得也很好。如果你未来的系统能把异构这个点做得比较极致,那么在芯片以外的系统层次,我觉得会有更大优势。

徐子扬:刚刚的讨论,都是围绕着云端的推理芯片。推理芯片是一个巨大市场,云端的、边侧的,大家各有侧重。大家都要获得相对低廉的带宽。但端侧有物理空间上、功耗上的限制,这就导致了在端侧上面,我们可能还会看到其他一些思路,比如3D DRAM(三维动态随机存取存储器)。其实很多思路都在提供更高、更便宜的带宽,包括所有HB开头的词,HBM、HBF……都是想把原先的介质做到更高的带宽。

泓君:我先花一点时间解释一下我们这期要频繁提到的三个词:SRAM、DRAM还有HBM。最简单的理解方式就是,它们都是存储数据的地方,但是区别就是说,离干活的地方有多远。

DRAM是你电脑里面的内存条,它能装很多,但是离得远,来回取数据要花时间。

HBM,它是把DRAM搬到了计算芯片的旁边,而且还开了很多条通道,所以它的容量大,速度也快,现在英伟达的高端GPU用的就是它。那它的代价是什么呢?就是贵,而且全球的产能非常紧张。

SRAM不一样,它可以直接做在计算芯片里面,所以它其实是最快的方案,快很多,但是它有一个致命的缺点,就是太占地方。存同样多的数据,SRAM需要的芯片面积是DRAM的几十倍、上百倍。

所以我们总结一下就是说,DRAM它的方向是便宜,但是慢;HBM快,但是贵,而且抢不到货;SRAM最快,但是它装不下。

徐子扬:在云端场景,对整个系统铺多大,没那么大限制,只要它能给我们提供足够吞吐。我们会从更本质的角度考虑:什么样的物理介质能提供最密的连线和最高带宽?我们找到的是SRAM。

Groq和Cerebras这两家公司,本质上它们的速度和可能的性价比都来自于SRAM,尽管它们没有着重强调这一点。其他一些美国AI推理芯片创业公司,包括d-Matrix、MatX,也在往SRAM方向走。并且谷歌TPU、亚马逊Trainium,如果我们去看现在所有发布的芯片,每一代SRAM都是变得越来越大的。

SRAM和现有的其他存储介质相比,从带宽角度,无论绝对数量,还是每块钱能买到的性价比,都非常高。所以我们能看到,大家都在往这个方向收敛。


泓君:可不可以一句话总结Cerebras?它相当于在一个巨大晶圆上做一整块的芯片设计。它的优点是什么,缺点是什么?和Groq相比,它的优劣势和trade-off是什么?

Mark:我觉得可以以一个更统一的视角,去看大家做的这些事情。以Cerebras和Groq为例,它们在Transformer出来之前,就预见到未来可能有一部分AI系统对带宽有非常大需求。大家都经历了同样的思考过程:怎么把带宽做得更便宜、更高,最后发现SRAM是比较好的介质。

但做这件事有trade-off。你要跳出local minimum(局部最优),就要损失一点东西。SRAM损失的是单芯片容量。DRAM是一个晶体管加一个电容存一个比特;SRAM需要六个晶体管,所以存储一个比特的代价更高,一个芯片上能做的容量会变得很低,可能比HBM要低两个数量级。

大家都发现了这一点,怎么提升容量呢?最简单直接的就是,你要把系统做得更大,做几百个、几千个芯片,单纯就为了把所有模型权重都放到六个晶体管的SRAM里。放是都能放下,只要系统够大。但问题在于,先放下了,如果它就在里面存着,并不能产生token。你得用另一种方式把它读出来,并且做有效的计算。

这时候大家会发现,当你系统足够大之后,很多计算或整个系统效率的瓶颈就卡在通信上。大家的思维实验其实都做到了这一步。这时候Cerebras和Groq开始分歧了,大家用了两条不同技术路线,来解决大集群通信调度问题。

Groq的思路是:实际调度如果放在运行时做,开销往往会很大,它希望把调度放在运行之前,也就是编译器这个时间点,把未来芯片系统里可能做的所有计算、通信都想明白了。哪个使用周期做什么计算,哪个周期开始通信,都排布好之后,实际运行时就没有调度问题了。这某种程度上缓解了集群变大之后调度成为瓶颈的问题。

Cerebras更简单粗暴:之所以集群通信有代价,是因为一个柜子里几百个芯片,大家总是有物理距离的。那如果把一个柜子的事情塞到一个大的wafer(晶圆)上,那物理距离、线的带宽,自然都会变得更好一些。

但在我们看来,他们在做各自技术决策的时间点,没有足够信息来支撑他们来判断未来具体需要面向哪样的workload来优化,因为那时Transformer还没出来。

Cerebras最后可能面临的大挑战,是如何控制整个wafer的良率以及成本;Groq则是在做出“依靠编译器做完全静态调度和编译”这个选项时,没有办法预先知道现在语言模型Transformer推理里有如此大的动态性,比如MoE(混合专家模型)的产生,这与它当时的技术选择并不那么匹配。

泓君:可以详细解释一下吗?

徐子扬:MoE这样一个网络有非常多的专家。每一个token在推理时,会去激活专家里的一小部分,这一小部分是在运行时决定的,随着不同的token在选择,比如在128个专家里选8个,这件事你没有办法在编译时预测。

现在的单颗SRAM是没有办法把整个网络都放进去的,一定会出现有些专家在一部分芯片上。这里就有调度问题:我要把这样的token送到哪一颗芯片上?这本身有一定的动态性。

如果想用一个静态的方式解决这个动态性,一种思路是,我非常保守,我把它都送过去,那有些芯片就在空转。另一种解决方式是换一种方法切模型。我们推演过,如果不用专家去切分这个模型,现在这个模型的大小很难用其他的几个维度把它切得很干净、很高效。所以这个动态性就变成了它的静态调度的很大问题。

泓君:我印象中MoE是在DeepSeek发布后变得非常主流,引起大家强烈关注的。但英伟达acqui-hireGroq是在2025年底,它应该也能看到这些问题。它当时为什么会做出“收购”的决策?大家有没有一些相关的消息跟推理?

徐子扬:用一个保守的思路去想,它会有一些芯片空转,但这只影响性价比,不影响我能做到很快这件事。现在市场对Groq和Cerebras的定位其实就是快,性价比没有被拿到台前那么多讨论。现在整个商业逻辑是这样的:如果我做推理比别人快几倍,比如我现在是100 token每秒,但是拿Cerebras能做到750甚至2000 token每秒,那我可以为此付很多溢价。

SRAM和HBM相比,性价比有两到三个数量级优势。所以我们在做整个系统时,其实可以浪费掉一个数量级。牺牲掉的就是它为了解决MoE去做技术上的一个trade-off。从带宽角度来说,性价比还是更高的。

Mark:从商业的角度来讲,别人如果愿意为更快买单,你不会主动告诉别人,你的成本其实是更便宜的。

泓君:所以Cerebras跟Groq,谁更贵?

Mark:我认为是Cerebras。

泓君:Groq创始人Jonathan Ross,也是谷歌TPU的核心设计者之一。他在设计这两套架构时,核心关注点有什么区别?

徐子扬:整个Groq的思路是围绕着编译器发生的。因为Jonathan Ross本身也是编译器团队的leader。他出来做这件事的思路,就是把确定性编译做好,然后围绕这个编译去设计硬件。所以就从静态编译和静态调度出发重新设计了硬件。

刚刚说的静态调度是一点,还有另外一点是determinism(确定性)。比如我们从存储介质里面把东西读出来,是100纳秒后出来,还是300纳秒后出来,会有一个抖动。这个抖动在DRAM中更明显。当它用了SRAM,再加上芯片设计,它其实是把确定性做到极致,也把静态时钟同步做到极致。这一切都围绕着:最后我能在编译器看到整个系统,并为它做这么样一个排布。

但是,他创业的时间点,有一些特性。2016年Groq成立,最开始想做很多图像、语音,但他们一直想做推理。在那个时代,模型和今天Transformer、MoE出来以后是不一样的。包括一些动态性,在那个时间点和今天,它的需求是不一样的。


泓君:我们刚讲到,Groq和Cerebras都有一些时代局限性在里面。它们创业的时间点,生成式AI和大模型还没出来,深度学习在整个业界是一个比较主流的方向,但是不是以Transformer为主,我们不知道。像Groq,当时也无法预测未来会和MoE有一点不匹配。

那Cerebras为什么成本比Groq还高?它从创业到现在,将近9到10年后,又站到了大家关注的焦点上。你们觉得在这中间它调整了什么?做对了什么?

Mark:我为什么刚刚第一反应是它的成本会比Groq高。首先,从技术路线讲,它需要以整个晶圆的规模去生产它的产品。这会遇到芯片生产过程中非常关键的一个参数——良率。

传统上,比如现在设计芯片,单芯片尺寸极限差不多800mm²,一个晶圆上可以切出40个类似芯片。良率会影响切出来的芯片有多少是好的。如果没有做任何partial good的设计,良率50%,可能就切出20个好的。

但如果单一产品尺寸就是整个wafer,Cerebras会做很多事情在于,我接受芯片上30%的单元都是坏的,仍然让产品能用。但这时候仍然和大概率40%、50%都是坏的这个良率是不匹配的。而且一旦整个晶圆达不到良率的需求,整个晶圆就作废了。这意味着,你要制造出一个成功的晶圆级产品,成本是非常非常高的。


Cerebras WSE-3晶圆级芯片 图片来源:Cerebras

徐子扬:除了良率,Cerebras还有一个问题,整个系统要为这个和其他芯片完全不一样的设计做改变。比如软件上,整个晶圆上可能有几十万个小core,坏了哪些部分能绕过去;如果坏在关键部分怎么办?这些事情之前都没有针对这样一个系统研究过,所以它首先要解决软件问题。还有你这个系统要怎么插到机柜里,也有一些额外事情,它都要自己解决,因为它可能是现在唯一一个比较有名的晶圆级生产商。

Mark:这个问题非常非常复杂,我们要捋一下逻辑。当我们说实际成本的时候,大家最关心的是token成本。token成本,我们强调了很多带宽成本,因为每推一次token,意味着要把整个模型从存储介质,比如从SRAM里读上来。

但回到数据中心本质的成本,其实有两部分:采购系统的成本,以及实际运行中的电费、能源消耗。Cerebras由于良率导致的成本高,都是它的硬件那部分成本高。这部分某种程度上摊薄了它能在实际带宽上获得的收益。比如,如果是简单的芯片,没有良率问题,可能单芯片成本可以做到英伟达的1/10,带宽做到10倍,就像Groq这种形态。但如果制造部分成本太高,很可能是10倍英伟达的带宽,但3倍HBM的成本,那带宽实际性价比就要打折扣。

这其实类似Groq要为它的确定性打一个折扣,Cerebras要为它复杂的良率成本打一个折扣,最终折扣都要打到token成本上。


泓君:英伟达为什么要花200亿去acqui-hire Groq?它最看重的点是什么?

Mark:这也很直接明了,我和Bill Dally(英伟达首席科学家)聊很多技术需求时,会发现GPU这个架构没有办法很好解决推理带来的新的大带宽的需求。我觉得从NVIDIA角度,它也有一些大公司的问题,尤其是在技术架构上。比如CUDA,既是一个很强的护城河,同时某种程度上也是创新的一个包袱。

我觉得Jensen很清楚,未来推理里,算力不一定是唯一的关键,需要补充带宽方面的技术能力。综合各种原因,acqui-hire一个有这种能力的公司,是非常好的决定。


Groq3 LPX机柜2026年8月,英伟达宣布该机架已全面投产 图片来源:NVIDIA

泓君:英伟达其实也是可以从内部做的,但很难吗?

Mark:Bill在NVIDIA Research,他们其实会做非常多架构层面创新,而且很早就开始做。比如围绕CGRA也发表了很多论文。但是在一个成熟的公司里,把一个研究想法颠覆式地推给产品团队,难度非常大。即使是英伟达这样的公司,也很难在内部推动,不如干脆acqui-hire一个和之前团队没什么关系的新技术团队。

泓君:我们之前说英伟达有一个很大的护城河,就是CUDA的体系。现在做推理芯片,或者做芯片,有多大程度可以绕过CUDA,或者说建立一套全行业通用的软件体系?

徐子扬:从推理芯片角度,绕过CUDA是百分百会发生的。事实上,我们去看几家大厂的推理芯片,比如TPU、Trainium,都没有一丁点说要兼容CUDA。

泓君:但大家依然会觉得TPU软件系统难用。为什么Anthropic能大量采购TPU?我听到一个说法,因为它有很多工程师是谷歌过去的,知道JAX怎么用。但如果让一个从没做过软件编译器的工程师做这些事情,大家还是觉得难。TPU在软件层还是一个黑盒,除非谷歌自己的人来做。

徐子扬:它只要不是“非常多个”难的问题,如果只是“一个”难的问题,我只要把Transformer里所有算子都在新芯片上写出来,那我Transformer就能跑了,商业逻辑就通了。另外有了AI加持,现在针对算子和整个运行时的开发,其实大大加速了。

泓君:我先说一个结论,大家认为推理芯片绕过CUDA是一定的事情。

Mark:对,我想说一下原理。比如用TPU软件、AWS软件,包括华为软件,其实很难用,这一点我不否认。核心点在于,在训练时代和推理时代,大家“为软件好用买单”的意愿,相比于“愿意为绝对token成本降低买单”的意愿,发生了本质变化。有些软件很难用,但如果难用能带来更好性能、更好性价比,在推理时代,大家天平会更多往性能、性价比倾斜。

以至于我们看到很多已有的做法,比如DeepSeek,虽然它用GPU芯片,但其实它更愿意直接去写很底层的PTX汇编代码,做很底层的优化。这就是为什么我们认为推理时代CUDA一定会被绕过。

泓君:我们一直在说成本。现在看Groq、Cerebras,还有你们未来做的芯片,性能跟性价比相比现在市场主流芯片(比如GPU),大概是什么量级?

Mark:从很多原理分析角度,我们认为未来更理想的推理系统,有机会在速度上做到比现在GPU,或者以通用AI芯片GPU、HBM这种架构,至少两到三个数量级提升,从几十token每秒,到一千甚至一万token每秒,这是单用户推理速度的提升;以及10倍左右性价比提升。


泓君:你们怎么判断一个推理芯片好不好?评价框架是什么?比如每个token产出的成本、推理速度、每个token耗电量、芯片算力利用率,以及软件和编译器,哪些方向是重要的?

Mark:我觉得在推理时代,前三个是重要的:成本、速度、耗电量。第四个(利用率)会影响第一个(成本)。但是最终大家关心的肯定是成本。

因为我们看未来整个系统是异构的,所以对一个芯片来说,不能单纯地从它的算力、带宽、容量让大家对整个系统产生一个综合的认知。未来衡量芯片好坏,一定要在系统层次衡量。

徐子扬:要再强调,我们在说的是云端AI推理芯片。如果是一个盒子,或放在手机上的芯片,每个token成本并不是最重要的。端侧最重要的可能是我最多花100美元买这个芯片,这100美元能达到某一个速度的推理,东西就能卖出去。所以端侧AI芯片考虑的是完全另一件事。

但从云端考虑,最终成本会被分解到每个token成本。所以第一优先级考虑token生产成本,第二优先级考虑速度。速度是未来非常重要、很核心的AI Infra指标。再往后是用电量,在云端角度,今天总持有成本(TCO)里用电量在整个比例里头是较小的那一端。

Mark:国内和美国这一点上有比较大的区别。国内我们了解到,大概是1/3在电,美国大概2/3在电。这个其实会影响大家更关心什么,比如老黄天天讲的tokens per watt(每瓦特token数),还是tokens per dollar(每美元token数)。

泓君:如果遇到同行,或者看一家芯片公司,你们会怎么判断它行不行?如果用一个问题问芯片公司,会是什么?

Mark:刚才那三个问题(成本、速度、耗电量),都是很好的问题。但我们比较关心的其实是两个,就是你的tokens per second可以做到多快、多便宜。可能很多实际做推理芯片的公司根本没有这个数字。

徐子扬:从用户端角度理解,就是你这个芯片组成的系统,每个token的价格,和它对单一用户的每秒推理速度。这两个是我们最关心的核心问题。


泓君:推理速度现在是核心制约瓶颈吗?从我作为用户体验来说,我觉得现在推理速度够用了。

徐子扬:这是我们思考非常多的问题:做“快”,这个“快”本身有多大意义?

先从今天商业逻辑说。自从Agent大规模爆发,现在大量语言模型产生的token,其实并没有被人读。这里有两个点:在Agent之前,有个东西叫chain of thought(思维链)。它产生token的这部分不是给你看的,是给模型自己产生最后结论的。这部分速度要快一些,因为最后是给自己看的;Agent这部分产生的token,也不是给人看的,是给别的Agent读的。

人本身阅读token的速度没那么快。我们可能做到100 token每秒,人就已经读不过来了。所以今天很多GPU或其他系统,它去反推的时候,都是往100 token每秒去发展的,甚至会低一些,50 token每秒。

但对Agent系统,我们认为这个速度一定程度上没有上限,越快越好。对AI来说,长期的核心制约有两个:能耗和时间。单位时间内能解决多少事情,本质上取决于系统对单用户的推理速度。

Mark:你提了一个很好的点:你觉得已经很快、够用了。我觉得核心点是,它一定会(通过某种方式)让你觉得够用,但会在别的地方实现这一点。比如它知道用户不能接受一个问题想两天,甚至一个小时可能都不能接受。所以这本质上限制了在这一天或一个小时之内,我能生产多少token来解决用户问题。

所以推理速度更快,并不意味着你要从一分钟思考,最后交互速度变成一秒钟;而是在同样一分钟交互时间里,模型可以用10倍更多token做更多内部自我思考,来提升智能水平。

徐子扬:或者用Agent的方式去做很多确证的实验来回答这个问题。

泓君:有意思。我看到答案的时间可能一样,但背后是这个模型思考了一遍,还是思考了十遍。所以推理芯片做得好,可以让模型在同样时间里更智能。

Mark:所以你看黄仁勋演讲的PPT,坐标纵轴是每瓦特token数,或者每秒每瓦特token数,是说token的成本;横轴讲的就是推理速度。Bill喜欢叫“interactivity”(交互性),但是老黄的PPT里面,横轴标注是“Smarter AI”,他认为推理更快意味着整个AI可以更聪明,就是基于刚刚的逻辑。

泓君:我理解了。所以有时候,比如看到一些应用很快给我答案,可能只是因为AI思考得少而已。这太有意思了。

徐子扬:我们甚至觉得,之后token的规模还会继续扩大,其中很大一部分都是在AI自己的系统里转,来为你产生最终智能。比如哪一天AI系统足够聪明,我说你去解决癌症,然后它在那慢慢解决,大部分token是在它自己里头转。

但如果我们会希望它在有限时间内解决,比如我想让AI系统判断明天股票市场怎么样,它如果用两天时间想这个问题,那回答没有任何意义。

所以我们为什么觉得时间是非常重要的本质约束:世界不会为任何事慢下来,很多事情需要在确定时间点之前得到答案。我们希望在确定时间节点里获得更多智能,这个就翻译成“快”。


泓君:现在很多国产芯片,甚至英伟达的芯片,大家有一个宣传出来的纸面算力值,但真实用起来感觉算力没跑满,有时连对折都不到。这中间消失的算力去哪了?为什么会有一部分算力浪费?为什么达不到理论算力值?

Mark:我觉得分两部分。如果单纯讲算力浪费,现在很多workload,包括一些注意力机制、很多应用,它的计算和访存的比例没有长在英伟达GPU的“甜点”上。这可能是比较大的一些方向,因为你卡在带宽上了。计算机体系结构有一个roofline,如果是带宽瓶颈,算力显然用不起来。

另外,推理其实是非常快速、由很多细小算子组成的。你想,每秒钟两三百个token了,这时每一个token对应的计算任务非常细碎。相比训练都是大矩阵相乘,这种细碎会造成一部分调度的损失。

泓君:这是使用者用的问题,还是芯片设计的问题,还是软件层的问题?

徐子扬:三者都有。Mark说到的算力和访存那部分,就更本质一些,这个可能是硬件设计和现在用的workload应用不匹配造成的。

再技术一点,现在经常说芯片在等数据从别的芯片传过来,意思是我们在互联上卡住了。任何一个数据没有及时到要算的那一边,无论是因为这一片上的HBM带宽不够大,从那里读出来时间太长,计算单元空转;还是我要从别的地方传数据导致空转。最后导致计算单元在做矩阵乘法,现在模型里最大的东西就是矩阵乘法。

我们在算MFU,模型算力利用率,基本上只算矩阵乘法这一块。所以一旦矩阵乘法在空转,最后会得到比较低的MFU,我们就会说这个芯片没有被很好地用起来。

回到roofline model,在推理,尤其为了高单用户推理速度的场景,还有另一个场景叫MBU(内存带宽利用率),访存带宽有多少被用起来。比如带宽拉到100%,芯片是不是百分百用起来?也不完全是。芯片至少有两个单位:访存带宽有没有百分百用起来,算力有没有百分百用起来。

这回到第一点:如果我设计时带宽非常小,算力非常大,那我把带宽吃满时,我的算力可能还空着。

泓君:所以它是一个综合的问题。你们自己设计推理芯片时,会把这些考虑进去吗?理论利用率和实际利用率。

Mark:我们会考虑进去。怎么避免实际执行过程中的调度、摩擦导致利用率损失,这点可能是我们更多可以在芯片设计上做优化的地方。


泓君:你们为什么要回国创业?

Mark:我当时回国不是因为创业这一件事回国,我在国内已经待了三年左右。我很多PhD朋友、导师都还在美国,所以每年也会去硅谷几次,和大家继续交流。

虽然现在国内有先进制程的实际的技术限制,但长远看,在一些更具挑战的方面,比如控制成本、性价比导向的供应链解决方案,国内整体环境有更大优势。

泓君:主要是供应链比较完善,供应商也比较多。即使团队在美国,可能也经常要回来看看硬件环节。

徐子扬:再本质一点,是搭基础设施的能力。因为我们本身搭的是推理基础设施,涉及几个核心点:数据中心在哪、怎么建、用水用电,中国有非常强的优势。另外,中国也是一个非常大的市场,它是能完全转起来的。

Mark:还有另一个角度。当时Groq和Cerebras做得比较艰难的点在于,美国最主流模型不是开源的。当你做一个很新的芯片,要让不懂你芯片的人适配你的模型,不太现实;要强行让自己适配一个自己不知道的模型,也不太现实。

所以当你做出芯片,更希望有一些开源东西可以拿来跑,在自己上面做出效果。但至少当时那些开源的,比如千问、Llama,显然不是美国最主流、用得最多的模型。所以他们在商业化上,短期只能看到开源模型的那部分小的市场。

但是国内反而倒过来。国内最强大的模型,以DeepSeek、智谱为代表,至少在架构层面更开放。从市场角度,国内可以稳定获取的最好的AI模型的API,其实也都是这些开源模型。


泓君:Mark,当时你去斯坦福读PhD的时候,Bill Dally很有名嘛,是英伟达首席科学家,也可以说是整个芯片领域的GPU的奠基人,因为他在斯坦福做的流处理研究,变成了今天的GPU。当时你为什么选他做导师?你跟他的交流怎么样?


Bill Dally 图片来源:NVIDIA

Mark:你说的stream processing(流处理),这其实是他2000年之前做的工作,只是后面NVIDIA更成功地把这个事情做了商业化。但他后面随着和NVIDIA合作,逐渐又在产业上主导了很多类似方向。

我大四的时候,Bill有一个马上就要毕业的学生韩松,他拉我过去,想让我帮忙做一些研究助理。那时候虽然是松哥指导我,但每周会和Bill有例会。

这个人给我的第一印象,是非常非常聪明。另外一个点,他在研究上看的问题是一些很本质的问题。他不会去解low hanging fruit,因为那对他的职业发展已经不重要。他是很资深的教授,没有任何短期学术压力,比如发多少论文。所以他看到的是一些更本质的东西。他实际上感兴趣的技术点,往往都是那些很难做,但一旦做出来,可能对整个学界、业界有非常大影响的点。这是我那时候开始就非常欣赏的他的特质。

泓君:你刚提到Bill看问题,会看到非常本质的地方。从你2017年开始读他的PhD,有哪些研究和交流,让你觉得他没有关注表面细节,而是直接戳到当前芯片设计最核心的环节?

Mark:后面我真的加入他的组里,跟他非常认真地做一些研究的时候,他当时非常感兴趣的点,我觉得除了他,没有人看到那个点。他当时去尝试做和现在深度学习完全不一样的另外一类——完全逻辑的AI的加速。

过去AI发展有两个不同分支:一个是偏深度学习、神经网络这种感知分支;另一个是强逻辑分支。强逻辑分支,大家往往会尝试构建很大的知识图谱,建立非常严谨的逻辑。现在就变成,比如大家尝试用AI证明数学定理。

泓君:那是哪一年?

Mark:2017年。但逻辑的AI的发展其实过去三四十年都有,而且到现在都有很强的应用,比如一些数学原理证明,再到芯片后面布局布线里,其实有非常强的逻辑AI参与。

所以Bill当时很感兴趣的点是:英伟达已经可以把偏感知的神经网络类AI加速得很好,但在他看来,未来AI是强逻辑与强感知的结合。强逻辑那一部分,当时基本没人在关心,因为之前几乎没有人做过针对性硬件,大家更多停留在软件层面。

那时候我们从头设计了一个全新芯片架构。它和现在CPU、GPU,包括我们想做的这些完全不一样,是专门加速这件事情的加速器架构。

从现在角度看,我知道硅谷很多创业公司,大家一开始有这样的想法:如何让现在这些语言模型Transformer更好地为数学原理、物理原理服务。我觉得这部分在未来可能也是很有影响力的芯片方向

泓君:所以你觉得他当时跟你们主导的强逻辑的芯片,就是重新设计的芯片,在今天的AI时代已经变成主要方向了,还是仍处在研发阶段?

Mark:我觉得它还处在算法研发过程中。本身解这个逻辑问题的算法非常固定,叫SAT(布尔可满足性问题)。但如何把这个问题和Transformer更好结合,让Transformer去把实际复杂的数学和物理问题拆解成这种强逻辑问题,我觉得是现在很多尝试做AI for Science的公司在做的事。现在算法层面还没有收敛。未来如果大家发现它真的很有效,以及未来如果科学探索的瓶颈真的落在“如何更快地求解复杂逻辑问题”上,那对芯片和硬件的需求会是确定的。

泓君:你觉得他给你的启发,更多是在芯片领域、学术领域,还是在思考方式、沟通方式、人格特质方面?

Mark:我觉得是后者。刚提到我跟Bill做的第一个项目,之后包括我的博士论文,很多东西并不一定是某一个确定方向。比如大家会看到他现在是GPU的奠基人,但我觉得本质上,他并没有和GPU绑定。GPU只是结果。原因是他是一个非常好的研究人员、非常好的架构师,所以能发现最重要的东西是什么,并以最好方式做出来,这成就了现在的GPU。但他对我影响更大的,可能是一些芯片设计、系统设计,甚至怎么做研究,更本质的需要关注的一些点。

举一个例子,我们现在做的很多芯片会围绕一个点去出发,叫locality(局部性)。而这件事情最早我是从Bill那里得到了非常大的震撼。他跟我说,整个芯片设计,一切都是围绕局部性去展开的。

泓君:什么叫局部性?

Mark:局部性就是location,位置,把东西放在那。他的原话是——“计算机系统结构就像房地产,一切都在于位置、位置、位置”。比如CPU里Cache(缓存)的设计,本身就是一种时间局部性和空间局部性的使用。

时间局部性,就是如果我用了一段数据,那未来一段时间大概率会重复使用这段数据。空间局部性,就是如果我用了一段数据,那大概率马上会用到它周围的一部分数据。

我们现在做AI芯片,要考虑把模型权重存在哪、为什么想用SRAM,就是希望提供最好的局部性。因为在AI时代,尤其做推理decode这个过程,时间局部性和空间局部性在算法上都被抹平了,这些都不复存在了。所以我们就要在架构上做更多实际硬件上的局部性,来弥补这一点。

在思考怎么更好地做事,或者找到更值得做的事的时候,我觉得他的逻辑是要找到最难的事情,找到对整个系统影响最大的那个点,并尝试解决它。他会关心trade-off。当你只做微小提升时,其实可以保全大局,不需要做颠覆式修改。但如果你要做很难的、数量级的提升,你一定要很清楚想明白:哪些东西可以牺牲,哪些东西真正关键。

只有想明白这些问题,你才能在整个系统层面做出更关键的选择,才能跳出local minimum(局部最优),找到全局最优解。

泓君:很有意思。这个就是说,我们不要去做微创新,要找到最难的那个问题,从全局角度做颠覆式创新。但它意味着失败概率很高。你跟Bill合作过程中经历过失败吗?

Mark:非常非常多。但我刚刚说的点,其实和成功失败没有关系。它是你做事情的逻辑:什么样的事情是Bill觉得值得做的,以及现在是我们觉得值得做的。做的过程中,肯定会有很多失败。但他不会因此否定你要解决的问题,你可能只是没有找到正确解法,甚至这个解法可能是没有的。

泓君:我觉得这段非常鼓舞人心。你回来创业,Bill Dally给了你什么样的建议?

Mark:我跟Bill会讨论很多技术细节。比如当时我有一些想法想用SRAM来实现,我会跟他讨论非常多。因为我现在想做的很多东西,和我当时PhD跟他一块做的东西,从方法原理上讲很相像。具体创业建议的话,Bill给我的建议就是:一定不要用PhD写的代码,因为这是Bill上一个创业里的惨痛教训(笑)。

泓君:他的整个特质还是更偏一个科学家。

Mark:正是这样。Bill当时给我另外一些点,其实是怎么做研究。但我现在会发现,那些东西并不一定是做公司最好的点。他认为做研究的本质,就是用最小的代价获取最多的知识。所以当时比如涉及流片,用科研经费把片子造出来,在Bill看来完全不必要,因为你已经在流片之前获得99%的知识了,除了工程实现,流片本身并不能带来额外的东西。

现在创业这件事,其实就是你要去解决剩下1%工程上的事,而且这部分可能要花费你99%的精力,但它对这件事能不能做成的贡献没有那么大。你在做工程之前,就可以从设计的角度知道这件事技术瓶颈在哪、能不能做。但实际工程上要解决的实际设计、散热、供电问题,是你要花很多精力去真的把它做出来的。


泓君:今天是我们在节目发出前的一次补录。6月24号,OpenAI跟博通发布了第一颗自研推理芯片Jalapeño。子扬,你们这些天有没有研究OpenAI的推理方案?它跟你们想的思路有什么不一样?


OpenAI首颗自研芯片Jalapeño 图片来源:OpenAI/X

徐子扬:我们在Jalapeño出了以后,认真探索了一下他们公开资料有的信息,包括在HotChips分享的一些内容。

首先,他们做的芯片目前是AI推理芯片,但定位是一个通用AI推理芯片,和GPU还是比较接近的。它的通用性体现在,可以跑各种模型,甚至能跑一些游戏的demo。

我来说几个我们看下来的侧重点,包括和我们不一样的点。

最重要的一个,是电的效率和钱的效率。OpenAI对电的效率非常敏感。因为现在美国数据中心缺的并不是资本和空间,而是电的供给。所以它非常需要用同样的电,产出更多的token、更多的智能,也意味着更多的收入。我们看到这颗芯片在功耗上做了很多工作,所以它的每瓦或每兆瓦能产出的token数,是大于英伟达对应的Rubin架构的。

另外一个特点,它是通用的,这包含很多意涵。首先通用性体现在,它把我们之前说的一些异构部分,包括prefill、decode,还有attention、FFN,都用一颗芯片全包了。它在设计上,加入了对小维度矩阵乘法的支持,所以在batch size比较小的情况下,性能也能做到比较好。

还有一些公开信息,甚至说它下一代要去支持训练。所以它在通用性上,和我们,包括Groq、Cerebras的系统级异构的思路有一些不同。

还有一个小特点就是,用了很多AI来帮助,包括从软件栈上看,它的Gluon写的kernel,很多优化都交给了Codex。另外它的芯片设计,无论是性能优化,还是从项目启动到流片的速度,都比我们之前看到的芯片项目有明显提升。它说启动到流片用了9个月。

泓君:这个速度相当快了。我其实有一个疑问。当时我们录播客时讲到,业界推理芯片在向SRAM路径收敛。但我们看OpenAI这颗芯片,它并没有走这条路,而是把HBM4带宽堆到单封装15.4TB/s。同样是解决带宽问题,但HBM是挺贵的一条路。为什么他们会选这条最贵的路?

徐子扬:这个贵代表,你买对应芯片、买存储、买存储带宽,价格比较高。但其实OpenAI最本质的限制在于电。它可能对资本开销、对造芯片成本没那么敏感。

这也和中美在算经济账上不太一样。中国电的比例比较低,占1/3甚至更少;美国是2/3,更多是电。但成本只是一部分,另一部分是供给。美国的电,每一年能提供多少新增的电的产能,是比较明确的。如果想在这个确定产能内产出更多token、更多智能,其实更关心的是芯片把电转换成token的效率。

OpenAI相对不那么关心我们之前提到的SRAM最本质的优势:每一块钱能买到的带宽比HBM高很多个数量级。这一点转化成的是,你最后花同样价格生产芯片,或同样芯片产能去生产产品,能得到更多的token。但目前OpenAI更关心另一个指标:从电的角度。

泓君:总结来说还是第一点,省电。

徐子扬:反过来说,为什么SRAM相对没那么诱惑?SRAM带宽非常高,但容量受限,所以在做芯片通用性上比较受限。包括我们自己的方案,包括Groq、Cerebras的方案,都会做一种系统级异构,一颗芯片要去和别的芯片配合。

但我们看到OpenAI选择做一颗更通用的芯片。这个我们上次讨论说到了,模型公司和云厂商业务比较多元,也有训练需求,模型五花八门,语音、图像模型也要跑,所以对芯片通用能力要求比较高。

做芯片都是trade-off。当你的需求点,有些对容量要求很高,有些对带宽要求很高,那就要找一个更全能的、可能更贵的解决方案。那最后就指向,在这个点上HBM的确做得很好,尤其HBM4带宽比之前也有很大提高。

泓君:那如果是长上下文的KV cache,HBM的方案会比SRAM有优势吗?

徐子扬:这涉及的还是要不要做异构。包括我们自己想的方案,和Groq跟GPU结合的方案,其实都是把attention这一部分的KV cache放在另外一块芯片上,不是SRAM方案上。

至于长上下文,它对KV cache、对容量需求有多大,我们看到最近几个月有非常大的变化。包括DeepSeek新模型出了之后,它的第一张图就是每一个token的KV cache,这个数字每一代都在往下缩,这次缩了1/4到1/8。所以我们之后遇到长上下文,它对容量有多大需求,这是一个正在变化的事情。

但因为它的需求是动态的,并且随着用的人数、随着上下文增长,它会不断地变大,所以一定程度上对容量的性价比有要求。这一点就落在了SRAM不太舒适的区间内。所以我自己想这个问题时,我们不会优先考虑用SRAM去存KV cache。

泓君:HBM每一代带宽提升比SRAM密度提升要快,那SRAM路径的优势窗口会不会在两三年后就关上了?

徐子扬:我们看HBM带宽增长,虽然现在已经做到一个很好的数字,但它带宽增长其实也没有大家想得那么乐观。包括这一代之后带宽增长从哪里来,也不是很确定。

从第一性原理去思考,如果你的连线还是通过走着某一种铜线(它不一定是铜线,区别于光刻出来的线)在一个带内走线,它的密度是有天然瓶颈的。

包括我们看到HBM一定程度上走到极限,是会从边上走线变成面上走线,类似一些厂家在做3D DRAM。这些都是未来存储很有前景的方向,但它最后会落在整个trade-off空间里的不同点位上。我们现在看,在带宽这个点位上,HBM也好,其他HBF等等也好,很难达到SRAM的带宽绝对值和性价比。

泓君:你觉得SRAM现在相比其他方案有哪些缺点?

徐子扬:最大缺点其实就是容量的性价比。因为它要用6个晶体管锁1个比特,而且一般来说,为了达到这个带宽,要放在同一个die(晶片)上,SRAM的堆叠其实会降低它的带宽。所以在这个点上,它容量性价比非常低。如果我们对存储有很大需求,需要存非常多数据,那SRAM可能不是最优方案。

但这个要分成两个问题讨论。你要存的数据量可能很大,但它是一个固定量时,比如我们要把模型权重全部存在SRAM里,那我们可以用很多个芯片组成一个集群去做,这个还是在SRAM可以接受的空间内。

但如果你要存的数据变化很多,并且可能未来持续增长,比如KV cache,那我们就认为它在容量上受限这个缺点,会使得它不适合这个场景。

泓君:了解。上一次录播客时,你说你觉得业界推理芯片方案在向SRAM收敛。OpenAI这个芯片出来后,你还会保持这个判断吗?

徐子扬:我觉得在一定程度上,在这个大的系统级异构趋势中,为了提高token性价比,还会有很多公司向SRAM收敛。

但的确,OpenAI提出的这个思路有非常有意思的地方。它其实是把异构这一点做进了一个芯片,就它的芯片里有很多部分,它们之间是异构的。OpenAI提出了一个dark silicon(暗硅)概念。当然这个概念一直都存在。OpenAI认为它比较容易接受这个成本代价:拿这一颗芯片去做不同的事,做某些事时,可以把其中一些部分关掉,或者降低功耗。

这种异构和我们想的系统级异构最大区别,其实还是它用了更多成本去买这个芯片,但可以做到电的效率更高。所以从per dollar角度,它这个方案其实不会很好。我觉得这涉及不同市场条件下,限制条件不同,会收敛到不太一样的地方。

我们看到,在对带宽要求非常高和带宽性价比非常高的地方,还是会收敛到SRAM方案。但如果电是第一限制,那OpenAI这个方案也是一个很好的解决方案。

泓君:你们研究他这个方案时,会觉得对你们现在做芯片的思路有什么启发吗?

徐子扬:我觉得对于AI的使用上,一部分验证了我们的一些想法,包括软件栈能被AI快速提升,比如AI怎么来做芯片设计和优化,这对我们其实有一定启发。

异构是发生在系统级,用不同芯片去组异构,还是发生在芯片内,在芯片内用不同单元去组异构,我觉得这其实就是在不同市场下,限制条件不一样,会走出不一样路径。这个我们看清楚之后,觉得我们的一些想法还是成立的。

泓君:异构发生在芯片内,现在业界是只有OpenAI这样做了,对不对?

徐子扬:异构发生在芯片内,这是OpenAI比较明确展示出来的。但比如原先英伟达GPU,也可以理解为异构发生在芯片内,只不过它是一个通用芯片,更强调通用性,没有像OpenAI去说,我把不同需求放在一起,并且通过各种方式能关闭一些东西,来提高电的效率。这是我第一次看到这样一个解决方案。

异构发生在系统级,包括之前讨论的Groq、Cerebras,和现在很多AI芯片,其实都在往系统级异构方向走,一些芯片配合做不同事情,包括PD分离、训练和推理分离,这些都是异构发生在系统级。

泓君:你觉得现在,或者说未来,整个推理芯片市场,还会是英伟达的天下吗?整个市场格局会变成什么样?

徐子扬:这个问题很难回答。我们当然不希望它是英伟达的天下。如果那样,就意味着这么多在做有意思探索的公司都很难存活,包括我们。

我们看到了,以GPU为核心的英伟达,在尝试其他技术探索时,它在迭代速度和方案选择上可能会有一定限制。所以我们也看到,有很多在做的新的方案,其实不是从英伟达出发的,包括Groq。也看到英伟达去acqui-hire了Groq。

所以我没有办法直接回答这个问题。但我们希望整个AI芯片变得更多彩一些,方案变得更多一些,这也符合我们对整个异构的认知。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

史之铭
2026-09-21 17:26:54
名古屋亚运颁奖台上的白发志愿者:91岁无薪酬上岗 单日补贴140元

名古屋亚运颁奖台上的白发志愿者:91岁无薪酬上岗 单日补贴140元

林小湜体育频道
2026-09-22 15:57:29
历史性一幕上演,德国外长火速致电中方,北京这回把话说得极重!

历史性一幕上演,德国外长火速致电中方,北京这回把话说得极重!

共工之锚
2026-09-23 00:32:09
拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

拜仁加入哈兰德争夺战,将和皇马、巴萨竞争哈兰德,作为凯恩的长期接班人

福酱的小时光
2026-09-23 09:01:35
辛迪克劳馥儿子命丧戒断中心,细节曝光,从入住到死亡不到24小时

辛迪克劳馥儿子命丧戒断中心,细节曝光,从入住到死亡不到24小时

东方不败然多多
2026-09-23 00:53:50
3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

3-0大胜!国乒女团半决赛战朝鲜!孙颖莎丢局,王曼昱回暖,蒯曼狂轰11-1

好乒乓
2026-09-22 23:27:29
严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

严查、重查、倒查,全都一查到底?这把“利剑”,究竟护着咱们啥

一口娱乐
2026-09-22 00:33:06
原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

汪巗的创业之路
2026-09-23 07:13:35
雷军回应“打新宇树科技赚了100多亿元”:不是我投资的,是顺为投资的,也不是打新,而是早期天使投资

雷军回应“打新宇树科技赚了100多亿元”:不是我投资的,是顺为投资的,也不是打新,而是早期天使投资

都市快报橙柿互动
2026-09-22 20:35:46
名古屋亚运女子百米大战将至,17岁陈妤颉迎战一众亚洲飞人

名古屋亚运女子百米大战将至,17岁陈妤颉迎战一众亚洲飞人

林子说事
2026-09-23 01:11:48
全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

全红婵不对劲。不是她以后不比赛了,而是她今年19岁了,居然开始了自己的精致路线。

小琦聊生活
2026-09-23 11:36:31
卖猫的你给我出来,你也没说这猫能长这么大啊

卖猫的你给我出来,你也没说这猫能长这么大啊

铲屎官阿伟
2026-09-22 18:40:07
脂肪肝能逆转了!《柳叶刀》:司美格鲁肽让60%患者肝脏脂肪消退

脂肪肝能逆转了!《柳叶刀》:司美格鲁肽让60%患者肝脏脂肪消退

垚垚分享健康
2026-09-22 22:40:06
16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

悬案解密档案
2025-07-18 16:15:01
乒乓亚运会:奥运亚军0-3惨败,松岛/美和险爆大冷,栋曼强势零封

乒乓亚运会:奥运亚军0-3惨败,松岛/美和险爆大冷,栋曼强势零封

帛河体育
2026-09-23 11:23:44
亚运会乒乓球战报,林诗栋蒯曼立大功,奥运会亚军无缘16强

亚运会乒乓球战报,林诗栋蒯曼立大功,奥运会亚军无缘16强

南海浪花
2026-09-23 10:36:40
民心欺不得,民意违不得,糊弄群众,终究走不远。

民心欺不得,民意违不得,糊弄群众,终究走不远。

荷兰豆爱健康
2026-09-21 08:48:55
韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

韩景枫又拿老婆打窝,当众埋胸李谣助理不敢看,女方手姿势很尴尬

蹲坑看世界
2026-09-23 04:48:11
亚运游泳预赛综述:张雨霏、于子迪第一晋级,张展硕冲击亚洲纪录

亚运游泳预赛综述:张雨霏、于子迪第一晋级,张展硕冲击亚洲纪录

乒烧泳球
2026-09-23 10:33:18
足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

汉史趣闻
2026-09-22 16:55:33
2026-09-23 12:44:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139786文章数 862639关注度
往期回顾 全部

科技要闻

2026网易未来大会上午场:科技如何破界

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

健康
教育
数码
游戏
家居

青春痘,究竟是怎么冒出来的?

教育要闻

我国教育普及和公平程度居世界前列

数码要闻

华为四款新品今日集中开售 三折叠套装卖到29999元

《巫师3 重制版》NS2预载开启!占用42.3GB

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版