网易首页 > 网易号 > 正文 申请入驻

用125亿分之6的参数,打平3970亿的旗舰模型

0
分享至


2026年初,如果你去看开源大模型的排行榜,会发现一件挺反常的事。

通义千问团队刚发布的Qwen3.8-Flash-Next,总参数125B(十亿),但每个token实际只激活6B。这个数字放在整个模型家族里显得有点寒酸,因为它要对标的,是上一代397B总参数、17B激活参数的旗舰模型。按常理,激活参数少了将近三分之二,性能应该明显打折扣。

但实测下来,在十四项预训练基准测试中,新模型在八项上反超了那个"更大"的前辈,剩下六项也只落后最多2.6分。更夸张的是训练成本:激活参数是三分之一,训练数据量是三分之一,训练总算力大概只要九分之一。

这不是靠某个单一的黑科技实现的。这篇论文真正有意思的地方,是团队把"模型好不好用""训练和推理贵不贵""训练过程稳不稳"这三件事绑在一起考虑,而且专门记录了这三者互相打架的时刻——比如某个改动让损失函数(衡量模型预测准确度的数值,越低说明模型学得越好)降低了,但下游任务的实际表现却没变化,甚至变差。这种坦诚的记录方式,比单纯报喜不报忧的论文要值钱得多。

一个绕不开的矛盾:记忆和效率不可兼得吗

要理解Qwen3.8-Flash-Next的设计,得先明白语言模型处理长文本时面临的老问题。

传统的自注意力机制(Transformer模型里让每个词都能"看到"前面所有词的机制)有个先天缺陷:计算量随文本长度呈平方级增长,同时它还得保留一份不断变大的键值缓存(KV Cache:模型在生成文字时,为了不重复计算,把之前算过的关键信息暂存起来的一块内存)。文本越长,占用的显存就越夸张,推理速度也越慢。

工程师们想过一个补救办法,叫滑动窗口注意力(Sliding-Window Attention,简称SWA:只让每个词看到附近一小段范围内的词,而不是全部历史)。这样确实省了显存和算力,但代价是窗口外的信息只能靠一层层网络往后传,传着传着可能就丢了。

这就好比你在图书馆查资料,如果每本书都得从头翻到尾去找关键信息,速度肯定慢,这是全注意力的问题。而如果你规定自己只能翻最近借的三本书,那三个月前借过的那本关键参考书,信息就传不到你手上了,这是滑动窗口的问题。真正好用的图书馆员,应该是脑子里记得所有书的大致内容摘要(相当于一个压缩的状态),同时手边还留着几本随时可以精确翻查的原书。

Qwen3.8-Flash-Next用的解法,是把两种机制按比例混着用:每四层里放三层Gated DeltaNet(简称GDN,一种把历史信息压缩进固定大小状态里的循环记忆机制),配一层全局注意力。

GDN的核心思路来自"门控增量法则"(Gated Delta Rule)。它维护一个矩阵状态,每来一个新词,先算出这个词的信息和已有记忆的"误差"(就是记忆里已经有的东西不用重复写),再用两个门控参数——一个衰减门决定旧记忆保留多少,一个写入门决定新信息写入多少——来更新这个状态。这样一来,重复出现的相似内容不会无限堆叠占用记忆,而是覆盖式更新,有点像笔记本上用橡皮擦改错别字而不是每次都重新翻页写。

架构消融实验(就是把某个组件换掉或去掉,看性能变化,用来验证这个组件到底有没有用)的结果很直接:在九个基准测试里,GDN混合架构比纯全注意力Transformer在八项上更强,比SWA混合架构在七项上更强。这说明单纯依赖局部窗口是不够的,压缩记忆加周期性全局检索的组合确实更划算。

值得一提的是,团队还发现一个细节:全注意力层里用不用旋转位置编码(RoPE,一种告诉模型"这个词在句子里排第几"的技术),在预训练阶段几乎看不出差别,但去掉之后,模型在后续微调后生成文本时会更容易陷入"说不完"的死循环。这种问题在预训练阶段的损失曲线上完全看不出来,得等到实际生成文本才会暴露,这也是这篇论文反复强调的一个主题:只看训练损失是会被蒙蔽的。

稀疏注意力:给检索建索引,也得先学会省纸

光有GDN和全注意力的混合还不够,因为那一层全注意力在处理超长文本(比如百万级token)时,依然是个昂贵的操作。

于是团队引入了Qwen Sparse Attention(QSA,一种不需要看完整个文本、只挑重要片段来算注意力的机制)。它的思路借鉴了此前的DSA方法(一种用轻量级索引器给每个词打分、决定哪些历史词值得关注的稀疏注意力技术),但做了一个关键改进:DSA的索引器本身计算量仍然是随文本长度平方增长的,QSA把这个索引过程也做了压缩。

具体来说,QSA先把连续的若干个token打包成一个"微块"(micro-block),对这个块做平均池化压缩成一个代表性的键值,再用一个轻量级的多查询注意力(MQA:一种只用少量共享的键值头,但保留多个查询头的注意力变体,能省显存)给每个块打重要性分数。分数最高的几个块会被选出来,展开成原始token参与真正的注意力计算,这样整体的索引开销就从平方级降到了平方除以压缩比。

打个比方,这就像你要在一本几千页的书里找某个知识点,如果你先按每十页做一个小标题索引,扫一遍标题就知道该翻哪几十页精读,比逐字逐句翻完整本书快得多。而如果连做索引这件事本身都要逐字扫描全书,那索引带来的省时效果就会被抵消掉一大半,这正是QSA要解决的问题:把"做索引"这个动作本身也变得轻量。

训练QSA分两个阶段。第一阶段叫稠密蒸馏,只训练索引器,让它学会模仿真实全注意力模型的注意力分布,用KL散度(一种衡量两个概率分布差异程度的指标)作为损失函数,训练1000步,约2B token。第二阶段叫稀疏训练,索引器和主干网络一起联合训练8000步,约200B token,让整个模型逐渐适应稀疏的注意力模式。

结果显示,QSA版本和全注意力版本的训练损失曲线几乎重合,差距只有万分之一量级。而在下游任务上,QSA版本反而在八个基准里的七个上追平或超过了全注意力版本,平均分从75.9提升到76.8。在长文本检索测试RULER和MRCR上,QSA的优势随文本变长而扩大:文本长度超过512K时,RULER分数从90.08涨到93.00,MRCR分数从30.66涨到40.53。

效率上的收益更直观。在百万token的上下文长度下,QSA相比传统的分组查询注意力(GQA),预填充阶段(处理输入提示词的阶段)快了7.6倍,解码阶段(逐字生成回复的阶段)快了4.9倍。

残差流的"四车道改造":加宽之后,怎么读怎么写才最省

除了注意力机制的改造,这篇论文还花了大量篇幅讨论一个容易被忽略的部件:残差连接(Residual Connection,指网络每一层的输出会直接加回到输入上,形成一条"信息直达"的捷径,是深度网络能训练得深的关键技术)。

问题在于,标准的残差流只有一条通道,所有层都往这条通道里写东西,也都从这条通道里读东西。这就好比一个班级只有一块公共黑板,第一节课写的笔记,可能到第八节课的时候已经被后面几节课的内容盖得看不清了。信息越往后传,越容易被稀释掉。

团队借鉴了此前的Hyper-Connections(超连接,一种把单条残差流拆成多条并行分支的方法)思路,先做了个简化实验:把残差流从一条拓宽成四条并行的"分支",每层用固定的权重从四条分支里加权读取,输出再按层数轮流写回某一条分支。这个改动几乎不增加计算量,只是多了一点显存搬运的开销,但训练损失就降低了0.01左右。这说明单纯"拓宽车道"本身就有效果,问题是接下来要不要把车道的进出规则也设计得更聪明。

答案是要的。团队在拓宽车道的基础上,进一步让读取和写入这两个操作都变成"看情况决定"的动态过程,而不是固定权重,最终形成了他们称为Gated Residual(简称GR,门控残差)的设计。

GR的具体做法是:先对每条分支做独立的归一化(RMSNorm:一种让数值分布保持稳定的归一化技术),然后用一个轻量的低秩瓶颈网络,根据所有分支的内容算出一组逐元素的门控分数,决定每个通道该从每条分支里读取多少信息,读取时四条分支加权平均得到最终输入。写回的时候则简单得多,只用一个每条分支对应一个标量的门控,把当前层的输出按比例写回各分支。

有意思的是消融实验暴露出的几个反直觉结论。

数据依赖的读写机制只让训练损失多降了0.002,但下游基准分数却提升了1.98分,这个比例和损失端的表现完全倒过来了,说明如果只盯着损失曲线做决策,很可能会低估这个改动的真实价值。

另一个例子更值得警惕:团队试过让每层只读取门控值最高的两条分支而不是全部四条,这样能省下不少推理时的显存搬运。预训练阶段的损失和基准分数几乎不受影响,看起来是个白捡的优化。但等模型经过后续的微调训练后,这个稀疏化方案的实际生成质量却出现了明显下滑。团队后来试了各种改进方案都没能解决这个问题,最终放弃了这条路。这是个很扎实的教训:预训练阶段看起来免费的优化,可能要等到更后期的训练阶段才会露出真面目。

团队还专门去分析了GR拓宽出来的四条分支到底在干什么活。因为GR没有让分支之间互相混合信息(去掉了Hyper-Connections里原有的一个叫Hres的混合算子),所以每条分支就是一个纯粹的历史累加器,可以精确追踪每一层的信息最终流向了哪里。分析发现,四条分支里通常有一条专门负责跨越很多层传递早期信息(比如第0层的输出直接被第15层、第19层这些后面的全局注意力层大量读取),另外三条则主要负责相邻层之间的短程传递。这种"一条专线负责长途,其余专线负责市内"的分工,是模型自己在训练中学出来的,没有人为强制规定过哪条分支该干什么。这就像城市交通规划里,你可能不会人为规定哪条路是快速路哪条是支路,但车流量大了之后,某条路自然会因为连接远距离节点而变成主干道。

去掉Hres这个混合算子看起来是省了一步计算,但背后的考虑更深:Hres需要额外读一遍完整的残差状态,在参数量固定的推理场景下,这是主导性的内存搬运开销。消融实验证明,只要读写机制本身够聪明,去掉这个混合算子性能几乎没有损失,那这一步开销就是纯粹可以省下来的。

场外记忆库:n-gram嵌入表怎么做到"加参数不加计算"

前面讲的都是主干网络内部的改动,Qwen3.8-Flash-Next还有一个比较特别的设计,是在主干之外挂了一个51B参数的n-gram嵌入层(n-gram:指连续若干个词或token组成的序列,比如"人工"和"智能"连起来就是一个2-gram)。

这个思路的出发点是,语言模型的容量扩展,除了让每个token经过更多计算(也就是更大的激活参数量),还有另一条路:让模型能查更多的"活字典"。n-gram嵌入表的做法是,把每个位置前面的若干个token组合成一个key,去一张巨大的嵌入表里查出对应的向量,再把这个向量叠加到当前token的表示上。

这种设计的巧妙之处在于,嵌入表的访问是稀疏且确定性的,也就是说每次只需要查很少的几行,而且查哪几行是可以提前算出来的。这意味着这张表完全可以放在主机内存(不占宝贵的显卡显存),提前预取到显卡上,几乎不增加每个token的计算量和延迟。这就好比你需要查一本百科全书里的某几个词条,你不需要把整本书都搬到办公桌上,只要提前知道自己要查哪几页,让人提前把那几页复印好放在手边就行,书本身留在书架上完全没问题。

团队做了两组关键的消融实验。第一组是关于该把这层嵌入放在网络的第几层。结果显示浅层(第1到4层)效果不错,但中间层和深层也都有竞争力,多层分散布置反而没有明显好处。团队最后选择放在第2层,好处是主机内存的预取过程正好可以和第一层的计算并行重叠,不浪费时间。

第二组消融更有意思,也是全文最能体现"损失和下游表现会打架"这个主题的地方:在固定总参数预算的前提下(也就是增加n-gram嵌入参数就得相应减少MoE专家数量),损失函数在词表规模扩大到10倍时达到最低点,但这个最优点在下游任务上完全体现不出来,各项基准分数几乎是平的,看不出n-gram嵌入表和MoE专家谁更划算。这说明这两种扩容方式服务的可能是完全不同的能力维度,不能简单地互相替代。

于是团队换了个思路,固定住MoE的参数预算不变,只是单纯往外扩大n-gram词表规模,从20倍一路扩到200倍。这次损失函数是单调下降的,词表越大损失越低,一点犹豫都没有。但下游任务的表现却在某个点就饱和了,有些任务甚至开始上下波动。唯独中文相关的基准测试(C-Eval和CMMLU)表现出了持续稳定的提升,这可能和中文本身对上下文n-gram信息更敏感有关。

这个现象非常值得琢磨。如果你只看损失曲线做决策,会得出"词表越大越好"的结论,一路无脑扩容下去。但实际上下游任务已经在告诉你,多出来的那部分容量并没有转化成真正有用的能力提升,只是让模型在训练数据的统计层面拟合得更好了。损失和下游准确率不是同一件事,这句话在整篇论文里被反复验证。

Muon优化器:不只是换个优化算法,还得重新设计整套工程管线

架构层面的改动讲完了,训练层面还有个重要角色,就是优化器的切换。

团队把主力优化器从AdamW(一种经典的自适应学习率优化算法)换成了Muon(一种通过正交化动量矩阵来计算更新方向的优化器)。正交化这个操作听起来很数学,简单理解就是:普通的梯度更新可能在某些方向上用力过猛,在另一些方向上几乎不动,Muon通过牛顿-舒尔茨迭代(Newton-Schulz iteration,一种不需要做矩阵求逆就能近似计算矩阵正交化结果的迭代算法)把更新方向"拉直",让每个方向上的更新幅度更均匀。

但Muon不是无脑套用到所有参数上就完事的。团队发现,MoE路由器(决定每个token该分配给哪个专家处理的小网络)如果用Muon,会在训练早期造成明显的不稳定,因为路由器每个输出维度对应一个专家的打分,维度之间基本是独立的,没有共享的线性结构可以被正交化利用,所以这部分还是老老实实用AdamW。同样,GR里那两个形状很"细长"的低秩投影矩阵,还有n-gram嵌入表本身,也都留在AdamW或Adam上。

工程实现上还有个容易被忽视但很关键的细节:像注意力的qkv投影、SwiGLU的fc1这些参数,在实际存储时往往是拼接成一个大矩阵存的,方便计算效率。但Muon的正交化操作如果直接对这个拼接后的大矩阵做,会把原本互不相关的几个子矩阵的奇异方向搅在一起,相当于把几个独立的问题混在一起求了一个错误的联合解。团队的做法是先把梯度按语义拆开,各自独立做正交化,再拼回去。这个"先拆后合"的操作在qkv和GDN输入投影上带来了实打实的性能提升。

这里还牵扯出一个纯工程问题:在Megatron-LM(一种流行的大模型分布式训练框架)里,模型参数是按张量并行和数据并行两种方式切分到不同显卡上的,但Muon的正交化操作需要拿到一个参数矩阵的完整视图才能算,这和分布式切分天然冲突。团队为此专门开发了一套叫Canzona的框架,按照预估的计算量重新分配哪张卡负责哪个参数的优化器计算,尽量让各卡的负载均衡,避免出现某张卡算得飞快、其他卡都在等它的"拖后腿"现象。

学习率和批量大小:稳定性提升之后,原来的经验值全部作废

架构和优化器都换了新的,一个自然的问题是:以前调好的学习率、批量大小这些超参数,还适不适用?

答案是不适用了,而且差距不小。团队重新拟合了一套超参数的缩放定律(Scaling Law:描述模型规模、数据量、超参数之间数量关系的经验公式),发现新架构和新优化器允许用明显更大的批量大小和学习率。

这背后的逻辑是:批量大小和学习率能开多大,很大程度上取决于训练过程本身有多稳。如果模型训练很容易出现梯度爆炸或者损失剧烈震荡,那你就必须保守地用小学习率、小批量去规避风险。反过来,如果新架构和新优化器组合本身就更稳,那之前留出来的"安全余量"其实是可以收回来,转化为更快的收敛速度和更高的并行训练吞吐量的。

团队在一个10.8B参数的模型上验证批量大小的预测:把批量从1260万token提升到2520万token,训练损失直接降低了0.0072,这是一个相当可观的提升幅度;但如果再往上加到3770万,反而出现了轻微的性能倒退。这说明预测出的最优点确实是踩在了甜蜜区间上,不是越大越好。

学习率的验证放在了一个156B参数的更大模型上,测试了预测最优值、除以根号2、乘以根号2、外加批量放大25%这四种设置,外加旧版本的超参数配方作对比。结果旧配方的损失比新预测的最优值高出0.0078,而新预测值附近的四种设置彼此差距只有0.0007,几乎在噪声水平以内。这说明这个最优点所在的区域是一个很宽的平坦谷底,不是那种稍微偏一点就掉下悬崖的脆弱最优点,这对实际训练来说是个很安心的信号,因为真实训练中很难做到把超参数调到分毫不差。

批量大小warmup(训练初期从小批量逐渐增加到目标批量的策略)这个业界常规操作,在新配方下也被证明没有必要了。团队专门做了对照实验:从630万token开始,每次增加630万,逐步爬升到2520万的目标值,结果无论是保持峰值学习率不变,还是相应调低早期学习率,两种爬坡方案最终的损失都比一开始就固定用2520万批量训练的方案要差一点,而且爬坡过程还多花了18.8%的优化器步数,纯粹是浪费时间。这背后的原因是,Muon这个优化器在大批量下依然能保持数据利用效率,不像AdamW那样在大批量场景下效果会明显打折扣,所以用不着靠小批量起步来规避风险。

压力测试:把学习率硬拉到四倍,看架构会不会崩

前面讲的都是常规训练场景下的表现,但真正决定一个架构能不能被大规模生产使用的,往往是极端情况下的表现。毕竟一个要训练几万亿token的大模型,训练周期动辄几个月,中途任何一次损失突然飙升(业内俗称"loss spike")都可能意味着几天甚至几周的算力打了水漂,需要从检查点重新开始训练。

团队设计了一套压力测试,思路是:把学习率强行固定在最优值的2倍或4倍,跳过正常的学习率衰减调度,用这种方式在小规模模型上人为制造出大规模训练中才会出现的不稳定现象,这样就不用真的跑一个万亿参数的模型去撞运气。

结果相当有说服力。在2倍最优学习率下,旧架构配AdamW的组合每一万步会出现4.3次损失突增,而换成Muon之后骤降到每一万步0.2次。到了4倍最优学习率这个极端场景,差距变得更加悬殊:旧组合每一万步突增183次,训练近两万步里有213步的梯度触发了裁剪阈值,等于裁剪机制几乎一直在工作;而两个Muon版本全程一次都没有触发裁剪阈值,其中加了GR的版本更是全程零突增。

这个对比就像两辆车分别在正常限速和超速一倍的情况下跑山路,旧组合的车在超速状态下几乎每隔几分钟就要急刹车才能不冲出弯道,而新组合的车即使在超速状态下也能平稳过弯,一次急刹车都不需要。这不是说新组合跑得慢更保守,恰恰相反,它是在同样激进的驾驶条件下依然稳。

团队进一步做了单变量隔离实验,只保留架构和优化器不变,单独开关一个叫GatedNorm(团队在另一项研究中提出的一种在归一化操作后加一个轻量门控的技术)的组件,观察对稳定性的影响。在3倍最优学习率下,打开这个门控能把损失突增频率从每一万步32次压到3.2次,触发裁剪的次数从256次降到20次。同时团队还发现一个规律:如果不加这个门控,模型为了应对高学习率带来的冲击,会靠让激活值(网络内部数值)里出现越来越极端的异常值来"硬扛",这种应对方式本身就很脆弱;而加了门控之后,即便学习率调得更高,激活值的异常程度反而比不加门控、学习率更低时还要低。这说明高学习率训练需要有个显式的重新缩放机制,门控就是在直接提供这种缩放,而不是任由网络自己想办法硬撑。

正因为这些稳定性上的改进,Qwen3.8-Flash-Next的正式训练全程没有出现过一次损失突增或梯度异常波动,而且完全没有依赖业界常见的qk-clip、SwiGLU-clip这类需要额外手动限制激活值的补救手段。

最终成绩单

说了这么多设计细节,最终落到实际的评测表现上,Qwen3.8-Flash-Next-Base在general、数学、代码、多语言四大类共十四项基准测试中,对比27B参数的同代小模型全面胜出,对比397B参数的上一代旗舰在八项上反超,其余项目也保持在小差距范围内。而实现这一切用的训练算力,大概只有旗舰模型的九分之一。

Q&A

Q1:Qwen3.8-Flash-Next用了多少参数,激活参数是多少?

A:总参数125B,每个token实际激活6B,另外还有51B参数的n-gram嵌入表放在显卡之外的主机内存里,不占用推理时的激活计算量。

Q2:Qwen Sparse Attention(QSA)相比传统全注意力有什么优势?

A:QSA通过压缩键序列并用轻量索引器打分选取重要片段,在百万token上下文下预填充速度快7.6倍,解码速度快4.9倍,且下游任务表现不降反升。

Q3:为什么Qwen3.8-Flash-Next能比参数量大三倍的上一代模型训练更稳定?

A:主要得益于Gated Residual门控残差设计和Muon优化器的组合,压力测试显示在4倍最优学习率下,新架构全程零损失突增,而旧架构每一万步会突增183次。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
经济拮据,全职宝妈鼓起勇气出来找工作!找到满意岗位却陷入两难:伸手找老公拿家用,还是出门挣工资?

经济拮据,全职宝妈鼓起勇气出来找工作!找到满意岗位却陷入两难:伸手找老公拿家用,还是出门挣工资?

捣蛋窝
2026-09-11 14:35:22
三星嘲讽苹果折叠屏:五十步笑百步,真正的卷王根本不带他俩玩

三星嘲讽苹果折叠屏:五十步笑百步,真正的卷王根本不带他俩玩

王新喜
2026-09-10 15:15:47
参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

参选消息落地了,特朗普沉默了。 9月5日,亨特·拜登高调宣布:“我要参加2028年大选,致力于成为最遵守法律的总统。”

扶苏聊历史
2026-09-10 17:49:17
女篮惨败,宫鲁鸣下课?新帅或曝光,47岁,执教严厉,或换所有后卫

女篮惨败,宫鲁鸣下课?新帅或曝光,47岁,执教严厉,或换所有后卫

喜欢体育的猫
2026-09-11 07:40:30
扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

扎哈罗娃反问日本:当年屠杀中国、苏联平民时,戴的不正是菊花纹章吗?此前高市早苗要求俄拆除战胜军国主义日本的纪念碑

鲁中晨报
2026-09-10 13:43:05
彭警,任峨眉山市委书记!上海市纪委监委第七监督检查室主任徐豪,拟任新职!

彭警,任峨眉山市委书记!上海市纪委监委第七监督检查室主任徐豪,拟任新职!

阿天爱旅行
2026-09-11 10:36:16
《交锋》钱文英攀附林看山成工具人!演员和欧豪《风吹半夏》一搭

《交锋》钱文英攀附林看山成工具人!演员和欧豪《风吹半夏》一搭

像诗一样的姑娘
2026-09-11 15:27:01
泽连斯基在国外遇刺!专机被无人机袭击,俄罗斯还是选择动手了?

泽连斯基在国外遇刺!专机被无人机袭击,俄罗斯还是选择动手了?

影孖看世界
2026-09-10 21:38:15
伊朗下令暂停对进出伊朗、运输能源产品的外国船舶收取10%的运费附加费

伊朗下令暂停对进出伊朗、运输能源产品的外国船舶收取10%的运费附加费

财联社
2026-09-10 19:17:16
中国必须高度警惕越南将发生的分裂危机!

中国必须高度警惕越南将发生的分裂危机!

叶老四
2026-08-31 08:51:57
李凯尔正式表态:想代表中国男篮再次出战世界杯 不满意上届表现

李凯尔正式表态:想代表中国男篮再次出战世界杯 不满意上届表现

醉卧浮生
2026-09-11 12:09:14
上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

上手iPhone Duo后我改主意了:折叠屏为何必须做到这么好?

报错免疫体
2026-09-11 00:30:16
孙艺珍被问如果儿子以后想当演员怎么办,本人回应:“他长得这么帅,想不当演员都难”

孙艺珍被问如果儿子以后想当演员怎么办,本人回应:“他长得这么帅,想不当演员都难”

韩小娱
2026-09-11 15:07:08
中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

章民解说体育
2026-09-10 22:22:02
WTT冠军赛:大爆冷!国乒男单仅剩1人,接近全军覆没,陈垣宇2:3

WTT冠军赛:大爆冷!国乒男单仅剩1人,接近全军覆没,陈垣宇2:3

国乒二三事
2026-09-11 12:37:45
穿个亮眼的裙子,身上肉多点咋了

穿个亮眼的裙子,身上肉多点咋了

飛尚日记
2026-09-09 07:40:30
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
美网19连胜!萨巴伦卡2-0横扫佩古拉 连续4年进决赛+冲3连冠

美网19连胜!萨巴伦卡2-0横扫佩古拉 连续4年进决赛+冲3连冠

醉卧浮生
2026-09-11 08:36:43
张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

张继科:刘翔是奥运冠军!是我们国家的英雄 别的不知道不能胡说

念洲
2026-09-11 07:00:49
网传中国农大一学生因不当言论被开除,网友不服……

网传中国农大一学生因不当言论被开除,网友不服……

慧翔百科
2026-09-10 17:21:21
2026-09-11 16:52:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9830文章数 568关注度
往期回顾 全部

科技要闻

罗永浩连用7个“抄的”吐槽苹果折叠屏

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

头条要闻

"男子称停资助遭受助学生质问"疑反转 民政局查无此人

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

千叶珠宝创始人夫妇失联 股价应声"腰斩"

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

家居
游戏
房产
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

首届日本恐怖游戏大奖揭晓 《寂静岭f》强势登顶

房产要闻

时隔7年,绿地海南再拿地!

教育要闻

为什么越在意孩子感受,孩子越脆弱

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版