网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-27B就是新的模型斩杀线

0
分享至

最能动手折腾模型的开源社区开发者,往往也是最会玩梗造概念的一群人。最近半年,他们最爱的一个概念是“斩杀线”。

这个词借自游戏,后来在更广泛的场合里变得更加流行。它原指血量落到某个数字以下,对手下一回合就能把你带走,比赛实际上已经提前结束。

把它套到模型上,过往一段时间人们指代的是 DeepSeek 一直在扮演的角色:一个新模型出来,先和 DeepSeek 比能力,再比价格。如果性能上不去、价格又降不下来,发布当天基本就失去了讨论价值。

从 R1 开始,DeepSeek 一度成为模型世界默认的那条线。

但现在,这条线看起来要换人了。

8月14日,Qwen3.8-27B 发布,开源两天下载量破百万,登顶 Hugging Face 全球趋势榜,编程 Agent 工具 Cline 的开发者里,它只用四天就成了被选择最多的本地模型。Artificial Analysis 的 Intelligence Index 给了它 52 分,已经进入 GPT-5.6 Luna、DeepSeek V4 Flash 这一档模型所在的区间。开发者给它起了一个更直白的外号:

“本地 Opus 4.6”。

当然,这个模型还是一个进化中的模型,一个综合 benchmark 的接近,不能直接等同于真实体验完全追平 Claude Opus 4.6。在 Terminal-Bench、HLE 等高难度任务上,Qwen3.8-27B 仍然存在差距。

另外,在很多评测里,它还有一个很突出的特点:特别能“想”,很多任务会生成远多于同类模型的 reasoning token,用时间换能力——Simon Willison 实测时,默认推理档让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。

不过这些都没有改变真正重要的地方:

它只有 270 亿参数。

这意味着,几个月前还需要数百亿、数千亿乃至更大规模模型才能稳定达到的能力区间,现在第一次被压进一个消费级硬件真正有机会容纳的尺寸。

而在4-bit 量化之后,模型权重可以压到 17GB 左右。一张 24GB 级显卡已经进入可以部署它的范围;拥有较大统一内存的 Apple Silicon 设备也能运行。当然,17GB 的权重不等于 17GB 内存就够了。真正运行还要给 KV Cache、上下文、视觉组件和运行时留空间,长上下文尤其吃内存。但事实上,重要的边界已经跨过去了。

过去,本地模型经常面临一个尴尬:跑得动的不够聪明,够聪明的跑不动。Qwen3.8-27B 第一次让这两件事情在一个非常有现实意义的尺寸上碰到了一起。

所以从现在开始,任何新发布的,不只是小尺寸的模型,甚至包括DeepSeek等模型在内,都会被开发者拿来先问一个问题:

比 Qwen3.8-27B 怎么样?

过不了这一关,很难再有讨论的价值。这就是新的斩杀线。



1

由DeepSeek 定义的上一条斩杀线,最重要的武器其实是性价比。

旗舰模型的能力,以 Flash 级的价格卖出来。开发者第一次意识到,顶级智能未必意味着昂贵 API。

但这套性价比仍然建立在云端。模型放在数据中心,开发者按 token 购买使用权。单价可以不断降低,只要 Agent 开始长时间工作,token 消耗仍然会持续累积——一个 Coding Agent 读代码库、改代码、跑测试、再修改,一项任务产生几十万 token 已经越来越常见。国内日均 token 调用量已经站上 140 万亿,比 2024 年初增长超过千倍。

而且单价也未必一直往下走。8月中,DeepSeek 完成了成立以来幅度最大的一轮提价,V4-Pro 高峰时段的输出价格从每百万 token 6 元调到 27 元,同步引入峰谷计费,智谱和 Kimi 此前也已相继调价。如果你的线画在报价单上,那就注定会跟着报价单移动。

也就是说,过去两年模型公司的竞争,基本是在回答:同样的智能,谁的 token 更便宜?但Qwen3.8-27B 把问题推进了一步:同样的智能,究竟需要多大的模型?

这是两种完全不同的效率。一个千亿参数模型便宜 30%,依然要住在数据中心里;一个 27B 模型如果能够完成过去千亿级模型才能完成的大部分工作,它改变的是模型部署的物理边界。

过去半年,行业所谓的“斩杀线”仍然大致锚在千亿级甚至更大的模型上。今天,参数规模缩到了 270 亿,智能水平却进入了上一代千亿级旗舰所在的区间。参数量缩了接近一个数量级,智能没有跟着掉一个数量级。

模型竞争因此出现了一个越来越重要的指标:智能密度。

每十亿参数究竟能装下多少能力?做到同样一件事情,需要多少显存、多少内存带宽、什么级别的机器?这些问题过去是模型评测的配角,现在正在走到前台。

原因也不复杂。对绝大多数真实任务而言,智能正在逐渐从稀缺走向过剩。其实我们今天大部分的真实 AI 任务,真正的瓶颈已经不是模型够不够聪明,而是这么聪明的模型能不能足够便宜、足够快、足够容易地跑起来。

企业知识库不需要解决 IMO,会议纪要用不上世界最强的推理模型,大量代码修改、信息抽取和后台 Agent 同样如此。模型能力达到某个阈值以后,再多五分 benchmark,对大量产品已经没有前五十分那么重要;但如果同样的能力从 200GB 显存降到 24GB,产品形态会直接改变。

Qwen3.8-27B 斩掉了这道硬件门槛。

2

Qwen3.8-27B 能力突破背后的原因,其实也不只是简单的“模型越来越强”能概括的。

过去两年,为了让大模型更便宜,行业最成功的一条技术路线是 MoE,混合专家。它的办法很好理解:模型里养很多“专家”,一次任务只叫其中一部分出来工作。这样可以把模型总容量做得很大,同时控制一次推理实际需要的计算量。DeepSeek 把这条路线推到了很高的位置。

但 MoE 有一个在云端不明显、到了个人设备上却很麻烦的问题,就是专家不工作,不代表专家不存在。模型的总权重仍然需要被存储,驻留在显存和内存里,或者在层级存储之间高效调度。稀疏激活可以大幅降低每个 token 的计算量,却不会让一个数千亿总参数的模型凭空缩成 20GB。

所以 MoE 特别适合数据中心——几十张甚至几百张 GPU 共同承载一个巨大的模型,再用稀疏激活降低推理成本。到了 PC、机器人、汽车和边缘设备,另一件事变得更重要:模型本身能不能放得下。

Qwen3.8-27B 是一个稠密模型。这意味着它没有 MoE 那种依靠大量闲置专家换容量的空间,效率必须从架构本身一点一点抠出来。

Qwen 在这一代继续使用混合注意力结构:64 层里 48 层是线性注意力,其余保留传统全注意力。线性注意力的一项重要价值,是长上下文运行时不需要像纯 Transformer 那样让 KV Cache 随序列长度不断膨胀;保留部分全注意力层,又避免完全牺牲模型回看细节和复杂上下文的能力。这是典型的工程取舍,在能力、显存和长上下文成本之间找平衡。

MTP,也就是 Multi-Token Prediction,解决另一个问题。大模型通常一个 token 一个 token 往外吐,本地推理很容易被串行解码速度卡住。MTP 让模型具备一次预测多个未来 token 的能力,配合 speculative decoding 提高生成吞吐。在云端,这可能只是又一项优化;在本地,它直接影响一个模型究竟是能启动还是真的能用起来。

此外,它还有原生视觉能力,Qwen3.8-27B 可以直接处理图像和视频,很多场景里不必再外挂一套视觉模型。

这几项技术单独拿出来都不是突然出现的新发明。真正困难的是把它们同时塞进一个 27B 稠密模型里,然后仍然维持足够高的智能。

这件事情显然也不是 Qwen 到 3.8 才突然想明白的。

3

回头看 Qwen 过去三年的路线,会发现 Qwen3.8-27B 并不是一次偶然命中。

2023 年 8 月,Qwen 第一批开源模型发布的时候,全世界的聚光灯还在 Llama 身上。几个月后,Qwen 同时放出了 72B 和 1.8B。

这个细节现在回头看很重要。也就是Qwen从第一年开始,小模型就不是旗舰模型旁边顺手附送的缩水版,而是它开源路线的一部分。

到了 Qwen2,参数尺寸进一步从 0.5B 一路铺到 72B;Qwen2.5 延续同样的做法;后来 QwQ-32B 又用 32B 这个尺寸专门挑战当时最热门的 reasoning 模型。这几年 Qwen 的产品线一直有一个非常鲜明的特点:尺寸特别全。大模型、小模型,Dense、MoE,通用、Coding、数学、视觉,不断往同一套模型体系里填。

这条路线在相当长一段时间里并不显眼。模型行业最容易获得关注的永远是那个最大的型号和榜单第一,尤其 DeepSeek R1 爆发以后,开源模型的叙事几乎完全被 DeepSeek 接管。Qwen 做的事情显得没那么性感:继续发模型,继续填尺寸,继续让开发者量化、微调、魔改。

但今天这件事情开始产生复利。

Hugging Face 今年的开源生态报告专门把 Qwen 拿出来讨论:Qwen 已经产生超过 15 万个明确的衍生模型,如果计算所有带有 Qwen 标签的模型仓库,数量超过 20 万;今年 Qwen 系列的下载量超过 30 亿次,超过 Google 和 Meta 的总和。报告同时观察到一个很重要的趋势:小模型的下载和实际部署量远高于超大型模型。原因很简单,绝大多数开发者并没有一个数据中心。



这解释了 Qwen 为什么会走到今天这个位置。

长期做小模型,积累的并不只是“怎么把参数砍掉”。训练数据怎么配,什么能力缩模型后最容易丢,教师模型和学生模型之间,应该保什么,量化之后哪部分最敏感,长上下文怎样降低内存消耗,开发者手里最常见的硬件是什么——这些细节需要一代一代模型实际发布之后,靠大量部署和反馈磨出来。

另一方面,大模型继续负责往上探能力边界。Qwen 的大尺寸 MoE 和小尺寸 Dense 并不是两条互不相关的产品线:这一代的旗舰是 2.4T 参数的 MoE,27B 和它共享同一套混合注意力骨架,更大的模型负责探索能力、生产数据和提供学习来源,经过验证的架构和训练方法,再逐渐向更小尺寸迁移——老师和学生长在同一个架构里。

所以今天回头看,Qwen 过去几年的技术路线其实很清楚:

大模型负责把智能做出来,小模型负责把智能压进去。

Qwen3.8-27B 是这两条路线第一次在一个非常醒目的位置汇合。它证明 Qwen 做了三年的“全尺寸”,并不仅仅是为了 Hugging Face 页面上多摆几个型号。真正的目标,是让同一档智能不断向更小的参数规模下沉。

27B 只是目前最引人注目的那个落点。

4

Qwen3.8-27B打开的是一类过去一直卡在中间的产品。

机器人就是最典型的例子。今天很多具身智能系统,本体真正能够长期运行的仍然是比较小的模型,碰到复杂视觉理解、任务规划或者高难度判断,再把请求送到云端更大的模型。原因并不神秘:本地跑得动的还不够聪明,够聪明的又太大。AI PC、汽车、智能眼镜和大量企业本地 Agent,本质上都面对同一个问题。这里缺的从来就是一样东西:足够强,同时真的塞得进去的模型。

硬件生态的反应最能说明问题。Qwen3.8-27B发布当天,NVIDIA 为它做了从 RTX 显卡、DGX Spark 到 Jetson 边缘平台的全线适配,机器人业务的官方账号专门发帖,说它已经为边缘准备好;官方博客强调的卖点,是开发者可以让敏感代码和专有数据留在自己的设备上。芯片公司为一个模型连夜铺路,赌的是自己的硬件销量。

Qwen3.8-27B 还远远没有小到能直接塞进一副眼镜或者普通手机,24GB 级显存目前也称不上真正的大众设备。但产业里一个重要的边界已经向前移动了。

当上一代旗舰级别的智能先从数据中心下降到一张消费显卡,“小模型”的春天正式到来。

Qwen3.8-27B 会成为新的一条斩杀线,它第一次把这条线明显地往设备侧挪了一步。以后判断一个模型有没有价值,问题不会只是它还能不能再聪明一点,还要看这一档智能,究竟能被压进多小的机器里。

毕竟当智能足够以后,谁能把它装进更多设备,谁才拥有更大的分发能力。这才是AI进入现实世界解决真问题的关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
6毫米结石堵住输尿管,27岁男子手术前夜自行排石:反复跳跃、蹲起,拿筋膜枪对着右侧腰部震了近半小时,“手术可以取消了”;致肾脏破裂

6毫米结石堵住输尿管,27岁男子手术前夜自行排石:反复跳跃、蹲起,拿筋膜枪对着右侧腰部震了近半小时,“手术可以取消了”;致肾脏破裂

大风新闻
2026-09-01 12:08:07
李维康去世仅2天,私生活被扒底朝天,原来她和迟重瑞同病相怜

李维康去世仅2天,私生活被扒底朝天,原来她和迟重瑞同病相怜

月光作笺a
2026-09-02 09:02:07
为什么女朋友觉得年入百万是很简单的事?网友评论:扎心啊!

为什么女朋友觉得年入百万是很简单的事?网友评论:扎心啊!

夜深爱杂谈
2026-09-02 19:30:12
外交部:尼泊尔泥石流灾害已排查出261名失联外籍人员

外交部:尼泊尔泥石流灾害已排查出261名失联外籍人员

澎湃新闻
2026-09-02 17:21:58
马媒:7比1打败阵风不重要,歼-16飞行6000公里后立刻上阵才厉害

马媒:7比1打败阵风不重要,歼-16飞行6000公里后立刻上阵才厉害

陶慕剑地球观察
2026-09-01 18:31:54
今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

今晚赛事:9月2日晚19点55,中央电视台CCTV5、CCTV5+ 直播节目单

拾光纪闻
2026-09-02 05:27:55
林肯号惨成啥样?看这张图就明白了

林肯号惨成啥样?看这张图就明白了

观察者网
2026-09-02 17:56:05
三地政府主要领导调整

三地政府主要领导调整

新浪财经
2026-09-01 17:30:51
一天双重羞辱!上合被印度说教,G20被欧盟除名,俄罗斯局面难堪

一天双重羞辱!上合被印度说教,G20被欧盟除名,俄罗斯局面难堪

趣文说娱
2026-09-02 16:15:31
狼牙山五壮士幸存者葛振林,晚年坦言当年隐情:他与宋学义一同跳下,没想到一株老树竟扭转了终生际遇

狼牙山五壮士幸存者葛振林,晚年坦言当年隐情:他与宋学义一同跳下,没想到一株老树竟扭转了终生际遇

磊子讲史
2026-08-31 14:10:54
29.99万!小米新车官宣:9月7日,正式上市!

29.99万!小米新车官宣:9月7日,正式上市!

科技堡垒
2026-09-02 15:44:55
孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

孙宇晨2018年6月被限制出境,结果不到4个月人就在美国了

江启
2026-08-31 04:00:08
4名“班主任”被抓!常州各班级注意

4名“班主任”被抓!常州各班级注意

中吴网
2026-09-02 16:27:23
世预赛亚大区官方实力榜:中国男篮升至第5 日本跌第3韩国第8

世预赛亚大区官方实力榜:中国男篮升至第5 日本跌第3韩国第8

醉卧浮生
2026-09-02 14:50:27
打到快凌晨2点、鏖战近5个小时,美网险爆大冷:头号种子3-2晋级

打到快凌晨2点、鏖战近5个小时,美网险爆大冷:头号种子3-2晋级

寒士之言本尊
2026-09-02 19:09:13
美国一军事专家曾透露出一惊人内情:"日本故意招惹中国,其实是为了达到另一个目的!他们就想激怒中国,好趁机给自己松绑扩军!"

美国一军事专家曾透露出一惊人内情:"日本故意招惹中国,其实是为了达到另一个目的!他们就想激怒中国,好趁机给自己松绑扩军!"

扶苏聊历史
2026-09-01 15:47:22
孙割被割:1.9亿刀,仅退款、小作文惹毛川普

孙割被割:1.9亿刀,仅退款、小作文惹毛川普

小小河
2026-08-31 16:27:29
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
国乒教练组大洗牌!马琳升职掌权,肖战牺牲让步,王皓争议并非空穴来风

国乒教练组大洗牌!马琳升职掌权,肖战牺牲让步,王皓争议并非空穴来风

南风入弦y
2026-09-01 16:24:49
连爆大冷!世界第1第4第5第6集体一轮游,国羽男单5进2,李诗沣7-21惨败出局

连爆大冷!世界第1第4第5第6集体一轮游,国羽男单5进2,李诗沣7-21惨败出局

锐评利物浦
2026-09-02 15:19:28
2026-09-02 20:04:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3372文章数 10529关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

时尚
教育
亲子
数码
艺术

夏天别总穿黑色裤子,试试这几款高腰裙,显瘦优雅又提气质

教育要闻

新生入学当天,成都这所学校办了一场“导师双选会”

亲子要闻

如何激发孩子的学习兴趣

数码要闻

179元!米家石墨烯暖风机C众筹开售 支持80°广角送风

艺术要闻

明代隐藏的“草书奇才”!水平不输张旭、怀素,当今知道他的人不足1%

无障碍浏览 进入关怀版