网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-27B就是新的模型斩杀线

0
分享至

最能动手折腾模型的开源社区开发者,往往也是最会玩梗造概念的一群人。最近半年,他们最爱的一个概念是“斩杀线”。

这个词借自游戏,后来在更广泛的场合里变得更加流行。它原指血量落到某个数字以下,对手下一回合就能把你带走,比赛实际上已经提前结束。

把它套到模型上,过往一段时间人们指代的是 DeepSeek 一直在扮演的角色:一个新模型出来,先和 DeepSeek 比能力,再比价格。如果性能上不去、价格又降不下来,发布当天基本就失去了讨论价值。

从 R1 开始,DeepSeek 一度成为模型世界默认的那条线。

但现在,这条线看起来要换人了。

8月14日,Qwen3.8-27B 发布,开源两天下载量破百万,登顶 Hugging Face 全球趋势榜,编程 Agent 工具 Cline 的开发者里,它只用四天就成了被选择最多的本地模型。Artificial Analysis 的 Intelligence Index 给了它 52 分,已经进入 GPT-5.6 Luna、DeepSeek V4 Flash 这一档模型所在的区间。开发者给它起了一个更直白的外号:

“本地 Opus 4.6”。

当然,这个模型还是一个进化中的模型,一个综合 benchmark 的接近,不能直接等同于真实体验完全追平 Claude Opus 4.6。在 Terminal-Bench、HLE 等高难度任务上,Qwen3.8-27B 仍然存在差距。

另外,在很多评测里,它还有一个很突出的特点:特别能“想”,很多任务会生成远多于同类模型的 reasoning token,用时间换能力——Simon Willison 实测时,默认推理档让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。

不过这些都没有改变真正重要的地方:

它只有 270 亿参数。

这意味着,几个月前还需要数百亿、数千亿乃至更大规模模型才能稳定达到的能力区间,现在第一次被压进一个消费级硬件真正有机会容纳的尺寸。

而在4-bit 量化之后,模型权重可以压到 17GB 左右。一张 24GB 级显卡已经进入可以部署它的范围;拥有较大统一内存的 Apple Silicon 设备也能运行。当然,17GB 的权重不等于 17GB 内存就够了。真正运行还要给 KV Cache、上下文、视觉组件和运行时留空间,长上下文尤其吃内存。但事实上,重要的边界已经跨过去了。

过去,本地模型经常面临一个尴尬:跑得动的不够聪明,够聪明的跑不动。Qwen3.8-27B 第一次让这两件事情在一个非常有现实意义的尺寸上碰到了一起。

所以从现在开始,任何新发布的,不只是小尺寸的模型,甚至包括DeepSeek等模型在内,都会被开发者拿来先问一个问题:

比 Qwen3.8-27B 怎么样?

过不了这一关,很难再有讨论的价值。这就是新的斩杀线。



1

由DeepSeek 定义的上一条斩杀线,最重要的武器其实是性价比。

旗舰模型的能力,以 Flash 级的价格卖出来。开发者第一次意识到,顶级智能未必意味着昂贵 API。

但这套性价比仍然建立在云端。模型放在数据中心,开发者按 token 购买使用权。单价可以不断降低,只要 Agent 开始长时间工作,token 消耗仍然会持续累积——一个 Coding Agent 读代码库、改代码、跑测试、再修改,一项任务产生几十万 token 已经越来越常见。国内日均 token 调用量已经站上 140 万亿,比 2024 年初增长超过千倍。

而且单价也未必一直往下走。8月中,DeepSeek 完成了成立以来幅度最大的一轮提价,V4-Pro 高峰时段的输出价格从每百万 token 6 元调到 27 元,同步引入峰谷计费,智谱和 Kimi 此前也已相继调价。如果你的线画在报价单上,那就注定会跟着报价单移动。

也就是说,过去两年模型公司的竞争,基本是在回答:同样的智能,谁的 token 更便宜?但Qwen3.8-27B 把问题推进了一步:同样的智能,究竟需要多大的模型?

这是两种完全不同的效率。一个千亿参数模型便宜 30%,依然要住在数据中心里;一个 27B 模型如果能够完成过去千亿级模型才能完成的大部分工作,它改变的是模型部署的物理边界。

过去半年,行业所谓的“斩杀线”仍然大致锚在千亿级甚至更大的模型上。今天,参数规模缩到了 270 亿,智能水平却进入了上一代千亿级旗舰所在的区间。参数量缩了接近一个数量级,智能没有跟着掉一个数量级。

模型竞争因此出现了一个越来越重要的指标:智能密度。

每十亿参数究竟能装下多少能力?做到同样一件事情,需要多少显存、多少内存带宽、什么级别的机器?这些问题过去是模型评测的配角,现在正在走到前台。

原因也不复杂。对绝大多数真实任务而言,智能正在逐渐从稀缺走向过剩。其实我们今天大部分的真实 AI 任务,真正的瓶颈已经不是模型够不够聪明,而是这么聪明的模型能不能足够便宜、足够快、足够容易地跑起来。

企业知识库不需要解决 IMO,会议纪要用不上世界最强的推理模型,大量代码修改、信息抽取和后台 Agent 同样如此。模型能力达到某个阈值以后,再多五分 benchmark,对大量产品已经没有前五十分那么重要;但如果同样的能力从 200GB 显存降到 24GB,产品形态会直接改变。

Qwen3.8-27B 斩掉了这道硬件门槛。

2

Qwen3.8-27B 能力突破背后的原因,其实也不只是简单的“模型越来越强”能概括的。

过去两年,为了让大模型更便宜,行业最成功的一条技术路线是 MoE,混合专家。它的办法很好理解:模型里养很多“专家”,一次任务只叫其中一部分出来工作。这样可以把模型总容量做得很大,同时控制一次推理实际需要的计算量。DeepSeek 把这条路线推到了很高的位置。

但 MoE 有一个在云端不明显、到了个人设备上却很麻烦的问题,就是专家不工作,不代表专家不存在。模型的总权重仍然需要被存储,驻留在显存和内存里,或者在层级存储之间高效调度。稀疏激活可以大幅降低每个 token 的计算量,却不会让一个数千亿总参数的模型凭空缩成 20GB。

所以 MoE 特别适合数据中心——几十张甚至几百张 GPU 共同承载一个巨大的模型,再用稀疏激活降低推理成本。到了 PC、机器人、汽车和边缘设备,另一件事变得更重要:模型本身能不能放得下。

Qwen3.8-27B 是一个稠密模型。这意味着它没有 MoE 那种依靠大量闲置专家换容量的空间,效率必须从架构本身一点一点抠出来。

Qwen 在这一代继续使用混合注意力结构:64 层里 48 层是线性注意力,其余保留传统全注意力。线性注意力的一项重要价值,是长上下文运行时不需要像纯 Transformer 那样让 KV Cache 随序列长度不断膨胀;保留部分全注意力层,又避免完全牺牲模型回看细节和复杂上下文的能力。这是典型的工程取舍,在能力、显存和长上下文成本之间找平衡。

MTP,也就是 Multi-Token Prediction,解决另一个问题。大模型通常一个 token 一个 token 往外吐,本地推理很容易被串行解码速度卡住。MTP 让模型具备一次预测多个未来 token 的能力,配合 speculative decoding 提高生成吞吐。在云端,这可能只是又一项优化;在本地,它直接影响一个模型究竟是能启动还是真的能用起来。

此外,它还有原生视觉能力,Qwen3.8-27B 可以直接处理图像和视频,很多场景里不必再外挂一套视觉模型。

这几项技术单独拿出来都不是突然出现的新发明。真正困难的是把它们同时塞进一个 27B 稠密模型里,然后仍然维持足够高的智能。

这件事情显然也不是 Qwen 到 3.8 才突然想明白的。

3

回头看 Qwen 过去三年的路线,会发现 Qwen3.8-27B 并不是一次偶然命中。

2023 年 8 月,Qwen 第一批开源模型发布的时候,全世界的聚光灯还在 Llama 身上。几个月后,Qwen 同时放出了 72B 和 1.8B。

这个细节现在回头看很重要。也就是Qwen从第一年开始,小模型就不是旗舰模型旁边顺手附送的缩水版,而是它开源路线的一部分。

到了 Qwen2,参数尺寸进一步从 0.5B 一路铺到 72B;Qwen2.5 延续同样的做法;后来 QwQ-32B 又用 32B 这个尺寸专门挑战当时最热门的 reasoning 模型。这几年 Qwen 的产品线一直有一个非常鲜明的特点:尺寸特别全。大模型、小模型,Dense、MoE,通用、Coding、数学、视觉,不断往同一套模型体系里填。

这条路线在相当长一段时间里并不显眼。模型行业最容易获得关注的永远是那个最大的型号和榜单第一,尤其 DeepSeek R1 爆发以后,开源模型的叙事几乎完全被 DeepSeek 接管。Qwen 做的事情显得没那么性感:继续发模型,继续填尺寸,继续让开发者量化、微调、魔改。

但今天这件事情开始产生复利。

Hugging Face 今年的开源生态报告专门把 Qwen 拿出来讨论:Qwen 已经产生超过 15 万个明确的衍生模型,如果计算所有带有 Qwen 标签的模型仓库,数量超过 20 万;今年 Qwen 系列的下载量超过 30 亿次,超过 Google 和 Meta 的总和。报告同时观察到一个很重要的趋势:小模型的下载和实际部署量远高于超大型模型。原因很简单,绝大多数开发者并没有一个数据中心。



这解释了 Qwen 为什么会走到今天这个位置。

长期做小模型,积累的并不只是“怎么把参数砍掉”。训练数据怎么配,什么能力缩模型后最容易丢,教师模型和学生模型之间,应该保什么,量化之后哪部分最敏感,长上下文怎样降低内存消耗,开发者手里最常见的硬件是什么——这些细节需要一代一代模型实际发布之后,靠大量部署和反馈磨出来。

另一方面,大模型继续负责往上探能力边界。Qwen 的大尺寸 MoE 和小尺寸 Dense 并不是两条互不相关的产品线:这一代的旗舰是 2.4T 参数的 MoE,27B 和它共享同一套混合注意力骨架,更大的模型负责探索能力、生产数据和提供学习来源,经过验证的架构和训练方法,再逐渐向更小尺寸迁移——老师和学生长在同一个架构里。

所以今天回头看,Qwen 过去几年的技术路线其实很清楚:

大模型负责把智能做出来,小模型负责把智能压进去。

Qwen3.8-27B 是这两条路线第一次在一个非常醒目的位置汇合。它证明 Qwen 做了三年的“全尺寸”,并不仅仅是为了 Hugging Face 页面上多摆几个型号。真正的目标,是让同一档智能不断向更小的参数规模下沉。

27B 只是目前最引人注目的那个落点。

4

Qwen3.8-27B打开的是一类过去一直卡在中间的产品。

机器人就是最典型的例子。今天很多具身智能系统,本体真正能够长期运行的仍然是比较小的模型,碰到复杂视觉理解、任务规划或者高难度判断,再把请求送到云端更大的模型。原因并不神秘:本地跑得动的还不够聪明,够聪明的又太大。AI PC、汽车、智能眼镜和大量企业本地 Agent,本质上都面对同一个问题。这里缺的从来就是一样东西:足够强,同时真的塞得进去的模型。

硬件生态的反应最能说明问题。Qwen3.8-27B发布当天,NVIDIA 为它做了从 RTX 显卡、DGX Spark 到 Jetson 边缘平台的全线适配,机器人业务的官方账号专门发帖,说它已经为边缘准备好;官方博客强调的卖点,是开发者可以让敏感代码和专有数据留在自己的设备上。芯片公司为一个模型连夜铺路,赌的是自己的硬件销量。

Qwen3.8-27B 还远远没有小到能直接塞进一副眼镜或者普通手机,24GB 级显存目前也称不上真正的大众设备。但产业里一个重要的边界已经向前移动了。

当上一代旗舰级别的智能先从数据中心下降到一张消费显卡,“小模型”的春天正式到来。

Qwen3.8-27B 会成为新的一条斩杀线,它第一次把这条线明显地往设备侧挪了一步。以后判断一个模型有没有价值,问题不会只是它还能不能再聪明一点,还要看这一档智能,究竟能被压进多小的机器里。

毕竟当智能足够以后,谁能把它装进更多设备,谁才拥有更大的分发能力。这才是AI进入现实世界解决真问题的关键。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
外交部答澎湃:首批5名DNA鉴定专家已抵尼,中方正筹备第三批紧急援助物资

外交部答澎湃:首批5名DNA鉴定专家已抵尼,中方正筹备第三批紧急援助物资

澎湃新闻
2026-09-02 15:36:26
部署280多天后,“林肯”号航母抵达泰国,全舰锈迹斑斑凸显美军颓势!

部署280多天后,“林肯”号航母抵达泰国,全舰锈迹斑斑凸显美军颓势!

天下布武
2026-09-02 17:35:16
吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

吴石案终极潜伏者隐姓 42 年,晚年返大陆热泪盈眶

唠叨说历史
2026-01-07 12:42:21
终于走了!领馆撤离成都,以色列在中国人心中的好感是咋崩盘的?

终于走了!领馆撤离成都,以色列在中国人心中的好感是咋崩盘的?

丁鸊惊悚影视解说
2026-08-09 10:44:44
秋天,最补的鱼,不是黄鳝泥鳅,而是这3种鱼,刺少肉厚

秋天,最补的鱼,不是黄鳝泥鳅,而是这3种鱼,刺少肉厚

阿龙美食记
2026-09-02 14:34:24
勒庞决选通杀,亲华候选人只剩2%支持率,法国要彻底变天了

勒庞决选通杀,亲华候选人只剩2%支持率,法国要彻底变天了

简史笔记
2026-09-01 13:39:13
欧美挖的比特币大坑,中国绕着走过去了,回头一看坑里都是自己人

欧美挖的比特币大坑,中国绕着走过去了,回头一看坑里都是自己人

尘世闲云
2026-09-01 05:12:01
大批玻璃杯查出重金属超标!开水一烫就释毒,很多家庭还在天天用

大批玻璃杯查出重金属超标!开水一烫就释毒,很多家庭还在天天用

匹夫来搞笑
2026-09-02 06:59:41
《街霸》电影春丽演员发新照 丰腴大腿愈发还原

《街霸》电影春丽演员发新照 丰腴大腿愈发还原

游民星空
2026-09-01 21:16:34
北大博士手握33份offer任教985三年,考核未过,背着百万房贷离开

北大博士手握33份offer任教985三年,考核未过,背着百万房贷离开

新浪财经
2026-09-02 08:39:22
电影节上,一名大学生向梅婷提问。谁知道问完后,梅婷却说:“我没听懂!”本以为会被骂,没想到现场响起了热烈的掌声

电影节上,一名大学生向梅婷提问。谁知道问完后,梅婷却说:“我没听懂!”本以为会被骂,没想到现场响起了热烈的掌声

二胡的岁月如歌
2026-09-01 20:54:17
别只吹杨瀚森绝杀!男篮险胜黎巴嫩,最大功臣是3个被喷惨的人

别只吹杨瀚森绝杀!男篮险胜黎巴嫩,最大功臣是3个被喷惨的人

面包夹知识
2026-09-01 17:16:13
“大B哥”吴志雄也学好了,杭州修改纹身内容,曝古天乐每一年都会送其劳力士手表

“大B哥”吴志雄也学好了,杭州修改纹身内容,曝古天乐每一年都会送其劳力士手表

裕丰娱间说
2026-09-02 10:29:11
日本果然参战了!伊朗暴怒:喊话1亿日本人,要找高市早苗算账

日本果然参战了!伊朗暴怒:喊话1亿日本人,要找高市早苗算账

军机Nova
2026-09-01 00:19:52
原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

原来普京一直被手下“蒙在鼓里”!中情局局长拉特克利夫想告诉普京,他们长期质疑普京被手下蒙蔽而看不清俄乌战争局势

扶苏聊历史
2026-09-02 17:28:54
“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

“希望4个老人长命百岁”,女子晒3万多退休金,普通人的心却凉了

番外行
2026-09-02 15:33:01
三战70+19已具统治力!埃奇库姆又强壮一档 名宿:史上最强第五巨头

三战70+19已具统治力!埃奇库姆又强壮一档 名宿:史上最强第五巨头

颜小白的篮球梦
2026-09-02 08:27:03
电动自行车限速拟调整至20km/h 九号雅迪小牛等作出回应

电动自行车限速拟调整至20km/h 九号雅迪小牛等作出回应

观点机构
2026-08-30 22:40:09
为什么二手的东西尽量别买?看了网友的分享,简直让人毛骨悚然

为什么二手的东西尽量别买?看了网友的分享,简直让人毛骨悚然

小陆搞笑日常
2026-09-02 09:16:21
泪目!曝耿其昌和女儿在李维康追悼会上的一幕,棺木上盖党旗,垫高棺木原因曝光

泪目!曝耿其昌和女儿在李维康追悼会上的一幕,棺木上盖党旗,垫高棺木原因曝光

裕丰娱间说
2026-09-02 10:22:43
2026-09-02 18:19:00
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3372文章数 10529关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

头条要闻

尼泊尔用无人机找幸存者 隧道被泥浆"像牙膏一样"塞满

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

需要重视的全球“资金失衡”

汽车要闻

23万级给到激光雷达和900km续航 比亚迪海狮08售22.99万起

态度原创

手机
家居
本地
旅游
公开课

手机要闻

华为详解nova 16 Pro内部空间设计,7.1mm机身塞7000mAh电池

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

旅游要闻

韫道启新 合众行远!第十八届孙子文化旅游节9月11日广饶启幕

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版