网易首页 > 网易号 > 正文 申请入驻

下载了千问3.8之后,我发现网上都吹错了重点

0
分享至



作者|Hayward

原创首发|蓝字计划

刚刚过去的一周,是让无数AI人夜不能寐的一周。

从8月13日的DeepSeek V4 Pro开始,再到后面的Gemini、智谱GLM 5.3和千问3.8 27B,每个大模型都很重磅,又偏偏挑在北京时间的凌晨时段发布,要出稿的媒体们,想睡都睡不了。

但在这一波新大模型热中,有一个大模型的热度始终贯穿整个8月:千问3.8系列

其实这一轮热度其实从8月初就开始了。千问先发布了旗舰模型千问3.8-Max,随后又把27B版本放上Hugging Face。模型开放两天,下载量便突破100万次,连续几天占着全球模型热榜第一。



国外最大的本地大模型社区LocalLLaMA,很快被千问3.8系列的各种测试、部署和量化帖子淹没。重复话题实在太多,版主干脆专门开了一个集中讨论帖。

有人一本正经地发帖讨论,千问3.8的出现,是不是说明大模型的规模定律已经快走到头了;还有人看完测试结果,当场表示周一开盘就去买阿里股票

别以为反应激烈的只有网友,连一向对中国大模型不太对付的海外媒体,也有点陌生了。

比如,《连线》杂志把千问3.8放进了“中国开源AI正在挑战硅谷玩法”的报道里;欧洲新闻台认为,它已经开始追赶Claude一直对外宣传的复杂工作能力。就连X平台汇总相关讨论时,给出的标题也是“中国AI正在追上美国模型”。

虽然,在大模型社区,每次新模型发布,总少不了几句“改变游戏规则”,但这次热度只空前,讨论之热烈,好像还真不止来至于新模型发布的新鲜感。

特别是当我们亲自上手体验了整个千问3.8系列之后,才发现它真正牛的地方

写文章堪比Opus 4.6?

既然要体验千问3.8系列,那离不开的重头戏,自然是让无数国外友人震惊的千问3.8-Max

它是整个系列的旗舰,总参数达到2.4万亿,每次运行调用其中约950亿参数,最长可以处理100万token的内容。

至于老外为什么吹得这么猛,看着两个跑分其实就明白了。

Terminal-Bench 2.1考察模型能否独立操作命令行,完成安装软件、修改文件和运行程序等任务。千问3.8-Max的平均通过率为86.6%,距离GPT-5.6 Sol只差2.2个百分点。

IFBench考察模型能不能同时遵守多项要求。千问3.8-Max的提示词通过率达到82.8%,超过GPT-5.6 Sol的72.7%和Claude Fable 5的63.5%,在这一项直接完成反杀。



一个证明它能办事,一个证明它听得懂人话。如今千问3.8-Max已经可以直接和最新的GPT、Claude同场较量,而且还有来有回。

而且这两个测试,对我们这些干编辑的来说也有价值,毕竟能乖乖根据提示词来生成内容,就是写出好内容的第一步。只不过相比跑分,其实我更关心它最后写出来的东西到底怎么样。

尤其是海外社区已经有人声称,千问3.8的写作能力可以接近Opus 4.6。后者一直是AI圈自媒体大神卡兹克心里写作最好的大模型。这个评价,可是连目前最牛的GPT和Claude都未曾拥有的。

所以,我准备了一道专门考验短文逻辑、段落组织和文风的题目,把它同时交给了千问3.8-Max和GPT-5.6 Sol。





|可以看到,同样一组材料交给两款模型,最后写出来的东西,风格确实很不一样。

GPT-5.6 Sol这一版,整体更像一篇已经搭好骨架的短文,铺垫、转折和前后承接都比较完整。

不过,GPT的老毛病同样存在。

像“问题也恰恰出在AI太认真了”“这让AI清理相册碰到了一个很典型的边界”,还是过于生硬了,文章的转折就显得很刻意,为了转折而转折。而且它还出现了个致命问题:

说好的500字,实际却生成了超过1000字,完全不听命令。

而千问3.8-Max的处理方式要简单粗暴不少。整个文章都跟着提示词的节奏来,反差转折?没有的。情感铺垫?没有的。甚至它还鼓捣出了个“金句”:

“按画质衡量都是差照片,按记忆衡量却都是绝版。”

但也正是少了技巧、技法,有些地方甚至像是想到哪写到哪,也因此少了几分过度整理的痕迹。

甚至像“那位差点失去父亲背影的用户,事先多半也不知道,最后一张会糊成这样。”这句,严格来说没有提供新的信息,按照大部分AI的标准来看,就是个废话。

不过,大部分人说话、写东西,就是会有一些废话出现。恰到好处的啰嗦,反而更有活人感。

而这点,在当前绝大部分的体验、评测中都没有提到,我甚至觉得那些狂吹的老外们,都没有吹到了重点上。

就在这个对比之前,我还试过让千问3.8 Max写过一段视频脚本的开头。不仅独自构思了一个比较有意思的视频开头,而且还会自己营造“悬疑解谜”的画面,并藏住答案。



|这显然要比GPT那种理工直男思维的线性叙事更有意思。

所以,至少从我自己的体验来看,只论写作,千问3.8-Max想要超过Opus 4.6还不现实。但它写出来的东西有时比GPT更像人,这一点确实出乎我的意料。

如果再迭代几个版本,把逻辑链和段落连接补上,它在日常写作里替代GPT,已经不是什么遥远的事。

不过,在这几天的体验中,其实比起千问3.8 Max的“活人感”,真正让我大受震撼的,是最近刚刚开放权重的千问3.8-27B。

顶级大模型,普通人也可以拥有了

千问3.8-Max确实很强,但它有2.4万亿参数。对普通人来说,这种体量基本只能在线使用。就算把权重下载回来,家里的电脑也跑不动。

千问3.8-27B就不一样了。

它只有270亿参数,能力比Max弱一些,但它最大的价值在于整个模型却可以下载回来,直接装进你家的电脑里。

而且它的性能可不弱。按照千问公布的成绩,千问3.8-27B在Terminal-Bench 2.1拿到73.0分,已经接近Claude Opus 4.6的78.2分。到了考验真实软件修复能力的SWE-bench Pro,它又拿到61.7分,超过Opus 4.6的53.4分。

也就是说,这款可以本地部署到你家里的模型,性能已经在部分测试中摸到了前代顶级闭源模型的边缘。

虽然并不是随便一台电脑都能装,但整体看来只要有一块一万元左右的显卡就能拥有这款旗舰级别的开源大模型,也难怪大家对这个版本的热情高得有点吓人。

就在当天,我也把千问3.8-27b下载到了电脑里。这是一个4-bit量化版本,模型文件占用大约16GB。我的电脑用的是一张16GB显存的RTX 4080,外加48GB内存。



那装在本地的千问3.8 27B效果怎么样呢?实话说,有点超出我的预期。

关闭思考模式以后,千问3.8-27B的生成速度可以达到每秒26个token。屏幕上的字往外冒得比人阅读还快,一篇五百字左右的回答,通常不用等上一分钟。



而且,在速度没问题的基础上,写出来的东西其实也可以。

我把同一道题同时交给了本地运行的千问3.8-27B、线上的千问3.8-Max和GPT-5.6 Sol。题目要求们详细分析RTX 4080相比RTX 3080,在大模型本地推理上的优势,写五百字左右。

三家都用了一句翻案的话开头,先否定只看算力的思路,随后把重点转到显存容量。后面的论证也差不多,显存负责撑起主线,架构、带宽和功耗跟在后面补充,结尾再落到RTX 4080可以运行更大的模型。



虽然结构类似,但风格却不一样。千问3.8-Max选择列清单,GPT-5.6 Sol写得更完整,本地27B则交付了一篇连续的短文。

只不过,其实从易读性来说,如果我想要的是一个“答案”,千问3.8 27B整出来的内容就足够清晰明了了,没有简单粗暴的参数堆叠,给出的答案也有理有据。

它还抓到了这道题最有价值的地方。其实RTX 4080最核心的优势是16GB的显存,它是目前高性能量化大模型能部署到本地的生命线,也是对比只有10GB显存的3080最核心的优势。

然而,正在我打算大夸特夸千问3.8 27B的时候,它又不可避免地翻车了。

它声称RTX 4080的显存带宽大约是1024GB/s,RTX 3080则是936GB/s,但实际上3.8-Max和GPT-5.6 Sol给出的参数:RTX 4080是716.8GB/s,RTX 3080 10GB版是760GB/s,才是对的。

部署在本地的千问3.8 27B,还是吃了没能联网搜索数据的亏。

这也说明了,除去了准确性之外,一个部署在本地的大模型,其实已经有了相当高的可用度。

而且它所组织的语言也还算流畅,特别是体现出了一种比较罕见的特质:回答技术问题时,知道什么该说详细点,什么可以一笔带过,哪怕对参数完全不懂,也能知道个高低好坏。

后续如果打算用它来修改文章、生成提示词,后者接入爱马仕等用来做一些简单的内容生成,已经足够了。

而且这个部署在本地的千问3.8 27B,甚至还支持多模态,你把一张图片丢给它,它还能帮你“看”这张图。

一个家用电脑里的27B,已经有资格和千问旗舰、GPT最新模型放在一起批改作业。哪怕最后输了一点,这件事本身也已经够离谱了。

好用,但也非毫无代价

可惜的是,随着使用的日益深入,我也有了更多的遗憾。

首先,前面提到千问3.8 27B每秒26个token的速度,有个重要前提:得关掉思考模式。

打开以后,速度会跌到每秒5个token左右。模型会先输出很长的思考过程,哪怕是一个很小的问题,也会先思考个一分钟再作答,很折磨人。

这甚至是整个千问3.8系列的弊病。海外社区里也有人吐槽,千问3.8-Max有时会在思考过程中反复绕圈,答案越写越长,和GPT那简单直接、真正的不绕圈子,形成了鲜明对比。

不过更多的遗憾,是来自电脑配置这件事上。

实际上,按照社区的反馈,千问3.8 27B最值得安装的版本,是NVFP4量化的版本。它同样把权重压到4位,NVIDIA还专门为这种格式做了硬件加速,尽量减少模型压缩后的能力损失。

可惜,我的RTX 4080属于上一代Ada架构,吃不到这项原生加速。想把NVFP4的优势用出来,至少要换到采用Blackwell架构的RTX 50系列。

但众所周知,当前的英伟达50系已经涨上天了。之前人厌狗嫌的RTX 5080 ,价格也涨到了12999元,已经比当年首发时的RTX 4090都要贵了,更不要说最适合部署NVFP4的显卡,RTX5090。

也就是说,最适合普通人用的,低成本又低成本的大模型实际上是离我们越来越近了;但又因为硬件涨价,又远离了普通人。

毫无疑问,千问3.8 Max值得吹上一番,3.8-27B更是值得留在硬盘里。只是这类好用开源模型的真正辉煌时刻,可能还是得看硬件价格什么时候肯放过普通人了。

声明:个人原创,仅供参考

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
63-84!世界杯首支亚洲队出局 8强已定5席 中国女篮利好 保送晋级

63-84!世界杯首支亚洲队出局 8强已定5席 中国女篮利好 保送晋级

侃球熊弟
2026-09-09 01:31:26
西安女子街边雨水井投放采血管?女子已找到,样本已送检

西安女子街边雨水井投放采血管?女子已找到,样本已送检

听心堂
2026-09-09 09:35:18
轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

轮到伊朗斩首了,导弹从天而降,大批美军官被抬走?英法德俄失声

梦史
2026-09-06 00:39:59
2-1!美网首个4强诞生!萨巴伦卡连续6年晋级 郑钦文比赛时间出炉

2-1!美网首个4强诞生!萨巴伦卡连续6年晋级 郑钦文比赛时间出炉

侃球熊弟
2026-09-09 02:07:15
调整! 央视直播中国女篮复赛时间有变,对阵波多黎各三大优势,胜券在握

调整! 央视直播中国女篮复赛时间有变,对阵波多黎各三大优势,胜券在握

白首狂夫n
2026-09-09 08:18:26
【油价大降】近1.84元/升,2026年汽柴油“最大降价”后“高歌猛进”,下次9月11日调价,汽柴油“2连涨”,预涨260元/吨!

【油价大降】近1.84元/升,2026年汽柴油“最大降价”后“高歌猛进”,下次9月11日调价,汽柴油“2连涨”,预涨260元/吨!

猪友巴巴
2026-09-09 14:50:04
穆帅:赢下比赛当然很高兴,但我不能当着国米的面庆祝

穆帅:赢下比赛当然很高兴,但我不能当着国米的面庆祝

懂球帝
2026-09-09 06:57:05
发不出工资,很多单位开始“不择手段”了

发不出工资,很多单位开始“不择手段”了

职场资深秘书
2026-09-03 19:07:38
伊朗称在霍尔木兹海峡捕获美无人潜航器

伊朗称在霍尔木兹海峡捕获美无人潜航器

澎湃新闻
2026-09-09 00:50:02
A股:行情有点异常,股民做好准备,明天周四,或将重演熟悉行情

A股:行情有点异常,股民做好准备,明天周四,或将重演熟悉行情

虎哥闲聊
2026-09-09 15:15:54
医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

医生发现:每天早起后先排便的人,用不了半年,身体或迎来5改变

任医生聊健康
2026-06-08 20:00:48
美国将于9月29日禁止进口加拿大乳制品、酒类 和机动车辆

美国将于9月29日禁止进口加拿大乳制品、酒类 和机动车辆

每日经济新闻
2026-09-09 08:50:11
“4岁男童被指摸臀事件”当事女子账号已被禁止关注;此前回应“蹭流量”称干自媒体需要流量;伊能静发声:建议家长都更有法律意识

“4岁男童被指摸臀事件”当事女子账号已被禁止关注;此前回应“蹭流量”称干自媒体需要流量;伊能静发声:建议家长都更有法律意识

极目新闻
2026-09-08 18:26:30
大难临头各自飞?郭德纲被处罚仅2天,身边人陆续传出“喜讯”

大难临头各自飞?郭德纲被处罚仅2天,身边人陆续传出“喜讯”

翰飞观事
2026-09-09 19:19:28
华人正在逃离马来西亚!40%变22%,马来至上把华人全逼走了!

华人正在逃离马来西亚!40%变22%,马来至上把华人全逼走了!

一路荒凉如歌a
2026-09-09 05:28:44
飞机上大妈霸占座位,空姐劝阻遭辱骂,机长一句话让她面红耳赤

飞机上大妈霸占座位,空姐劝阻遭辱骂,机长一句话让她面红耳赤

今天说故事
2025-08-07 16:14:09
“平价山姆”要来了!金粒门或在苏州新开5家门店

“平价山姆”要来了!金粒门或在苏州新开5家门店

姑苏网
2026-09-09 18:35:09
官方:国足亚运队补招李新翔和张志雄参加集训

官方:国足亚运队补招李新翔和张志雄参加集训

懂球帝
2026-09-09 17:11:05
库明加亮相森林狼训练馆!与华子开心拥抱 和主帅高管认真交流

库明加亮相森林狼训练馆!与华子开心拥抱 和主帅高管认真交流

罗说NBA
2026-09-09 08:38:05
拼了!王思雨继续借助止痛药+消炎药缓解脚伤 将带伤战波多黎各

拼了!王思雨继续借助止痛药+消炎药缓解脚伤 将带伤战波多黎各

醉卧浮生
2026-09-09 15:45:47
2026-09-09 20:20:49
蓝字计划 incentive-icons
蓝字计划
记录智能时代的每一次浪潮!前沿科技捕手,AI产品深度洞察。
325文章数 3896关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

男子被误导签下年交60万的大额保单 连缴两年无力承担

头条要闻

男子被误导签下年交60万的大额保单 连缴两年无力承担

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

红旗HS7 PHEV申报图曝光 尺寸升级/搭载激光雷达

态度原创

手机
健康
旅游
教育
公开课

手机要闻

苹果iPhone 18 Pro将搭载更小的灵动岛,支持显示三项实时活动

中风康复为何像“抽丝剥茧”?

旅游要闻

初秋好天气,游览泰山天烛峰景区

教育要闻

北京40名学生获国家级奖学金!教育部最新公布——

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版