网易首页 > 网易号 > 正文 申请入驻

DeepSeek MODEL1横空出世,R系列将被放弃还是新生?

0
分享至

一行代码泄漏的新架构标识,正悄然揭示这家中国AI独角兽在轻量化与专用化赛道上的战略转向。

01

开源社区的狂欢

2026年1月20日,DeepSeek-R1发布一周年之际,一位开发者在DeepSeek官方GitHub仓库更新的FlashMLA代码中发现了一个神秘标识——“MODEL1”。这个隐藏在114份文件、数十处代码注释中的名字,迅速点燃了全球AI社区的好奇心。



恰逢Hugging Face发布《“DeepSeek时刻”一周年》博客,盛赞R1对全球开源生态的重塑作用1,MODEL1的现身仿佛一场精心编排的周年献礼。

它究竟是V4的雏形、R2的前奏,还是DeepSeek第三条技术路线的起点?更关键的是:曾以推理能力惊艳世界的R系列,会被放弃吗?

02

时代的技术竞赛

根据对代码库的详细分析,MODEL1展现出与当前旗舰模型DeepSeek-V3.2(代码中标识为V32)完全不同的技术路径。在总计114个文件中,MODEL1被提及28至31次,且被置于与V3.2平行的独立分支中,这明确表明它并非现有模型的简单迭代,而是一个全新的架构序列。

架构层面的标准化回归是MODEL1最显著的特征之一。



DeepSeek V3系列曾采用独特的576维非对称MLA设计(128维RoPE + 448维Latent),而MODEL1则将head_dim参数重新设定为512维。这一“回归标准”的动作并非技术倒退,而是DeepSeek可能已经找到了无需依赖非标维度也能实现高压缩率的新方法。

代码中提及的Engram机制或许就是关键所在,这种机制被认为是DeepSeek在分布式存储或KV压缩上的新突破。通过更完美的GPU Tensor Core计算特性对齐,MODEL1在换取更高计算通用性的同时,可能实现了更优的性能表现。

对下一代硬件的深度适配是MODEL1的另一大亮点。代码库中出现了大量针对英伟达最新Blackwell架构(SM100)的专门优化,包括SM100接口和B200显卡的专用内核实现。



特别值得注意的是,SM100的Head128实现仅支持MODEL1,而不支持V3.2,这被解读为DeepSeek为适配新一代硬件专门优化了新架构。测试数据显示,在尚未完全优化的状态下,MODEL1的稀疏算子在B200上已能达到350 TFlops的算力利用率,显示出其技术前瞻性。

计算效率的显著提升通过引入“Token-level Sparse MLA”机制得以实现。代码中出现了test_flash_mla_sparse_decoding.py测试脚本和FP8 KV Cache混合精度支持。这意味着DeepSeek正在将MLA机制从“全量计算”进化为“Token级稀疏计算”,允许模型在处理超长上下文时动态忽略不重要的Token,从而在显存占用和推理速度上实现数量级优化。

此外,MODEL1每个token的KVCache大小为584字节,相比V3.2的592字节有所减少,在32K长度序列中可节省约256KB内存,这对于边缘设备部署具有重要意义。

03

战略迷雾

V4、R2,还是第三条路线?

MODEL1引发的最大悬念是其产品定位。目前线索指向三种可能:

猜想1:旗舰全能模型V4

此前传闻DeepSeek将于2月发布V4,且编程能力“超过现有顶级模型”1。MODEL1对长序列(16K+)的优化、对文档与代码场景的适配,符合V系列“全能专家”定位。

猜想2:新一代推理专家R2

其稀疏计算、FP8解码、低内存特性完美契合R系列“高效率解题专家”基因。开发者社区认为它可能是“针对大规模推理优化的R1继任者”,甚至实现“双RTX 4090运行1M上下文”。

猜想3:架构层通用底座,支持V与R双线迭代

最可能的情形是:MODEL1并非具体产品,而是新一代基础架构,可同时衍生V系列(重知识广度)和R系列(重推理深度)——类似“芯片级创新”,上层可灵活封装不同能力。

04

R系列的价值重估

在MODEL1引发广泛关注的同时,业界对R系列未来命运的担忧不无道理。



DeepSeek-R1在后训练阶段大规模使用强化学习技术,在仅有很少标注数据的情况下极大提升了模型的推理能力。与传统的监督微调不同,R1开创了一种纯粹的强化学习方法,通过基于规则的奖励系统引导模型进行逻辑推理。

这种“推理即训练”的自我进化机制,突破了自GPT大模型以来的人类输入瓶颈,在数学、代码、自然语言推理等任务上达到了与OpenAI o1正式版接近的性能。

2025年12月,DeepSeek同时发布了DeepSeek-V3.2和DeepSeek-V3.2-Speciale两款模型,前者被形容为“话少活好”的助手,主打高性价比与日常使用;后者则像“偏科”的科研天才,专攻高难度数学问题求解和学术研究逻辑验证。



这种产品分化策略表明,DeepSeek早已认识到不同应用场景对模型能力的差异化需求。R系列作为专门优化的推理模型,与通用对话模型V系列形成了良好的互补关系。

同时,成本控制的突破性是R系列的另一重要价值。

据DeepSeek技术报告,DeepSeek-V3的训练成本仅为557.6万美元,远低于OpenAI的GPT-4(1-2亿美元)和谷歌的Gemini(2亿美元)。R1不仅继承了这种成本控制能力,还通过模型蒸馏技术将推理能力压缩到小至15亿参数的小模型中。

令人惊讶的是,R1的15亿参数蒸馏模型在数学基准测试中能够优于更大的专有模型,在AIME上获得28.9%的分数,在MATH上获得83.9%的分数。这种“四两拨千斤”的技术路线,正是DeepSeek能够在算力受限环境下实现突破的关键。

05

从单一产品到生态矩阵的构建

自2025年2月起,华为云、阿里云、百度智能云、字节火山引擎、腾讯云等国内主要云厂商纷纷宣布上线DeepSeek模型。紧随其后的是各大国产芯片厂商,包括沐曦、天数智芯、摩尔线程、壁仞科技等十数家企业宣布完成了对DeepSeek模型的适配和上线。

由于DeepSeek打破了对高算力的约束限制,国产芯片的利用率得到极大提升。在应用层,金融、医疗、制造、通讯等各行各业都在积极接入DeepSeek模型,希望借助其能力升级自身服务。

从代码结构看,MODEL1并非V3.2的简单缩小版,而是不同的架构选择。V3.2追求最大性能和精度,MODEL1则可能追求效率和可部署性。社区对MODEL1的身份有多种猜测:一种观点认为它可能是一个追求极致效率的轻量级模型,更适合边缘设备部署;另一种分析则指向它可能是一个“长序列专家”,专门为处理超长文档或代码项目而生。

更深入的代码解读发现,MODEL1支持动态稀疏推理和额外的缓存区,这些设计可能旨在提升复杂任务(如智能体应用)的调度能力。

综合以上分析,我们可以得出一个明确的结论:R系列不会被放弃,而是会在DeepSeek的技术演进中扮演新的角色。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
过于离谱,名古屋亚运会中国队尚未登场就被判负,对手不战而胜进四强

过于离谱,名古屋亚运会中国队尚未登场就被判负,对手不战而胜进四强

尘语者
2026-09-17 15:50:58
跑步12年,56岁老跑友掏心窝:为了终身不心梗不脑梗,我就死磕这4件事

跑步12年,56岁老跑友掏心窝:为了终身不心梗不脑梗,我就死磕这4件事

小方说跑步
2026-09-17 09:35:03
CBA最新消息!曝NBA明星中锋加盟上海男篮,广东宏远有意拉塞尔

CBA最新消息!曝NBA明星中锋加盟上海男篮,广东宏远有意拉塞尔

体坛瞎白话
2026-09-17 17:32:26
前员工称反映食安问题后,家人遭威胁、女友被开除,1点点:沟通无果后提牛奶找到其老家,没有威胁

前员工称反映食安问题后,家人遭威胁、女友被开除,1点点:沟通无果后提牛奶找到其老家,没有威胁

界面新闻
2026-09-17 16:58:16
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
谈判破裂,菲财长离开香港,马科斯拒绝中方贷款,经济崩盘倒计时

谈判破裂,菲财长离开香港,马科斯拒绝中方贷款,经济崩盘倒计时

墨兰史书
2026-09-18 02:30:04
三队全胜斩获亚冠积分5.33,中超首轮亚冠积分为所有联赛最高

三队全胜斩获亚冠积分5.33,中超首轮亚冠积分为所有联赛最高

懂球帝
2026-09-18 02:33:08
真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

真的有人喜欢微胖吗?一个人的时候,常常会感到不自信

娱你同欢
2026-07-31 23:28:29
不想在中国待了?出境队伍拥挤得人山人海,背后究竟发生了什么?

不想在中国待了?出境队伍拥挤得人山人海,背后究竟发生了什么?

阿淫记录生活日常
2026-09-17 07:52:08
辽宁虎戴玉林落马 只上了两年高中考上大学 并成为金融教授

辽宁虎戴玉林落马 只上了两年高中考上大学 并成为金融教授

观海财经
2026-09-17 20:18:26
原来他俩是敬一丹弟弟!如今身居高位,同胞四人名字细品大有乾坤

原来他俩是敬一丹弟弟!如今身居高位,同胞四人名字细品大有乾坤

喜欢历史的阿繁
2026-09-18 01:03:36
中国人口下滑:被严重低估的慢变量

中国人口下滑:被严重低估的慢变量

亿通电子游戏
2026-09-17 01:54:32
两大名嘴吵起来!苏群说中日男篮战只是普通比赛,杨毅怒怼:说这话的人不用担责任

两大名嘴吵起来!苏群说中日男篮战只是普通比赛,杨毅怒怼:说这话的人不用担责任

萌兰聊个球
2026-09-17 19:48:28
两次降费仍未留住,中山一小区宣布终止前期物业服务合同

两次降费仍未留住,中山一小区宣布终止前期物业服务合同

南方都市报
2026-09-17 20:11:24
女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

女儿踩坏床头柜怕被骂悄悄扔掉,两天后母亲想起:有370多克黄金铂金和190余万银行存单全在床头柜里;安徽当地警方连夜追回,分毫未少

三湘都市报
2026-09-17 21:32:50
底线被击穿,俄军开启毁灭报复,泽连斯基无奈求和,普京定下铁规

底线被击穿,俄军开启毁灭报复,泽连斯基无奈求和,普京定下铁规

何蕥室内设计
2026-09-18 01:46:09
皇马迎来最严峻考验,穆帅得到全队拥护,穆帅决心消除皇马队内的 “自满情绪” !

皇马迎来最严峻考验,穆帅得到全队拥护,穆帅决心消除皇马队内的 “自满情绪” !

福酱的小时光
2026-09-17 18:33:32
邮报:恩佐离队内幕相关报道关窗后才出现,曼城对此感到困惑

邮报:恩佐离队内幕相关报道关窗后才出现,曼城对此感到困惑

懂球帝
2026-09-17 21:53:25
婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像……山西一小伙儿办极简婚礼火了!当事人:妻子提出的,加酒席共花费1.6万多元

婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像……山西一小伙儿办极简婚礼火了!当事人:妻子提出的,加酒席共花费1.6万多元

大风新闻
2026-09-17 20:30:09
被低估的几种运动!医生:过了60岁,能坚持一个也好

被低估的几种运动!医生:过了60岁,能坚持一个也好

小方说跑步
2026-09-16 17:35:54
2026-09-18 07:08:49
电脑报少年派 incentive-icons
电脑报少年派
最新鲜的互联网产业资讯
3977文章数 1609关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

旅游
亲子
手机
本地
公开课

旅游要闻

烟花+戏剧+赛事全拉满!长江口吴淞岸线带你解锁中秋国庆滨江新玩法

亲子要闻

小恐龙选择了紫色的旺旺碎冰冰

手机要闻

鸿蒙7花粉Beta版有惊喜,华为Mate 60系列手机升级后新增支持眼动翻页功能

本地新闻

不止胖东来!许昌藏着半部三国史

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版