网易首页 > 网易号 > 正文 申请入驻

说好“多模态不是主线”的梁文锋,怎么转头就发了个Vision模型?

0
分享至



在多模态这个问题上,梁文锋在那次投资人交流会上曾这么说过:“多模态布局,我们一直在做。对产品来讲,它很重要;对C端用户产品来讲,它很重要。但是对智能的上限,它是一个组件,它不是主线本身。我们应该会上相关的模型,就是我们V4的后续版本会支持原生的多模态。”

梁文锋也的确做到了。2026年8月21日,DeepSeek上线了DeepSeek V4 Flash Vision Exp,DeepSeek官方称,这是一个多模态视觉理解模型。

和V4 Flash以及V4 Pro不同,DeepSeek V4 Flash Vision Exp没有技术报告,也没开源,官方只给了一张性能表和几个演示案例。

可DeepSeek V4 Flash Vision Exp怎么看都不像是个“组件”。

以往来看,DeepSeek OCR、DeepSeek OCR 2这样的模型才贴合梁文锋口中“组件”的定位。这些模型的作用,是把图片以像素形式存在的文字,转换成电脑可以识别的纯文本字符。

因此,相较DeepSeek OCR而言,DeepSeek V4 Flash Vision Exp更像是一个“主线”模型。

难道梁文锋对多模态的看法改变了?事实可能并非如此。不过有一点可以肯定,那就是梁文锋学会了放低姿态,用产品和用户形成更密切的交流。

梁文锋此前曾说,“通往AGI要经过产品这个台阶,但不用花太多精力做C端、B端。”而随着DSH的爆火,发布后不到一个星期,DS就发布更新,提升了多模态能力。

过去的梁文锋对于产品有一种“偏执”,不完美不发布。DeepSeek V3.2版本和DeepSeek V4预览版之间,相隔足足4个半月,如果从V3正式发布开始算,仅仅1个大版本,就用了1年零4个月。

现如今不仅更新变快了,还把DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,都是在说明梁文锋态度上发生了一些转变。

01

多模态是Agent和推理的入口

如果你是练跑步的,那么你应该给别人看的成绩你跑了多少米用了多少秒,这样别人才知道你到底是快还是慢。但如果你告诉别人的是三分球命中率是多少,那很显然,你想告诉别人的是你有多准。

DeepSeek V4 Flash Vision Exp也是如此,它想表达的事情,远非是一个展示DeepSeek现有的多模态能力那么简单。

明明是一个多模态模型,官方公布的测评里,放的却是一串Agent基准。比如Terminal Bench 2.1得83.9,DeepSWE 59.3。



其实在AI视觉模型圈里有一套默认的考卷。

一个新视觉模型发布,通常要放的是这几项:MMMU,跨30个学科、大学水平的图文理解与推理,考“看到图能不能做对题”;MathVista,考图片里的数学推理;DocVQA,考从扫描文档里找到答案;ChartQA,考读懂图表里的数字和趋势;OCRBench,考最基础的文字识别。

无论是Qwen-VL、Gemini 还是GPT-4o,发新版本的时候,展示的都是这套基准。

即便是DeepSeek V4 Flash Vision Exp也放了一些多模态侧的基准,然而这些基准也“不太正经”,充满了浓浓的Agent味。

Chartography考的是专业人士读专业图表做决策,ApexBench是多模态Agent基准,Agents’ Last Exam 是通用Agent评测。没有一项是“看图答题”,全是“看完图,把事做下去”。

这张跑分图,本身就是DeepSeek的一种暗示。

梁文锋自始至终都认为多模态不是AGI的主线,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent跟推理这条主线上的一个必然产物,只不过它刚好也是“多模态”罢了。

DeepSeek V4 Flash Vision Exp所展现出来的价值观是,多模态从来不是让你“看图聊天”,而是让Agent看懂网页截图、读懂图表数据、理解UI布局,然后把任务做下去。

多模态不是目的,是手段,是给主线用的插件。DeepSeek的主线仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所干的事,也不过是强化了产品的推理能力。

虽然DeepSeek V4 Flash Vision Exp这个很神秘,但它也并非是一个凭空出现的模型。

4月29日晚,DeepSeek多模态负责人陈小康(Xiaokang Chen)在X平台发文预告,配文 “Now, we see you”,宣布DeepSeek多模态识图功能开启灰度测试。

第二天,DeepSeek正式在GitHub发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包含DeepSeek、北京大学、清华大学,属于三方联合研究成果。

然而这篇论文在5月1日凌晨就被删除,相关官宣推文也消失不见,GitHub官方仓库直接变为404状态,项目彻底无法访问。DeepSeek全程未发布任何撤稿公告,也没有公开解释原因。

好在,社区留下了这篇论文的拷贝版本。

这篇论文没有去讲“我们模型看得多清楚”,而是提出一个问题:模型能看见,但不一定能想清楚。

传统多模态模型用自然语言描述图片里的对象,比如“左边那个男的”“右边那个高的”。可是在复杂场景里,这种描述非常模糊,模型很容易越推越乱,最后导致整个逻辑崩塌。

就拿集体照来说,左边一共好几个男的,那么哪个男的才是模型所描述的那个?

DeepSeek的解法,是把点坐标和边界框提升为“思维的最小单元”,直接嵌进推理链,让模型“边推理边指向”,就像人数东西时会伸出手指,一个一个点着数。

靠这套机制,模型在计数、空间推理、迷宫导航这类任务上,把抽象的判断精确锚定到图像坐标,从“左边那个男的”、“右边那个高的”,变成了“我手指的这个”、“我手指的那个”。

6月,经过DeepSeek官方确认,其在客户端和网页端上线的Vision模式,底层就是这套视觉原语机制。

而DeepSeek V4 Flash Vision Exp,是把同一套技术嫁接到了V4-Flash的API基座上,重点强化多模态Agent能力,核心推理逻辑完全沿用了论文的方案,没有跳出其技术框架。

不仅如此,论文当时的实验,就是基于DeepSeek-V4-Flash作为语言骨干所搭建的多模态方案。这次的DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。

除了DeepSeek V4 Flash Vision Exp这个模型,DeepSeek在多模态方面的进展还体现在DSH上,8月19日晚,作为DeepSeek目前的主力产品,DSH更新了rc.8版本,提升了Agent的多模态能力。

rc.8的核心,是DeepSeek在多模态这件事上,“两条腿”走路。

一条叫“原生直通”。rc.8给模型适配器加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如GLM、Qwen,或者刚上线的V4-Flash-Vision-Exp,Harness就把图片原封不动送进模型,不做任何中间加工。

另一条叫“工具层视觉”,服务的是纯文本模型。

比如用DeepSeek自己的V4-Flash,直接读图会失败。这时Harness不会报错退出,而是自动降级成一套工具链,先做OCR识别文字,再统计图片颜色比例、扫描部分像素行、读取尺寸和颜色模式,把这些信息拆成结构化证据,最后交给文本模型去推理整张图。

Cherry Studio的核心创始人Yinsen把这种方式称为“伪视觉”,对付PPT截图、流程图、界面这类结构清晰的图够用,面对真实照片和复杂的空间关系就很勉强。

但要说明的一点是,DSH在rc.8之前,甚至连“伪视觉”都没有,全靠社区的视觉插件,还有通过pi2dsh桥接进来的视觉方案。

它们的做法大同小异,先调一个外部的视觉模型(比如 GLM、Qwen)把图片识别成文字,再把结果塞回文本模型。

这些插件证明了DSH架构的开放性,也同时暴露了一件事,DeepSeek自己没有视觉模型,只能借别人的眼睛。

02

DSH还有哪些可以补足?

正如开头提到的,虽说梁文锋没有改变旧观点,但梁文锋也学会放低了姿态。

2025年,在DeepSeek R1惊艳全球之后,社区就开始等待DeepSeek发布V4。

2025年下半年,随着V3.1、V3.2等迭代版本陆续推出,无数媒体“独家爆料”,称DeepSeek下一代旗舰大模型V4,计划于2025年7月、8月、9月……直至2025年年底发布。

结果自然是无一准确,堪称现代版狼来了。

2026年春节前,距离V3 发布已经过去400多天,所有人都在赌DeepSeek会复刻春节档R1的奇迹,把V4卡在农历新年这个节庆日子上线。

结果2月4日,外媒援引消息人士的话,称春节期间V4不会发布,DeepSeek官方也对此事保持沉默。

然后时间线一路后移。最后到了4月24日,V4才以预览版的形式登场,一次同时放出了V4-Pro和V4-Flash。

梁文锋的产品观是,宁可跳票,也不肯在产品没有完全做好的前提下发布。

可也就是在这段时间里,DeepSeek“掉队”了。

国际方面,2025年8月,OpenAI发布了GPT-5;11月,Anthropic发布Opus 4.5。这两款模型都是问鼎全球的性能榜的产品。

而在国内,2025年4月Qwen 3,不到半年后,阿里一口气放出来了Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。还有Kimi的首个原生多模态模型K2.5、智谱的GLM-4.7、MiniMax的M2.1、腾讯的hunyuan world等等,数不胜数。

与之相对的,DeepSeek发布的产品只有V3.1(8月V3.1,9月V3.1-terminus)和V3.2(12月)。

除了DeepSeek,全世界都在以月为单位发布模型,Anthropic更是以天为单位,在2026年2月1日到3月末,52天的时间里发布了73款功能和产品。

假如梁文锋是大厂的产品经理,以他发产品的效率,恐怕撑不过试用期就得被开除。只可惜DeepSeek是他的。

正式版更磨人。

6月29日,DeepSeek给全体API开发者发邮件,明确表示V4正式版7月中旬上线。7月21日,有消息表示正式版将要延期,目标挪到7月底。7月28日,又有消息说可能拖到8月10日至20日之间。

7月31日,V4-Flash正式版才千呼万唤始出来,而V4-Pro正式版,直到8月12日晚间才正式上线。

梁文锋对待产品,不做到自己满意,绝对不放出来。

可到了DeepSeek V4 Flash Vision Exp这里,明显味道变了。

模型上线当晚,社区就开始对其进行检测。根据实测显示,DeepSeek V4 Flash Vision Exp连梁文锋本人最具代表性的一张照片都无法识别。



不仅如此,还有用户反馈,称DeepSeek V4 Flash Vision Exp在理解复杂图表时会漏掉关键信息,中文场景的处理偏弱,有人在对话里插入图片后,还发现上下文缓存机制受到牵连。

一圈看下来,社区对DeepSeek V4 Flash Vision Exp的普遍看法是“效果好像也就那样”。

这个模型就像是在餐馆等着上菜,看不见后厨,不知道这盘菜什么时候才能端上来,厨师怕你等不及,于是从锅里盛了一勺给你尝尝,告诉你说菜还没做好,但是在做了。

其中的原因,很可能在于梁文锋持续受到优秀产品的压力。DSH从立项之初就对标Anthropic的Claude Code和OpenAI的Codex。

8月23日,外媒报道称Anthropic或将于8月底递表上市,因此目前正处于静默期,Claude Code没有较大的更新。

OpenAI却很激进,8月20日直接开源了Codex Harness,这是支撑Codex运行的底层系统。负责把模型和工具接起来,让模型能打开文件、执行命令、记住任务进行到哪一步,以及遇到有风险的操作要停下来询问。

但这并不是重点,重点是,在产品逻辑上,Codex Harness把多模态放在了Agent运行时的核心位置。

在Codex的工作流里,图片不是先交给某个外部视觉模型,再把识别结果转述给文本模型。

模型是可以直接接收截图、界面和其他视觉输入的,并把这些内容纳入同一条任务链。模型会先理解画面,再决定要调用什么工具、修改哪些文件、运行哪些命令,最后根据执行结果继续修正。

正如前文所述,DSH无论是哪条腿,在多模态这件事上,在DeepSeek V4 Flash Vision Exp之前,它都是割裂开的。DSH只负责以“模型处理过的图片”进行推理,而非用图片进行推理。

显然,Codex效果更强,首先是因为它减少了一次信息损耗。图片经过OCR或摘要之后,模型看到的已经不是原始画面,而是工具挑选出来的文字和特征。

只要处理过的图片漏掉一些信息,那么后面的推理就只能建立在不完整的证据上。

举个例子,前面的话就相当于模型处理后的图片,后面那句话是原图。你会发现,仅仅只漏掉一个字,意思就完全相反了。

要断章取义——出自“不要断章取义”

原生视觉输入则让模型直接面对图像,文字、布局、位置和相互关系可以在同一上下文里被判断。

其次,Codex把视觉理解和行动闭环连在了一起。它不是单独回答“这张图里有什么”,而是要根据截图判断下一步该做什么,再通过终端、文件和其他工具验证结果。

就算是中间出错了,新的截图和执行反馈还能继续回到同一条推理链里。这样一来,多模态就不再是“识别完了就完了,后面发生啥不关我事”的状态了,而是一个持续的服务,以提高推理的性能。

而这一步也是目前DSH所欠缺的。

所以这也是为什么OpenAI在开源Codex Harness后,DeepSeek会立马开源DeepSeek V4 Flash Vision Exp,梁文锋是想告诉用户,别急,别人有的我们也有,不过需要一点时间。

03

社区正在补足DSH的最后一公里

当然,DSH最明显的短板,是它和普通用户之间距离太远了,没点计算机知识,估计连DSH怎么安装都不清楚。

好在的是,正是由于DSH开源,所以这最后一公里,社区已经开始接手了。

最典型的例子是DSH Desktop,这个项目由一位06年的大二学生Benson Wang开发。

它的核心就四个大字“一键安装”。把原本需要复杂安装环境,以及输入npm指令才能安装使用的DSH,变成一个exe,下载以后双击安装就能直接变成一个桌面工具。

然而就是这么简单的一个项目,短短几天,就在GitHub上获得了1.8万颗星星。可见,大家普遍都认为DSH就该有一个简单方便的桌面版本,现在的DSH确实有些“反人类”了。

顺便一提,DSH Desktop这个项目的贡献者也有DSH负责人崔添翼,不过这并不是说明他参与了开发,而是GitHub本身的开源协作机制,让DSH原本的贡献者出现在了这里。



Benson Wang表示,他正在开发手机版的DSH,项目名为anywhere DSH。

他计划通过 iOS 和 Android 连接桌面端,让用户在手机上发起任务、查看 Agent 进度,并在需要时继续跟进。

这也是社区最有价值的地方。

事实上,DSH官方团队本身也非常关注社区。比如他们关注了DSH-better-sidebar这个项目,这是DSH第三方社区UI增强插件,给DSH原生Web界面提供了一套完整的服务化侧边栏工作台框架。以及awesome-dsh-plugins,提供DSH插件精选和搜索雷达,相当于是一个DSH的插件市场。

或许不久的将来,DSH会“收编”这些优秀的项目和开发者,丰富现在的DSH。

诚然,社区项目不能自动等同于DeepSeek的战略转向。开放生态越是发展,就越是会有版本兼容、权限控制、插件安全等问题出现。

但官方的态度就说明,DSH正在通过社区吸纳好的想法。

或许不久的将来,DSH也将上线官方的插件市场,想用什么插件,自己直接在官方的入口里搜就行了。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
因工作变动,任振鹤辞去甘肃省省长职务;曾任江苏省委副书记等职

因工作变动,任振鹤辞去甘肃省省长职务;曾任江苏省委副书记等职

上观新闻
2026-09-02 15:50:37
今年最“委屈”的211大学,就业率超96%,录取分数线却跌出全国100强!

今年最“委屈”的211大学,就业率超96%,录取分数线却跌出全国100强!

教育导向分享
2026-09-02 18:16:12
拒绝退役!33岁郭艾伦正式表态,新赛季去向或已定,未来有望重回辽宁

拒绝退役!33岁郭艾伦正式表态,新赛季去向或已定,未来有望重回辽宁

兵哥篮球故事
2026-09-01 17:30:58
​热苏斯:为加盟巴萨大幅降薪,每赛季少赚300万欧元

​热苏斯:为加盟巴萨大幅降薪,每赛季少赚300万欧元

足球推文C
2026-09-02 17:36:55
中国如今面临的最大问题:已经不是如何发展、如何致富了?

中国如今面临的最大问题:已经不是如何发展、如何致富了?

蜉蝣说
2026-08-30 19:26:34
越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

越南的小心思够精明!这次吉尔吉斯斯坦举办的上合组织峰会,越南没派最高领导人出席,只让国家副主席带队参会,比起去年明显降了半格

扶苏聊历史
2026-09-01 15:15:37
豆包说要生两个一儿一女,我让它说句真心话,看完沉默了!

豆包说要生两个一儿一女,我让它说句真心话,看完沉默了!

另子维爱读史
2026-09-02 19:44:54
条件不匹配就别硬演特务头子!把黄觉和程煜、冯恩鹤放一块对比,差距真的太明显了

条件不匹配就别硬演特务头子!把黄觉和程煜、冯恩鹤放一块对比,差距真的太明显了

小椰的奶奶
2026-08-31 12:37:31
2026年,即将全面取消农村户口?每人补偿30万!是真是假?

2026年,即将全面取消农村户口?每人补偿30万!是真是假?

三农雷哥
2026-09-02 17:24:40
一生不体检,患癌不化疗,102岁才肯走,她说出两个字,全场沉默

一生不体检,患癌不化疗,102岁才肯走,她说出两个字,全场沉默

大鱼简科
2026-08-20 09:52:00
张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

张万年致电许世友:我趁热往前拱一拱,许怒斥:你摸摸脑袋热不热

芊芊子吟
2026-09-02 14:15:15
不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

不是景甜舍不得3000万,查了下才知道,原来她穷得日子也不好过

天天热点见闻
2026-08-29 08:53:35
智商高的孩子最显著的特点就是“胆小”,很多家长却白白毁掉了娃

智商高的孩子最显著的特点就是“胆小”,很多家长却白白毁掉了娃

另子维爱读史
2026-08-17 21:22:42
闹大了!刘翔公开回应体制:不要上班也不要补偿金,只选第三条路

闹大了!刘翔公开回应体制:不要上班也不要补偿金,只选第三条路

一路荒凉如歌a
2026-09-02 18:22:22
家长群内有人提议凑600元请保洁打扫教室,另一家长回复“再请俩保姆咋样”被老师禁言,教体局回应

家长群内有人提议凑600元请保洁打扫教室,另一家长回复“再请俩保姆咋样”被老师禁言,教体局回应

天涯社区
2026-09-02 17:28:15
尼克斯名宿:杰伦·布伦森整体表现已超越了NBA传奇德里克·罗斯

尼克斯名宿:杰伦·布伦森整体表现已超越了NBA传奇德里克·罗斯

好火子
2026-09-01 22:08:52
林肯号惨成啥样?看这张图就明白了

林肯号惨成啥样?看这张图就明白了

观察者网
2026-09-02 17:56:05
热议!近期《重案六组》翻拍,李诚儒回应:他们请了我,我没去

热议!近期《重案六组》翻拍,李诚儒回应:他们请了我,我没去

西昆仑Bruce
2026-09-01 18:29:49
80岁陈观泰脑出血离世!曾与狄龙是武行同窗,生前还计划开拍新作

80岁陈观泰脑出血离世!曾与狄龙是武行同窗,生前还计划开拍新作

翰飞观事
2026-09-02 19:32:17
人口大迁徙已成定局?明后年,越来越多的人会扎堆涌入这4座城市

人口大迁徙已成定局?明后年,越来越多的人会扎堆涌入这4座城市

大鱼简科
2026-09-02 19:27:13
2026-09-02 20:39:00
字母榜 incentive-icons
字母榜
让未来不止于大。
2743文章数 8091关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

头条要闻

被星宇股份裁掉的107名应届生 损失远远不止一份工作

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

10万级的满配B级车 试驾2027款比亚迪海豹06

态度原创

游戏
亲子
教育
本地
手机

《FF7》蒂法惨遭DLSS5摧残!变大妈难以接受

亲子要闻

宝蓝和弟弟妹妹手上涂满颜料,用手掌画画,有趣又漂亮~

教育要闻

随州一中2026年秋季开学典礼隆重举行

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

手机要闻

泄露的iPhone 18 Pro卡托零部件暗示将推出三种机身配色 或再次取消黑色

无障碍浏览 进入关怀版