网易首页 > 网易号 > 正文 申请入驻

DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?

0
分享至



来源| Tech星球

| 华卫 任雪芸

大模型圈里,几乎没有哪家像DeepSeek这样,把“调价”做成了连续剧。

2026年4月,DeepSeek V4-Pro打到2.5折;5月砍到原价的四分之一,靠极致性价比把周调用量顶到全球第一。可到了8月,剧本反转,8月17日峰谷定价正式生效,高峰时段V4-Pro输出价从6元/百万Tokens跳到27元,刷新DeepSeek史上最大提价纪录;8月23日又开始回调,把周末拉成全天低谷收费模式。

半年之间,DeepSeek从全网最便宜变成了“收割者”,价格改了四五轮。

就在这波价格调整震荡里,DeepSeek那只憋了许久的多模态“眼睛”也终于睁开了。8月21日,V4-Flash-Vision-Exp上线,把视觉能力塞进强调低成本的Flash系列。只是,这只眼睛视力还不够好:Tech星球实测,它把三位同框演员当成同一个人,把王兴兴错认成马化腾,直到风景图才勉强给出可能方位;而同样的问题,豆包几乎“一击即中”给出正确答案。

现实的矛盾在用户中被激化,一边是“价格屠夫”主动收窄低价优势,另一边是能力短板刚补就被实测打脸。

当豆包、千问、Kimi 们把推理、代码、Agent、多模态的短板一块块补上,DeepSeek必须回答一个新问题:如果价格趋同,但别的产品功能够全面,凭什么还能让用户一直选择?

DeepSeek睁眼了,但“视力”不太好?

按照DeepSeek公布的基准测试,在需要视觉理解的 Agent Benchmark 上,
DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态能力已经接近Claude Opus-4.8。

Tech星球实测了一波,看看 DeepSeek 更新的多模态能力到底如何?

首先是人物识别能力的对比,我们稍微上了点儿强度,发了一张三位长相气质相似的演员同框的照片。结果,DeepSeek不仅认不出来,还把三个人都当成了同一个人。



然而,同样的问题丢给豆包,得到了清晰准确的答案,并给出了三位演员的照片,甚至连演员的曾用名都标出来了。





于是,我们决定再给DeepSeek一次机会,发送了一张同一个人物做出不同表情的图。可惜的是,DeepSeek再次“出错”,把王兴兴认成了马化腾。



反观豆包,依然给出了准确的答案,还认真分析了人物身份以及表情背后可能的原因,比如它指出王兴兴本身性格专注技术,不热衷资本仪式,甚至指出可能仅仅是抓拍角度问题。



接下来,我们决定把识别对象切换到风景,选了新疆伊犁那拉提草原网红桥一张实拍照片,看模型是否能识别出对应的景点。这次,DeepSeek虽然将正确答案说了出来,但只把其当作了可能区域之一,并未给出确定性的回答。



豆包就“一击即中”,直接给出了确定性的答案。



虽然说目前任何AI大模型都存在幻觉,但豆包一直被公认为属于幻觉率较高的一个。然而,在这次视觉理解能力的测试中,DeepSeek的幻觉也十分明显。

Tech星球先用豆包生成了一张“猫咪趴在笔记本电脑上”的图片,接着将这张明确标注“豆包AI”的图分别发给了DeepSeek和豆包,假装询问猫咪写代码的逻辑。

DeepSeek的回答虽然有趣,但显然没有发现“猫咪并不能写代码”这个事实Bug,还对着实际并不能看清的一段模糊代码屏幕,自行描绘了一套猫系程序员版的伪代码逻辑。





豆包也是一样,存在严重幻觉。它并没有区别出在现实生活中,猫咪是根本不能写代码的,还自创了一段代码。





更离谱的是,无论豆包还是DeepSeek都没有发现这张AI生成的图,电脑只有五行键盘,明显缺少一行,还完全按照指令去分析“猫咪到底压住了哪个键盘”。在反幻觉上,豆包和DeepSeek都存在明显不足,水平大致相当。

到了图表识别环节,DeepSeek就比较得心应手了,能够读懂收到的折线图,并能明确粉丝增长的正负,也可以通过图表进行二次计算。



不过,豆包的表现也不差,答案亦准确无疑。



对比下来,我们发现豆包在识别人物上有明显的优势,这可能因为背后抖音的数据优势有关。其他场景下,诸如图表识别,反幻觉,豆包和DeepSeek几乎处于水平相当。

在外网,DeepSeek-V4-Flash-Vision-Exp倒是收获了一些不错的评价。有开发者表示,“DeepSeek-V4-Flash-Vision-Exp 搭配 DeepSeek harness框架,简直逆天了。它碾压的那些测试,我甚至之前从没跑过。”

还有开发者将其与最近的神秘模型“牛来”(OX-Alpha)做了代码能力对比测试,结论是:从测试体验来看,OX-Alpha的参数规模应该很大,性能优势明显。



此外,有细心的网友发现,V4-Flash-Vision-Exp只在 DeepSWE 和 Agents' Last Exam 上略胜 Opus 4.8 一筹,差距很小,且在Terminal Bench、NL2Repo 和 Cybergym 等Benchmark上仍然落后。



性价比还是“王”,图片Token上限拉出40倍差距?

DeepSeek最传奇之处,是它证明了一件此前很多人不太相信的事情:大模型可以用更低的成本做到非常高的能力水平。从R1到V4,其“便宜又能打”的标签一步步被强化。百万Token级上下文、Agent能力、代码和推理能力,再加上极低的API价格,DeepSeek一度成了开发者眼里的“性价比之王”。

然而,国内模型厂商越来越多,能力间的绝对差距正在缩小。豆包可以在内容、交互和产品体验上做得更好,千问、Kimi、元宝等都在快速补齐推理、代码、Agent、多模态等能力,海外模型则在复杂推理、工具调用和Agent等等方向持续进化。而DeepSeek还依然只是个大语音模型,和用户需求存在明显gap。

到了今天,一个正在变化的现实是:DeepSeek可能依然很强,但它已经越来越难被直接称为“老大”了。此前,DeepSeek是在向所有模型厂商发问:“你凭什么比我贵?”现在,它必须开始面对的挑战是:“如果其他家够值够全面,我为什么一定要一直选你?”

曾经靠一个模型就能横扫市场的DeepSeek,现在显然需要适应一个更新的大模型竞争时代。DeepSeek或许也意识到了这一局面,这几天,用刚刚上线的V4-Flash-Vision-Exp新补齐了多模态能力这张牌,并且坚守“性价比”。

定价上,DeepSeek-v4-flash-vision-exp 的价格与V4 Flash持平,并同样采用高峰、空闲两档计费。计费方面,图片会先按尺寸转换为token再计入用量,并没有额外增加一个明显的多模态溢价。



对比国内其他厂商,即使在高峰时段,DeepSeek依然很有“诚意”,缓存命中与否及输入输出各维度定价均显著低于豆包Seed 2.1 Pro、小米MiMo-V2-Omni、Kimi K3和阿里云的主力视觉模型Qwen-VL-Plus,尤其输出端和缓存未命中场景优势更大。



实际测试中,同样的图片,在不同厂商那里可能会被折算成完全不同的Token数量,而这直接决定了最终的账单会膨胀多少。根据Tech星球的统计,各厂商之间的差异巨大,单张图片的Token上限甚至相差超过40倍。

首先是DeepSeek V4-Flash-Vision-Exp,给出了一个极具攻击性的数字:单张图片消耗最高为 384Token。即使在高峰时段的缓存未命中情况下,单张图片最高仅0.001152元,1000张图大约只需1.15元。

对比来看,虽然豆包的视觉模型未公开具体的图片转Token算法,但此前官方给出了一个直观示例:“1元钱可处理284张720P的图片”。Kimi则采取完全不同的策略:固定计费。根据其官方文档,视觉模型每张图片的计费标准固定为1024 个Token,与图片大小或分辨率无关。

相较来说,阿里云通义千问的视觉模型采用了最为精细的折算逻辑。根据阿里云官方文档,大多数模型支持每张图片最高1600万像素,更高的分辨率会消耗更多Token:每张图片的Token数计算公式为 h x w / (32 x 32) + 2。但真正值得关注的是其Token上限,按公式推算出的理论值,单张图片最多能消耗约15624个Token。在qwen-vl-plus-0710模型的规格中,还明确标注了“单图最大16384Token数”。



此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。

尽管涨了一波价,但如果把整个市场拉进来比较,DeepSeek仍然具有明显的成本优势。用户如果能够错峰,还可以获得更低的成本。

DeepSeek可能已经不再是那个遥遥领先的“老大”,但它显然还是牌桌上的大腕儿。从主打高频、低成本调用的V4 Flash,到面向复杂推理和高规格任务的V4 Pro,再到如今补上图像、截图和界面理解能力的V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整。

DeepSeek被“教育”后,战略变了

多模态模型和DeepSeek V4 Pro发布后,DeepSeek 被“教育”了。所谓“教育”,一半来自外部,一半来自自己。

外部的测评放大了DeepSeek的多模态短板,根据Tech星球实际测评,眼下DeepSeek的视力显然还没追上它的脑力。而V4 Pro,则需要在Harness框架上才能用更好的表现,Harness的操作门槛对普通用户并不友好。Tech星球体验Harness后发现,由于Harness版本依然处于测试版,因此依然存在不少Bug,比如Prompt输入时经常不能完全显示。

V4 Pro发布前,DeepSeek提前预告了那场史无前例的涨价:8月17日峰谷定价把输入从6元拉升到27元,缓存命中输入涨幅最高达1100%,是DeepSeek发布以来幅度最大的一轮提价。

一边收窄低价优势,一边能力还被友商反超,外界自然要重新盘算:还值不值?

涨价的冲击很快显现。OpenCode Go的统计显示,涨价一周以来,DeepSeek的调用量明显下滑,首当其冲的是高频、成本敏感型开发者。

紧接着DeepSeek在8月23日把周末拉成全天低谷,用更低的价格把被劝退的需求往闲时分流。这恰恰说明,DeepSeek自己也已经意识到:补贴式低价换来的“老大”光环,正在算力稀缺与成本压力下褪色。

面对这种局面,DeepSeek做出了两个动作。

第一个动作,是补齐那块最显眼的短板“多模态”。8月21日,
Deepseek-V4Flash-Vision-Exp 上线,把视觉能力塞进以效率和低成本著称的Flash体系,且不“溢价”。同期上线的免费Files API,更让图片一次上传、凭file_id复用,进一步压低重复调用的传输与计费成本。

在大模型竞争加速的背景下,如果不愿在价格上守住,就只能在能力上进攻。Tech星球用DeepSeek做完上面五个测评后,只花费了0.14元。不过,豆包是免费的,没花钱。



第二个动作,是把“涨价”包装成资源调度。峰谷定价把工作日9:00—12:00、14:00—18:00设为高峰、价格翻倍,其余为空闲、价格减半;随后更新了“周末全天低谷”。

相当于用价格杠杆把闲时算力分配给对时延不敏感的批量任务,既缓解高峰拥堵,也给愿意错峰的开发者留出低价窗口。

大模型行业正从“低价抢客户”转向“价值定价”,曾被称为“价格屠夫”的DeepSeek收刀,某种程度上也意味着纯低价策略已难以为继。但把视觉放进便宜的 Flash线,等于用“低价多模态”重新定义性价比。

如此一来,DeepSeek的V4产品矩阵正在变完整:高频低价的V4-Flash、复杂推理的V4-Pro,再到补齐图像与界面理解的DeepSeek‑V4‑Flash‑Vision‑Exp。比起一味追求低价,它开始重新考量“能力、价格、用户需求”的平衡。

而这或许只是DeepSeek面向现实“低头”的开始。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
将赴大陆参加APEC,深绿政客表态不一般,黄国昌将赖清德一军

将赴大陆参加APEC,深绿政客表态不一般,黄国昌将赖清德一军

林子说事
2026-09-02 01:08:12
26所学校一个学生都没招到!民办本科的“淘汰赛”正式打响

26所学校一个学生都没招到!民办本科的“淘汰赛”正式打响

起喜电影
2026-09-02 00:07:53
国务院任免国家工作人员

国务院任免国家工作人员

新华社
2026-09-02 17:13:03
全民进入纯过日子模式。

全民进入纯过日子模式。

老陆不老
2026-09-02 08:27:57
Here we go!罗马诺:曼联前锋奥比-马丁将租借加盟威廉二世

Here we go!罗马诺:曼联前锋奥比-马丁将租借加盟威廉二世

懂球帝
2026-09-02 21:58:23
我能说啥?委内瑞拉人民不反抗,自己不争气,光指望别人咋行

我能说啥?委内瑞拉人民不反抗,自己不争气,光指望别人咋行

南生今世说
2026-08-31 12:16:19
当年抢不到的豪宅再现江湖,深圳万科瑧山府10套房产挂牌转让

当年抢不到的豪宅再现江湖,深圳万科瑧山府10套房产挂牌转让

第一财经资讯
2026-09-02 20:22:13
鲁迅的文章,当年是怎么过审的?

鲁迅的文章,当年是怎么过审的?

刘晓原
2026-08-31 21:46:15
“还不如送块肉!”被扔下的教师节礼物引关注,评论区的老师很现实!

“还不如送块肉!”被扔下的教师节礼物引关注,评论区的老师很现实!

林林先生
2026-09-01 10:12:35
王鸥发文承认“去父留子”,与何九华的爱恨纠葛,比想象中更扎心

王鸥发文承认“去父留子”,与何九华的爱恨纠葛,比想象中更扎心

小先生笔记
2026-09-01 10:15:47
活久见,孙宇晨竟然报警了!

活久见,孙宇晨竟然报警了!

麦杰逊
2026-09-02 08:00:19
刚刚,伊朗打击三国美军基地,“大量美军死伤”!特朗普:最终打击正在酝酿之中!油价大涨

刚刚,伊朗打击三国美军基地,“大量美军死伤”!特朗普:最终打击正在酝酿之中!油价大涨

新浪财经
2026-09-02 07:39:32
即使克莱已经不如当年,但签下他对于热火依然是一个重大的补强?

即使克莱已经不如当年,但签下他对于热火依然是一个重大的补强?

稻谷与小麦
2026-09-03 00:05:13
里奥:从曼联内部获悉,拉什福德回归以来的表现几乎无可挑剔;BBC:目前而言,齐尔克泽很可能留队

里奥:从曼联内部获悉,拉什福德回归以来的表现几乎无可挑剔;BBC:目前而言,齐尔克泽很可能留队

MUREDS
2026-09-02 00:08:42
苹果新CEO特努斯内部信:iPhone 18 Pro/Max发布会必将惊艳四座

苹果新CEO特努斯内部信:iPhone 18 Pro/Max发布会必将惊艳四座

IT之家
2026-09-02 07:11:13
一位抑郁休学孩子妈妈的“血泪忠告”:尽量不要让熟人知道你的状态,逢人就讲孩子抑郁不上学的事,真的很傻!

一位抑郁休学孩子妈妈的“血泪忠告”:尽量不要让熟人知道你的状态,逢人就讲孩子抑郁不上学的事,真的很傻!

阿呆爸
2026-09-02 21:12:30
李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

李春平身边23名员工联名写举报信!举报利益集团安排李春平假结婚

细品名人
2026-09-01 22:35:27
曝香港武打巨星陈观泰去世,享年80岁,四婚娶小30岁娇妻,晚年定居内地

曝香港武打巨星陈观泰去世,享年80岁,四婚娶小30岁娇妻,晚年定居内地

裕丰娱间说
2026-09-02 12:51:40
劝退应届生事件后,星宇股份外包工涨薪1元/小时,中介:有争议舆论不好招人,所以涨薪

劝退应届生事件后,星宇股份外包工涨薪1元/小时,中介:有争议舆论不好招人,所以涨薪

北青网-北京青年报
2026-09-02 11:46:07
印度军事专家推演:如果中印发生空战,印度空军或许就没机会升空

印度军事专家推演:如果中印发生空战,印度空军或许就没机会升空

午夜搭车a
2026-08-30 11:47:23
2026-09-03 00:19:00
Tech星球 incentive-icons
Tech星球
聚焦互联网前沿科技和新商业
2831文章数 26685关注度
往期回顾 全部

科技要闻

凌晨最强模型上新,Claude Fable 5.1发布

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

头条要闻

乌安全局与乌国防部情报总局在基辅交火 泽连斯基发声

体育要闻

一次有奖问答,让他成为欧冠主帅

娱乐要闻

香港武打影星陈观泰离世,终年80岁

财经要闻

北京首钢园数采中心停运,“百万小时”产能目标的账还算得过来吗?

汽车要闻

配双腔空悬+机械差速锁 传祺越7预售权益价17.18万起

态度原创

房产
时尚
本地
手机
军事航空

房产要闻

新四代住宅 新样板间开放丨以艺术之名 赴一场迭代之约

白衬衫不火了?早秋穿“棕色衬衫”更高级好看

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

手机要闻

三天连着!OPPO、荣耀、vivo齐发布新款系统,到底谁会是最终选择?

军事要闻

特朗普威胁伊朗终极打击蓄势待发

无障碍浏览 进入关怀版