9月10日,DeepSeek正式发布DeepSeek V4.1 Flash模型。据官方发布信息,这是公司全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,采用非对称编码器—解码器结构:550B总参数,输入阶段激活8B,输出阶段激活16B。
新模型最核心的变化在缓存。据官方数据,V4.1 Flash每个Token的KV Cache从上一代V4 Flash的3514字节降至890字节,约为原来的四分之一;与初代DeepSeek V1相比,缩小到约1/437。缓存相关的HBM需求降至上一代的1/4,SSD需求降至1/8。Agent使用场景中缓存命中费用占比较高,这一压缩直接降低了Agent类任务的使用成本。
Agent能力提升明显。官方对比数据显示,相比V4 Pro,DeepSWE v1.1从62.7提升至74.2,Terminal-Bench 3.0从11.8提升至30.0,Automation-Bench从43.2提升至54.8,CyberGym从83.3提升至88.1。在官方列出的对比中,V4.1 Flash在DeepSWE v1.1、CyberGym和Automation-Bench三项上得分最高,超过Kimi K3、GLM 5.3、Opus 5和GPT 5.6-Sol。不过GPQA Diamond得分仍低于V4 Pro,部分测试也未超过表中全部竞品。
API定价同步调整,继续采用峰谷定价。闲时缓存命中输入0.02元/百万Token,未命中1元,输出4元;高峰时段分别为0.04元、2元、8元。高峰时段为工作日9:00—12:00、14:00—18:00,其余时间均为闲时。新价格自9月10日12:00生效。
配套的DeepSeek Harness同步更新至v0.1.5,模型针对标准模式、程序化工具调用模式和极简模式做了专项训练。旧版V4 Pro将有序下线,相关API请求转向V4.1 Flash并按新价格计费。模型已在Hugging Face开源。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.