智猩猩AI整理
编辑:林夕
刚刚,DeepSeek 官方宣布,DeepSeek V4.1 Flash 正式上线。
![]()
这一次升级,DeepSeek 在模型架构、缓存机制、训练方式和 API 定价上都做了调整。
核心目标很明确:让一个 552B 参数级别的 MoE 模型,以更低的推理成本跑起来。
从架构来看,DeepSeek V4.1 Flash 采用了全新的Causal-Encoder-Decoder结构,输入和输出采用不对称设计。
模型总参数量达到 552B,但输入侧激活参数只有 8B,输出侧激活参数为 16B。
除了架构变化,V4.1 Flash 还采用了新的预训练方式,并进行了更大规模的强化学习后训练。
从官方公布的测试结果来看,V4.1 Flash 在多项 Agentic Benchmark 上已经超过包括DeepSeek V4 Pro 在内的一众旗舰模型。
![]()
从这些数据来看,V4.1 Flash 在代码、终端操作、网络安全以及自动化任务等 Agent 场景中,都有比较明显的提升。
![]()
而这次 V4.1 Flash 和 DeepSeek Harness 的结合,也值得单独关注。
DeepSeek Harness 团队成员 Cui Tianyi 此前透露,Harness v0.1.5 已经开启试用,新版本与 V4.1 Flash 的模型训练进行了深度结合,模型针对 Harness 的不同配置进行了专项训练和优化。
![]()
目前,Harness 已经支持 Agent 读取和修改工作区文件、运行命令、制定计划以及委派工作等能力。
这次 v0.1.5 还加入了实验性的 Agent Teams。
简单来说,就是让多个 Agent 协同完成任务。一个 Agent 可以负责拆解问题,另一个负责写代码,还有 Agent 负责检查结果,再根据任务进展继续推进。
同时,Agent 之间的通信和任务控制也更加灵活。
另一个变化发生在KV Cache。
对于 Agent 来说,一次任务通常需要持续保留上下文,并反复调用模型。随着任务变长,KV Cache 会成为推理成本的重要组成部分。
DeepSeek V4.1 Flash 对这一部分进行了大幅压缩。
官方表示,新一代模型相比上一代对 HBM 的需求降低到原来的1/4,对 SSD 的需求降低到原来的1/8。
![]()
由于 Agent 场景下缓存命中的费用往往占比较高,KV Cache 的缩小,也会直接影响长任务和多轮 Agent 任务的使用成本。
这次 V4.1 Flash 的 API 价格也同步下调,继续采用峰谷定价,闲时价格为高峰时段的一半。
与此同时,DeepSeek 也准备逐步下线 V4 Pro。
官方表示,经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等方面已经全面超过此前的 V4 Pro。
![]()
按照计划,北京时间 9 月 14 日 12:00 之后,在 V4.1 Pro 正式上线之前,调用deepseek-v4-pro的请求将自动路由到 V4.1 Flash,并按照 V4.1 Flash 的价格计费。
![]()
除了 API,V4.1 Flash 这次也同步开放了模型权重。
DeepSeek 表示,将支持开源社区进行推理适配,并进一步扩大模型的部署范围。
目前,DeepSeek V4.1 Flash 已经在 Hugging Face 开放,官方同时发布了对应的技术报告。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.