网易首页 > 网易号 > 正文 申请入驻

端侧模型太夯了!面壁智能开源2B「小钢炮」,通用Agent杀到端侧

0
分享至

编辑|陈陈

过去几年,端侧大模型一直在不断突破能力边界。

最初,人们关注的是手机等设备能否运行一个基础语言模型;随后,长文本理解、数学推理、代码生成、多语言能力逐渐被压缩进更小的模型。如今,随着模型能力进一步提升,一个新的问题开始浮现:Agent 能力,是否也能从云端走向端侧?

这并不是简单地把一个聊天模型放进设备,一个 Agent,需要理解目标、拆解任务、调用工具、根据反馈调整策略,并在多轮交互中持续推进任务。

随着端侧模型能力不断提升,过去属于云端的复杂工作流,开始具备在设备侧独立运行的可能。

面壁智能正是在这一方向上的代表性机构。

9 月 8 日,面壁智能开源新一代端侧语言基础模型 MiniCPM5-2B让端侧通用 Agent 能力开始具备雏形。该模型将工具调用、深度搜索、代码生成等智能体核心能力引入端侧,为复杂任务在设备侧运行提供了新的可能。

另外,团队此次开放的不只是模型权重和算法,还包括部分训练 Recipe(如 RL recipe)、自研强化学习框架 Meshy、基于奖励的强化学习策略 JustRL II,以及一批 SFT 数据。这在当前大模型开源生态中并不常见。

端侧模型轻装上阵,Agent 能力正在成形

MiniCPM5-2B 轻量但不代表能力弱。

根据 Artificial Analysis Intelligence Index 榜单,MiniCPM5-2B 在开源模型类别中排名第一。该榜单综合了 9 项评测,覆盖知识推理、代码能力以及 Agent 任务执行等多个维度。结果显示,MiniCPM5-2B 以 23 分领先 Gemma 4 12B、Qwen3.5 9B 等参数规模更大的模型



在衡量模型在 Agent 工作流中的榜单中,MiniCPM5-2B 以 20 分排名第一,领先于 Granite 4.2 8B(9 分)、Qwen3.5 9B(7 分)等参数规模更大的模型。



MiniCPM5-2B在推理效率上也展现出优势,完成单个任务平均仅需要约 21K output tokens,与同规模模型相比处于较低水平。



值得注意的是,MiniCPM5-2B 在真实工作任务评测中取得接近人类基准的成绩,这一结果表明,端侧模型的能力边界正在从简单问答进一步延伸到真实任务处理。



MiniCPM5-2B 也展现出较高的智能密度,进入同级开源模型领先位置。



综合能力评测中,根据多项 benchmark 测试,其平均分达到 53.9 分,领先于 Qwen3.5-2B 等模型。

评测覆盖代码推理、数学推理、工具调用、代码智能体、搜索智能体等多个维度,MiniCPM5-2B 在多个方向保持均衡,说明其提升并非来自单一能力,而是整体能力的增强



这些榜单成绩背后值得关注的是端侧通用 Agent 能力已经有了雏形。

过去提到 Agent,大家默认的前提是云端大模型才玩得转。MiniCPM5-2B 的意义在于,它把端侧 + 通用 Agent 这两件事拼在了一起:模型原生支持工具调用、深度搜索、代码生成等智能体核心能力,并且从预训练阶段就开始为 Agent 能力铺路,一路贯穿到 SFT、大规模强化学习对齐,确保这些能力在实际使用中稳定可靠,而不是能跑但不好用的半成品。

而在强化学习阶段,MiniCPM5-2B 还采用了面壁智能自研的强化学习框架 Meshy基于奖励的强化学习策略 JustRL II

在训练框架侧,Meshy 彻底去掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算等全部建模到对等服务,利用 TransferQueue 中的数据就绪状态来驱动实际控制流,能够简单的在同步、异步、全异步三种训练模式中灵活切换,便于扩展。

在算法层面,端侧模型做长思维链强化学习,常常训练过程中分数不升反降:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面 GRPO 信用分配太粗糙,面对上万词元的推理链,分不清哪步对、哪步错。为此,MiniCPM 团队提出 JustRL II:数据上,用三阶段流水线筛选校准训练数据;算法上,给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。



真实效果如何?我们上手测了一下。感兴趣的用户可以前往开源地址获取模型,并自行部署体验。

首先我们让 MiniCPM5-2B 在本地处理一篇长篇会议纪要(AI 生成)。测试中,我们连续提出多个问题,例如本次会议缺席人员是谁?Atlas V2.0 正式上线日期是哪一天?

结果显示,MiniCPM5-2B 能够从长文本中提取关键事实,并区分讨论过程与最终结论,给出正确答案,能够满足日常需求:





接下来我们让 MiniCPM5-2B 根据 5 份简历,提取每位候选人的姓名、年龄、工作年限、核心技能,并整理成结构化表格。

MiniCPM5-2B 能够从多份长文本简历中准确提取关键信息,并完成后续的匹配分析。整个过程无需将候选人资料上传云端,模型可以直接在本地完成文档理解和信息处理。

对企业而言,这类招聘筛选、资料整理等任务往往涉及大量敏感信息。端侧 Agent 的价值,就在于让模型具备处理真实业务流程的能力,同时降低数据离开本地带来的安全风险。





最后,我们还测试了模型的网页生成能力。MiniCPM5-2B 能够根据简单描述完成页面布局设计和代码生成,并生成包含多个功能模块的网页。



最终结果如下:



从以上案例可以看出,MiniCPM5-2B 已经开始具备理解任务、处理信息并生成结果的端侧 Agent 雏形。

公开数据治理、开源数据集,这在行业里很罕见

除了算法,数据质量正在成为决定模型能力的重要因素。尤其对于参数规模有限的端侧模型而言,如何从海量数据中筛选、提炼高价值信息,直接影响模型能力上限。

面壁智能此次进一步公开了支撑 MiniCPM5-2B 能力提升的数据体系,包括全新的预训练数据处理工具 UltraX,以及三个最新开源的数据集

UltraX 是一个函数调用式的精炼框架,核心思路和过去用大模型端到端重写文本不同:它训练了一个仅0.6B参数的轻量模型,去预测一套结构化的编辑操作,包括保留、删除、替换、插入,然后由确定性的执行器把这些操作实际应用在原始文本上。

传统的数据处理是文档级过滤:判断一篇网页文章质量好不好,差就整篇丢掉,但有价值的部分和垃圾内容往往交织在一起,整篇扔掉损失太大。

UltraX 做法是让模型像一个精细的编辑,逐行判断「这段留、那段删、这句换个说法」。这样做既避免了端到端重写容易带来的语义漂移和结构破坏,又因为编辑操作本身可保存、可审计,让整个精炼过程完全可追溯,数据被改了什么、为什么改,都有据可查。



UltraX 的整体工作流程,包括程序监督数据生成、精炼模型训练以及推理阶段的程序执行。

效果上,UltraX 在 FineWeb、RedPajama-v2、AICC 等五个主流语料上做了验证:用同样规模的 1B 模型从零预训练,UltraX 精炼后的语料在下游任务上全面优于原始语料,仅用 16B tokens 训练出的效果,就已经超过原始语料训练满 20B tokens 的最终表现,数据效率提升非常明显。目前 UltraX 已在 Hugging Face 开源,发布后一度登顶 Hugging Face Datasets Trending 榜首。

与此同时,面壁智能同步开源了 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 数据集,将数据治理能力延伸至模型训练全流程。

UltraData-Code,做的是代码数据的分级治理,延续了 UltraData 一贯的 L0 到 L3 递进式构建思路。L0 从约 1.92 亿个公开 GitHub 仓库中保留最新版本代码与溯源信息;L1 在此基础上做大规模过滤、格式规范化和近重复去重;L2 面向 11 种编程语言,专门筛选算法相关的代码,用语义 embedding 加上分类器打分,把主要实现算法和数据结构的文件筛出来,规模约 400B tokens;L3 则更进一步,把这些算法代码拆解重构成任务描述、解题分析、参考实现和测试代码相互对齐的结构化训练样本,规模约 150B tokens。

UltraData-SFT-Agent-2609,是 MiniCPM5-2B 后训练阶段的核心 Agent 数据池,大约 50 万条样本,覆盖工具调用、网页搜索、代码 Agent 和通用 Agent 等任务类型 —— 具体到场景,包括网页搜索与多跳问答、软件工程与多环境代码执行、Office 文档处理、金融服务与数据库工具交互等等,既有一步到位的短链路指令,也有需要持续规划、反复交互、阶段性验证的长链路任务。

UltraData-RL-2609,则是后训练 RL 阶段的核心数据,超过 8 万条样本,覆盖数学推理、代码生成、通用知识问答和长文本理解。做强化学习训练的人都知道,数据质量比数量更重要,尤其是三个常见的坑:题目答案没法自动验证、奖励标签本身不可信、题目难度和模型当前水平不匹配。UltraData-RL-2609 专门设计了三阶段流水线来对付这三个问题:分别为可验证性过滤、奖励可信性校验和难度匹配与信号优化等流程,从而为模型提供更高质量的强化学习训练信号。

事实上,数据开源一直是面壁智能和 OpenBMB 社区的重要方向。过去几年,双方围绕大模型训练全流程持续开放数据资源,覆盖对齐、推理、预训练等多个环节:UltraChat、UltraFeedback 面向指令对齐和偏好学习;UltraInteract_sft、UltraData-Math 聚焦复杂推理能力提升;Ultra-FineWeb、DCAD-2000 等则覆盖网页预训练和多语言数据治理。

截至 2026 年 9 月,双方已累计开源超过 10 个大模型训练数据集,UltraData 系列数据集累计下载量超过 266 万。连同此次开放的数据集,面壁智能进一步将数据开源延伸至代码、Agent 和强化学习训练阶段。

开发者能用它做什么?

MiniCPM5-2B 从一开始就设计成「对开发者友好」的形态。

推理端,支持 SGLang、vLLM、llama.cpp、Ollama、Hugging Face,以及面壁智能自研的 CPU 推理框架 Arclight,覆盖主流本地部署和云端推理场景。

微调端,支持 Llama Factory 和 ms-swift,可以快速在自有数据上进行领域定制。

特别值得关注的应用场景,是那些对数据隐私敏感的任务:聊天记录整理、会议纪要处理、合同问答、内部邮件分析…… 这类任务放在云端模型上,数据需要出本地、上传服务器,始终是企业用户的顾虑所在。端侧模型的价值恰恰在这里:数据无需离开本地,在一定程度上降低隐私风险,同时减少云端调用成本。

此外,端侧运行 Agent 的能力,也让批量处理任务(试卷批改、简历筛选、合同集拆分并行处理)在本地变得高效且低成本。

结语

过去几年,大模型竞争主要发生在云端:更大的参数规模、更强的推理能力、更高的训练成本,不断推动模型能力上限提升。

但 AI 真正进入日常生活和产业场景,还需要跨过另一道门槛,让模型能够在设备侧运行,让智能真正靠近用户。

MiniCPM5-2B 的意义,是在有限参数规模下,让工具调用、深度搜索、代码生成等 Agent 能力开始进入端侧。这意味着,端侧模型正在从轻量版助手走向能够理解任务、调用能力并完成工作的智能体。

更重要的是,面壁智能此次开放的不只是一个模型权重,而是包括数据、训练流程、RL 框架和方法体系在内的一整套探索路径。开发者拿到的不只是一个结果,也是一套继续优化和创新的基础设施。

未来的 AI 形态,或许不会只有云端超级模型这一种答案。云端负责复杂推理,设备侧承担高频、隐私敏感任务,二者协同工作,将成为更普遍的形态。

2B 参数不是终点,但它证明了一件事:当 Agent 能力开始进入端侧模型,AI 正在从数据中心走向每个人手中的设备。

一些参考链接

MiniCPM5-2B 开源链接 (含模型与 UltraData 系列数据):

Hugging Face:https://huggingface.co/collections/openbmb/minicpm5

GitHub:https://github.com/OpenBMB/MiniCPM

Meshy 框架开源链接:

GitHub:https://github.com/OpenBMB/Meshy

博客:https://maydomain.notion.site/meshy-blog-zh

JustRL II 强化学习算法:

博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
系明确致癌物!有些人天天喝

系明确致癌物!有些人天天喝

北仑发布
2026-09-17 20:18:41
匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

匿名现役美国军人首次公开中东多处美军基地遭伊朗袭击照片:建筑与装备大面积损毁,“我们眼睁睁看着它们被摧毁,任由别人往脸上挥拳”

政知新媒体
2026-09-16 08:30:59
印尼首富家族被查、护照被没收:300亿美元财富正在悄悄转移海外

印尼首富家族被查、护照被没收:300亿美元财富正在悄悄转移海外

相思赋予谁a
2026-09-17 10:06:43
9月17日最新消息!苦等的2026退休养老金,究竟会不会涨?

9月17日最新消息!苦等的2026退休养老金,究竟会不会涨?

妙知
2026-09-17 10:06:04
戴安娜王妃死因再掀风波!弟弟新书爆料查尔斯曾说“她很快会被遗忘”,白金汉宫强硬回应

戴安娜王妃死因再掀风波!弟弟新书爆料查尔斯曾说“她很快会被遗忘”,白金汉宫强硬回应

粉红冻奶的观影日记
2026-09-17 18:35:10
孙千,谢谢大家比我更爱我:愿你岁月温柔总有晴朗

孙千,谢谢大家比我更爱我:愿你岁月温柔总有晴朗

飘雨桐
2026-09-16 23:57:59
女性之美,从来不在于妆容

女性之美,从来不在于妆容

疾跑的小蜗牛
2026-09-17 19:45:52
官宣!恭喜胡明轩!中国男篮等了整整24年

官宣!恭喜胡明轩!中国男篮等了整整24年

篮球实战宝典
2026-09-17 17:22:59
同一家公司,领导按300%交社保、员工按60%,这叫“多缴多得”?

同一家公司,领导按300%交社保、员工按60%,这叫“多缴多得”?

偷喝一口奶
2026-09-04 11:53:36
日本:永远活在2000年

日本:永远活在2000年

茶狐看世界本尊
2026-09-16 07:35:39
数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

数据显示,超15%的中青年夫妻处于“干婚”状态,68%的中年人拥有固定深交的异性网友

舒山有鹿
2026-07-25 09:57:20
教授夫妇双双从25楼跳下,账户查出700万流水,遗言:没有活着的希望

教授夫妇双双从25楼跳下,账户查出700万流水,遗言:没有活着的希望

悬案解密档案
2025-10-31 15:05:24
香港诡异事件“鬼母煮饭”,女尸腐烂十日,幼女却说母亲每天煮饭

香港诡异事件“鬼母煮饭”,女尸腐烂十日,幼女却说母亲每天煮饭

堇色夜行
2025-01-06 22:54:42
世界杯出局仍获最高分!20岁美女国门6次神扑难救主 采访哽咽落泪

世界杯出局仍获最高分!20岁美女国门6次神扑难救主 采访哽咽落泪

我爱英超
2026-09-17 03:46:55
社保局工作人员坦言:最近三年退休的人,是实打实的养老幸运儿

社保局工作人员坦言:最近三年退休的人,是实打实的养老幸运儿

兵鉴史
2026-09-14 20:14:40
中央5台直播亚运女排时间表:9月18日,CCTV5直播中国冲击两连胜

中央5台直播亚运女排时间表:9月18日,CCTV5直播中国冲击两连胜

薇说体育
2026-09-17 17:31:22
中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

中纪委再次重拳出击!这4个领域将被严查,这4种行为将被严肃处理

细说职场
2026-09-17 17:18:56
00后女孩回应毕业后回家照顾家人被说“扶弟魔”:我拥有最好的家人,弟弟一个月赚4000元,自己只留400元,没有他们的牺牲我哪有机会上学

00后女孩回应毕业后回家照顾家人被说“扶弟魔”:我拥有最好的家人,弟弟一个月赚4000元,自己只留400元,没有他们的牺牲我哪有机会上学

潇湘晨报
2026-09-17 18:23:26
准备把苹果16Pro卖掉换一台18Pro,可线下店店长的建议说到心坎了

准备把苹果16Pro卖掉换一台18Pro,可线下店店长的建议说到心坎了

小兔子发现大事情
2026-09-17 11:31:57
注意!复读生明年不能报这些大学!

注意!复读生明年不能报这些大学!

绵学堂
2026-09-16 20:14:28
2026-09-17 21:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14014文章数 142733关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

义乌开始卖"UFO"了:垂直起降可载1-2名乘客 售价80万

头条要闻

义乌开始卖"UFO"了:垂直起降可载1-2名乘客 售价80万

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰正式公开 华为技术加持打造家庭泛越野智能座舱

态度原创

健康
艺术
亲子
旅游
游戏

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

艺术要闻

深圳第二座机场,5张效果图透露新地标样貌!

亲子要闻

宝蓝盲猜糖果还是冰淇淋大挑战,快看看谁赢了~

旅游要闻

【凝心聚力 真抓实干 奋力实现“十五五”良好开局】文旅重塑 宁夏打造国际旅游目的地

《GTA6》台湾地区过审!上架PS 定价约487人民币

无障碍浏览 进入关怀版