![]()
智东西
作者 毕伟豪
编辑|漠影
一款模型“好不好”,究竟该如何定义?
显然,Agent正在改变人们评价大模型的方式。过去,判断模型强不强,往往看参数规模、Benchmark成绩和上下文长度。
而在Agent时代,一款能够又快又好地解决问题、完成任务,且token花得起的模型,才是很多用户眼中的好模型。
顶级模型固然能力更强,但往往思考和执行时间长、成本高昂,而快速模型生成token很快,却容易走错路、反复尝试,甚至需要人工接手,任务完成速度根本没快多少。
用更少的计算和无效尝试,更快更好地完成任务,是如今用户对Flash级别模型的期待,也让Flash级别模型逐渐从旗舰模型的轻量版本,走向一条独立的产品路线:在能力、速度和成本之间寻找新的平衡。
与此同时,一个新的衡量维度随之浮现——智能密度,即让有限的激活参数承担更多有效工作。
云知声刚刚发布的新一代主力模型U2-Flash,正是围绕这一方向训练的。它采用稀疏MoE架构,总参数约266B,激活参数仅10B,最快输出速度达到300tokens/s,首字响应平均3秒以内,其能力可以覆盖编程、Agent、推理、指令遵循等多类任务。
从评测结果来看,U2-Flash的提升也不只体现在速度上。在考察代码生成与软件工程任务的DeepSWE v1.1中,U2-Flash取得64.6分,较上一代模型U2实现翻倍式增长;在考察复杂软件工程问题解决能力的SWE-Bench Pro中取得61.6分,较前代提升10.5分;在考察终端环境下Agent自主执行能力的TerminalBench 3.0中,得分达到24.3分。
![]()
▲U2-Flash评测成绩(来源:云知声)
智东西对U2-Flash进行了多方位实测,看看它在长链路Agent、编程和办公任务中,能否做到“又快又好”。
一、18分钟速搓“ChatGPT”,打造超写实大型滑梯
在以往的测试过程中,我们往往会用一个简单的任务来试探模型的水准,但对U2-Flash,我们直接交给它一个极具考验的需求:做一个Agent。
在开源Agent界,Pi一直为众多开源爱好者所认可,开发者可以通过这个底层Agent框架来定制自己的专属Agent,我们交给U2-Flash的第一个任务,就是通过阅读Pi的代码仓库,创建一个新Agent,名叫Goat,然后推送到GitHub上。
![]()
这个项目非常考验模型对于长链路任务的处理能力,需要模型能够充分阅读并理解仓库内容,然后搭建简易循环,同时配好环境,最后上传。
U2-Flash在编程上速度确实很快,从阅读仓库代码到跑通一个简单的Agent仅用了18分钟,所呈现的结果符合我们所提出的要求,构建了一个能够调用工具并与人交互的Agent,并通过了简单的文件创建测试。
![]()
在这个过程中,U2-Flash自己规划了任务路径,然后选择了本机上常用的OpenCode Go订阅作为默认模型,随后构建了Agent,上传到了GitHub,非常高效。
![]()
接下来,我们让U2-Flash给Goat封装一个WebUI,没有提出任何其他要求,能看到其实U2-Flash的创建的WebUI在交互上没有什么问题,但UI的设计审美稍弱一些。
![]()
随后我们不断提出新要求,例如增加历史对话、记忆系统、模型选择器和预览页面等,U2-Flash很快重构了UI,能看到下图中已经有了这些Agent刚需的功能区域了。
![]()
最后,智东西让U2-Flash对整个UI进行了重绘,并提供了非常详尽的提示词。能看到,在有充足信息的情况下,U2-Flash重绘后的页面美观程度直线上升,俗话说就是顺眼多了。
![]()
接下来,我们测试了另一个重型任务,让U2-Flash调用Blender来搭建一个大型滑梯的3D建模,这项任务非常考验模型的空间结构理解、复杂曲面建模以及多步骤任务执行能力。
我们没有只要求它做一个简单的滑梯外形,而是进一步加入了10米级主体结构、螺旋滑道、直线滑道、楼梯、平台、护栏、支撑架等结构,同时要求模型具备真实厚度,并完成材质、灯光、摄像机和场景整理。
![]()
相比简单的网页生成,这类任务需要模型持续调用工具、理解三维空间关系,并在发现问题后进行修改,整个过程对Agent的长流程执行和实际交付能力提出了更高要求。
能看到,接到任务后,U2-Flash先对整体结构和建模顺序进行了规划,明确主体尺寸后,再确定主塔、平台、滑道等核心结构的实现方式。具体到螺旋滑道这类复杂曲面,它还会提前考虑轨迹和截面,再生成具体模型,整体思路比较清晰,体现出不错的任务规划能力。
![]()
其实从草稿上看,我们就已经能感受到U2-Flash在进行规划后的产出效果了,它仅花了不到20分钟,就已经进入了精细化的处理阶段,同时,滑梯的结构也非常不错。
![]()
接下来,U2-Flash自己开始不断渲染和检查,然后修复一些草图中的支撑柱穿透滑道和过度密集的问题,全程无需人工干预,它自己就解决了大部分问题。
![]()
最终经过几轮细节调整,总共用时40分钟,U2-Flash完成了整个滑梯的建模,生成结果非常惊艳,整体上没有那种塑料感,支撑柱的金属质感渲染效果非常好,仅存在一些细节上的问题。模型在快速完成任务的同时,交付了一个足够优秀的成果。
![]()
三、9篇技术论文做成PPT、43页财报转带表格网页,办公场景也能速通
对于非极客用户来说,办公无疑是最重要的使用场景,长文档总结、多文档信息提取、表格分析、复杂指令执行,这些是每天都在发生、并且决定一个模型能不能被长期调用的任务。
智东西选取了几个企业办公场景中会遇到的任务来进行测试,首先是长篇论文的解读,我们输入了DeepSeek历代模型的技术报告,总共9篇论文,让U2-Flash输出总结报告,提示词如下:
通读DeepSeek的这些核心论文,请逐篇读完之后,从架构、注意力机制、专家路由、训练优化、上下文长度和效率这六个维度,把每一代的关键突破提炼出来,再判断技术之间的继承和迭代关系,搞清楚哪些是第一次提出,哪些是在前代基础上的改良或替换。开头用两百字以内给出一个整体判断,也就是一句话讲清这条主线。接着给一张演进路线表,列出代次、时间、架构与注意力、关键创新、相比上一代解决了什么问题、以及效率变化。然后再用文字描述一张技术谱系,说明MLA、DeepSeekMoE、多token预测、稀疏注意力、mHC、Muon这些核心技术分别是从哪一代引入、又被哪一代取代。最后给三条可验证的横向对比结论,每条都标上论文出处。
U2-Flash耗时约40分钟,给出了一份关于DeepSeek模型演进谱系的分析报告,从内容上看非常凝练,核心要点都囊括在内了。
![]()
随后,我们让U2-Flash根据这份报告做一个PPT,并让它保持DeepSeek的元素,再配上一些论文截图。
![]()
有意思的是,在我限定要注意美观之后,U2-Flash对于PPT内元素的设计感变得非常在意,专门费了不少功夫来达到“好看”程度,从手绘到官网下载试了个遍,从这一点上可以看出,U2-Flash在指令遵循方面做得相当不错。
![]()
最终,U2-Flash交付了这样一个PPT,并输出了pdf和pptx两种格式,PPT上的论文截图搭配恰到好处,整体上看比较美观,细节处理也不错,在审美方面给了我们一些小惊喜。
![]()
最后,智东西选择了财报文件解读作为实测的收尾,我们并不想单纯测试U2-Flash在文件读取方面的能力,而是通过一个网页开发任务,来看看U2-Flash识别文件、分析数据、制作图表以及网页开发的综合水准,提示词如下:
阅读云知声(Unisound)最新半年报,基于报告真实数据制作一个半年报分析网页:先完整通读报告,提取营收、毛利、净利润、研发投入、现金流、资产负债等核心财务指标,以及业务板块构成、同比与环比变化、主要风险与经营亮点,再据此设计一个包含关键指标卡片、营收与利润趋势图、业务结构占比图、增长归因和总结结论的单页分析网站;页面要求数据准确、引用有出处、图表清晰可交互、适配桌面与手机、采用现代简洁商务风格,最终交付一个可直接在浏览器打开的完整HTML文件(含内联样式与必要的图表脚本),并在页面顶部注明数据来源与报告期,若某项数据报告中未披露则明确标注而非编造。
U2-Flash提取了全部43页文件中的关键财务信息,如收入、毛利、亏损、研发投入等,并将这些数据做成了表格内嵌到网页中,最终呈现出了一个既美观又具备实用性的财报分析网页。
![]()
四、后训练增大智能密度,自主闭环演进押注RSI
整体实测下来,U2-Flash的表现并不只是生成速度较快,它同样在任务完成质量上做得足够好。
无论是18分钟完成一个长链路Agent、大型滑梯建模,还是处理多份技术论文、43页财报并生成网页,都需要模型具备强大的推理、规划和自主执行能力,在实测中,U2-Flash表现确实可圈可点。
U2-Flash并不是对前一代模型U2简单做“快”和“省”的效率精简,它是云知声针对真实生产力场景推出的一种新的模型形态。云知声希望U2-Flash可以在较低激活参数下,同时覆盖推理、编程、Agent等能力,并通过后训练进一步强化自主执行。
这种设计也与云知声长期的场景积累有关。云知声拥有10年以上的行业场景和数据积累,长期参与真实业务,使其能够围绕文档处理、数据分析、代码开发、Agent执行等任务持续积累训练数据和经验。
因此,U2-Flash的训练目标除了提升单项Benchmark成绩,还包括任务理解、路径规划、工具使用和最终完成效果的优化。
具体到训练层面,云知声构建了一套后训练体系,包括自主闭环演进、自适应任务生成、多教师在线蒸馏、异步Agent RL以及自我运维。其中,自主闭环演进是比较核心的一环,也是云知声探索递归自我改进(Recursive Self-Improvement,RSI)的阶段性实践。
![]()
目前的U2-Flash并非完全自主的开放式自我改进系统,而是一个有明确边界的闭环:模型参与“生成任务、执行任务、发现问题、产生数据、继续训练”的过程,通过强弱模型轨迹对比,定位影响任务结果的关键步骤,再将这些薄弱环节转化为后续训练数据。随着模型能力变化,任务难度也会相应调整。
在这一过程中,模型的角色开始从单纯的训练对象扩展到训练流程的参与者。比如,多教师在线蒸馏将数学、代码、Agent、指令遵循等不同方向的能力迁移到统一模型中;异步Agent RL则针对长链路任务并行采集执行轨迹,并分析影响任务成败的关键Action。自我运维则进一步让模型参与训练环境检查和异常处理。
![]()
云知声认为,这类有界闭环是进一步探索RSI的起点。更高阶的方向,则是让模型逐步参与训练策略、任务设计乃至研发流程本身的改进。不过,这类开放式递归自我改进目前仍处于探索阶段,U2-Flash现阶段主要是在技能、数据和训练流程等相对明确的范围内进行实践。
从数据来看,这套训练方式已经带来了一些可量化的变化。相比U2,U2-Flash完成Coding Agent任务所需的迭代步数平均减少约20%~30%,Agent任务完成时间缩短约35%;异步Agent RL使单位时间产生的有效训练轨迹数提升约60%,多教师蒸馏则使达到同等能力水平所需的训练步数减少约55%。
U2-Flash力图证明的一件事是:模型参数规模固然重要,但对于Agent而言,有限的激活参数能够释放多少有效任务能力,同样值得关注。
五、更快更好的模型,有机会成为“默认”的那个
回到产业视角。过去,开发者和企业通常采用分层调用:简单任务用小模型,复杂任务切换旗舰模型,专项任务再调用专用模型。但多模型接入、任务路由和上下文衔接,也会带来额外的系统复杂度和延迟。
因此,当一款Flash级别模型能够同时满足能力够用、响应够快、成本可控、Agent稳定运行等条件,它就有机会从旗舰模型的补充,成为企业日常任务的默认入口。
U2-Flash的定位正是如此。它将编程、Agent、推理、工具调用和办公处理等能力集中在同一套模型中,重点覆盖文档分析、数据处理、会议纪要、方案生成、代码理解与修改等高频任务。
![]()
▲U2-Flash制作的PPT(来源:云知声)
云知声判断,随着Flash级别模型能力继续提升,未来有望覆盖企业90%以上的真实任务,旗舰模型更多承担少量复杂任务的兜底。
当然,Flash级别模型并不意味着可以替代所有模型。从实测来看,U2-Flash在复杂数学推理、前沿科研、深度推理,以及部分空间关系理解任务上仍存在能力边界,这类任务依然更适合交给能力上限更高的模型。更现实的路由方式,是让Flash模型承担大多数高频任务,遇到超出能力边界的任务再切换到更强的模型。
对于政企、金融、能源等场景,模型能否进入生产环境,还取决于本地部署、国产芯片和操作系统适配等条件。由此来看,Flash模型的竞争正在从单纯追求响应速度,转向在能力、成本、延迟和部署适配之间寻找平衡。
从实测效果上看,U2-Flash已经能在各种任务中提供高效的解决方案,同时,对于一些长链路的复杂问题,U2-Flash也拥有不俗的能力。
![]()
▲U2-Flash调用Blender建模渲染图(来源:云知声)
此外,U2-Flash还支持国产芯片部署。云知声称,在实际服务中,U2-Flash在国产平台上的吞吐、时延、并发和集群扩展效率持续提升,部分场景已接近NVIDIA GPU方案。
毫无疑问,企业以及个人开发者日常模型的选择方案,又多了一种。
结语:Agent时代,模型不仅要快,还要把事情做好
对于Agent而言,“快”从来不只是更快生成Token,更重要的是从接到任务到交付结果,能少走多少弯路,又能把事情做到什么程度。
这也是U2-Flash此次实测给人留下的一个直观感受:速度是它最容易被感知的优势,但任务完成质量才决定它能不能真正承担生产力工作。
18分钟完成Agent搭建、40分钟完成大型滑梯建模,背后考验的并不只是模型的响应速度,还包括任务理解、路径规划、工具调用、问题发现和自主修正能力。
从这个角度来看,U2-Flash所探索的并不是简单的“更快模型”,而是在有限的激活参数和计算成本下,同时把速度与任务完成质量做上去。
而在模型能力之外,云知声还在通过自主闭环演进、多教师蒸馏、异步Agent RL等后训练方式,继续强化模型处理真实任务的能力,同时也在朝着RSI的目标持续迭代。
当然,U2-Flash仍然存在能力边界,一些复杂数学推理、前沿科研以及部分空间关系任务,依然需要能力上限更高的模型。
在可预见的未来,Flash级别模型更现实的发展方向,是在越来越多高频任务中,把速度、能力、成本和稳定性同时做到一个可用的平衡点。
智能密度,正在成为这个阶段新的评价维度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.