![]()
2024 年,ChatGPT 掀起生成式 AI 浪潮时,整个行业都在回答同一个问题:大模型能写出多好的文章、画出多精美的图。
两年过去,答案清晰得近乎乏味。但另一个问题被有意无意地忽略了——这些内容,有多少最终变成了电脑里的"成品"?
现实是,大多数知识工作者的工作流正在分裂。屏幕左侧开着对话式 AI,右侧是 Excel、邮箱、Notion、飞书,中间隔着一条执行鸿沟。AI 生成一份竞品分析框架,你手动填进表格;AI 写出一段代码,你粘贴到 IDE 里调试;AI 列出本周待办,你逐条复制到项目管理工具。人们得到了无限量的"半成品",却花了更多时间当"搬运工"。
Sam Altman 今年初多次提及,2025 年的核心叙事将从"模型能力"转向"Agent 交付"。从"生成答案"到"交付结果",中间隔着执行、调度、跨应用协作、错误兜底——这些脏活累活,目前几乎全由人类承担。大模型越聪明,人类越像 AI 的翻译官和质检员。
如果执行闭环是下一个战场,那么谁有能力打这一仗?
脏活测试
我们做了一个测试:让 DuMate 跟进本周 AI 行业的一则重要融资传闻,完成从热点追踪、资料交叉验证、长文撰写,到多平台内容适配和排期发布的完整内容生产流程。
对AI自媒体作者来说,这串链条里的脏活远比想象中多。你需要在Twitter/X、即刻、公众号信息流之间监控信源,在Notion或Obsidian里整理素材,在ChatGPT里反复调试prompt生成初稿,再手动把长文改写成小红书图文(提炼金句、控制篇幅、配emoji),接着生成播客口播脚本,最后分别排进公众号后台、小红书创作平台、音频剪辑软件的日程表。任何一个环节断了,比如信源没交叉验证导致数据错误,或者多平台发布时间撞车,整周的内容节奏就会崩盘。
给DuMate的指令只有一句话:"这周AI行业有个重要融资新闻,帮我跟一篇深度解读,周五前要发出,同时准备小红书图文和播客口播稿。"没有拆解步骤,没有指定工具。
接下来的时间里,它自己打开了信源监控面板,在网页间抓取相关动态;同时开始交叉验证。
![]()
进入撰写阶段,它根据整理好的素材自动生成了一篇 3000 字的深度解读,随后自主完成了多平台适配:把长文拆解成小红书图文(提炼三个核心观点、配上 emoji 和短标题),同时生成了一份适合音频录制的播客口播脚本,语气从书面语转成了口语化表达。
全程大约10分钟。零复制粘贴,零在五个平台之间反复横跳,零凌晨两点发现信源冲突而推倒重写。最终交付的是一份带信源标注的深度长文、一套小红书图文、一份播客口播脚本。
![]()
你还可以给它设置定时任务,让它在指定时间自动启动,整理每日的AI新闻。
![]()
但十分钟完成全流程,关键不在模型读了更多 Token,而在某种"不跑偏"的框架能力。
Harness:当模型负责聪明,框架负责不跑偏
用过 Agent 的人都知道,当任务链路拉长,大模型最容易犯的错不是变笨,而是变散。
第三步的决策和第一步的意图对不上,或者在某一步动作变形,把 A 任务的输出格式套到 B 任务上,整个链路就崩了。你让它写一份研报,它中途突然开始写诗;你让它分析数据,它半路把表格格式改成了散文。这不是模型智商不够,是"长链衰减"——链路越长,意图越模糊,动作越变形。
DuMate 的 Harness 框架,要兜住的就是这个问题。
它不替模型思考,只给模型定"执行纪律"。Harness 相当于一个严格的项目管理助手:每一步执行前核对目标,完成后校验格式和逻辑,发现偏离立刻纠偏。模型负责聪明,Harness 负责不跑偏。
Andrej Karpathy 很多年前提出"Software 2.0",描述神经网络如何用数据编程替代人工编码。今天 Agent 的演进,某种程度上正在进入"Software 3.0":不只是训练更大的模型,而是用工程框架把模型的"聪明"封装成稳定的"服务"。市面上大多数 Agent 还在卷模型能力,却很少有人在工程层面解决"长链任务衰减"。用户感觉 AI"时而很神,时而很懵",本质上不是模型不行,是框架没兜住。
这个判断有一个硬核的数据支撑。
行业里有一个基准测试叫 PinchBench,它测的不是模型会不会写诗,而是模型在真实工作流里完成复杂任务的准确率。最新数据:同样的底层模型,在 DuMate 的 Harness 框架下跑出 93.3%,Anthropic 的 Computer Use 是 89.0%,OpenAI 的 Operator 是 91.6%。
![]()
DeepResearch Bench 是当前对深度研究型 Agent 最全面的评测基准,从洞察深度、内容准确性、可读性等维度考察 Agent 处理复杂研究任务的综合能力。DuMate 以 58.03 的综合分位列第一。支撑这一成绩的是 DuMate 自研 Skills 体系中的 Deep Search 与 Deep Research 双引擎——前者负责跨平台语义检索与高价值信息定位,后者在此基础上叠加多轮推理与因果分析,将碎片信息提炼为结构化研究成果。
![]()
市场正在用脚投票。DuMate 以 114.72% 的环比增速拿下 AI 产品增速榜第一,访问量稳居前三。这指向一个明确的趋势:用户正在从"能生成漂亮回答"的聊天工具,转向"能完成丑陋任务"的执行搭子。
![]()
![]()
ChatGPT 和 Claude 擅长前半段:你问,它答,对话结束。DuMate 要搞定的是后半段:对话结束之后,活才刚刚开始。
当框架把执行兜住了,下一步就是让用户彻底忘记"工具"的存在。
入口:不是聚合界面,而是意图的直接映射
框架兜住了执行,但用户面对的下一个麻烦是:工具太多了。
今天的 AI 用户陷入一种荒诞的悖论——工具越多,负担越重。百度系内部就有搜索、秒哒、伐谋、百科、文库至少五条能力线,外面还有 ChatGPT、Claude、Notion AI 各自为政。用户被迫成了"AI 调度经理",每次提问前要先判断"该用哪个工具",然后在不同界面之间搬运上下文。AI 本该替你干活,结果你成了 AI 的调度员。
DuMate 的入口逻辑完全不同。它不给你选择界面,而是直接黑箱化调度。你扔进去一个自然语言指令,它自己在执行中判断:这一步需要实时信息,调用搜索;这一步需要深度分析,调用大模型推理;这一步需要可视化图表,调用数据工具。用户不需要知道后台调了谁,只需要知道任务在往前推进。
这才是"入口"的真义——不是把一堆工具摆在你面前让你挑,而是让意图直接映射到结果。
更值得说的是 Skill 的沉淀机制。一次复杂任务的执行流程可以被一键保存为可复用的 Skill。下次直接调用,无需重新描述需求。Agent 的能力不再是一次性的"聪明",而是可以累积的"流程资产"。对个人,这是把个人工作流固化成自动化脚本;对组织,这是把最佳实践从人脑里抽出来,变成可复用的数字资产。
当然,跨应用调度、访问邮件、处理数据,安全问题绕不开。DuMate 过了信通院双项认证——功能 4+ 级和可信能力优秀——核心承诺是数据不出设备、高风险操作二次确认、全程可审计。这是 Agent 进入真实工作场景的前提,企业 IT 部门不会因为"AI 很酷"就放行一个可能泄露客户邮件的工具。
迭代速度也值得一提。官方说"1 天 1 版",测试期间我们确实感知到了这种进化:第二周还在卡顿的表格识别,第三周已经顺滑;第三周还需手动兜底的邮件分类,第四周已能自动处理边缘案例。这不是传统软件的功能更新,而是 Agent 每天都在生成工作日报、反思执行、学习偏好。它像一个不睡觉的实习生,每天复盘自己哪里搞砸了,明天怎么改进。
框架兜住了执行,入口消解了工具,但 Agent 的终极考验是:它能不能同时服务所有人?
两端验证:当机器开始理解人
技术门槛这件事,AI 行业有个长期悖论:模型越强大,界面反而越复杂。真正的零门槛,不应该要求人向机器靠拢,而应该让机器理解人的表达。
老万今年七十岁,长白山野生动物摄影师,硬盘里存着近 100TB 的红外触发视频。真正拍到东北豹、黑熊的片段可能只占千分之一,过去他得戴着老花镜一帧一帧审阅,眼神不济后几乎被拖垮。他不懂 Python,不会写提示词,给 DuMate 的指令只有一句大白话:"帮我把红外视频里有野生动物的画面挑出来,建个新文件夹,再按我平时的习惯整理监测日志。"
DuMate 直接开始干活:拆解工作流、识别视频内容、提取有效片段、新建文件夹、生成带时间地点物种推测的监测记录。全程没有让老万打开任何专业软件,没有导出导入的折腾。他后来跟我们说,一开始以为是"又一个年轻人搞的聪明玩意儿",直到看到硬盘里自动冒出来的新文件夹,和那份格式熟悉得像他自己手写的日志,才意识到人机关系发生了反转——不是他去学机器的规则,而是机器理解了他的表达。
另一个极端是栗噔噔。三十岁,前腾讯产品经理,现在一个人运营三档自媒体栏目,月收入比大厂时翻五倍。她的痛点不是不会用工具,而是工具太多、链路太长。一篇内容从选题到发布,要经历 Obsidian 整理、仿写、排版、封面生成、多平台同步、短视频脚本拆解。过去她需要手动在六七个工具之间搬运,或者雇助理干这些脏活。
她用 DuMate 搭建了一条自动化流水线:在 Obsidian 里丢进去选题和素材,Agent 自动完成仿写、排版、生成封面、同步后台、拆解短视频脚本。全程五分钟。同样的产能,过去需要一个全职助理加一个兼职设计师,现在她一个人运转。这不是因为她更努力,而是她把"组织能力"下放给了 Agent。过去十人以上团队才能建立的运转体系,现在一个人、零代码、零门槛就能获取。
老万是技术绝缘体,栗噔噔是产品专家;一个七十岁,一个三十岁;一个在深山老林,一个在城市公寓。他们唯一的交集是:都有大量具体的、重复的、不想干的脏活,且都不愿意为了干这些活而先学一门技术。
这才是 Agent"零门槛"的真正含义——不是界面更简洁、按钮更少,而是彻底消解学习成本。你不需要知道什么叫 RAG,不需要理解 Agent 框架,不需要背诵提示词模板。像对一个正常人说话一样描述你要什么结果,机器负责理解意图、分解任务、调度工具、交付成品。
Agent 战争的尽头是工程化闭环
过去半年,GPT-4o、Claude 3.5、Kimi K2.6、DeepSeek-V3 在评测集上的差距持续收窄,模型能力正从竞争优势变成基础设施。Agent 时代同理:模型负责智商,框架负责执行力。
中国互联网产品工程团队过去二十年练出的肌肉,是把产品跑通。微信不是第一个 IM,但第一个把支付、公众号、小程序编进同一个国民应用;美团不是第一个做外卖的,但第一个把骑手调度、商家系统、用户端在高峰期同时跑稳。Agent 需要的正是这种能力——当海外还在卷参数,中国团队已经把 Agent 塞进邮箱、Excel、企业微信的缝隙里解决脏活。
而对百度来说,作为国内最早布局AI的企业,他们早已走完了从研发到全栈布局的过程,在“芯云模体”的基础上他们已经完全把目光瞄准了“落地”,放在如何融入千行百业。而在产品领域,今年以来,从龙虾开始,百度智能云就体现了这方面的嗅觉和速度。换个角度来说,DuMate 想做的不是一个产品,而是一个协议:自然语言进,执行结果出。这种"黑箱化"入口本质上在模仿操作系统——Windows 没让你理解内核,macOS 没让你管理内存,它们只把复杂性封装起来,给你一个可直接操作的界面。
如果 Agent 时代需要一个"Windows",胜出者必须满足三个条件:通用的任务理解、稳定的跨应用调度、安全的本地执行环境。DuMate 目前在这三条线上都有布局,但更像早期的 Windows 3.1——粗糙,但已能让人看见图形化操作系统的未来。
它还有不少毛边:移动端刚上线,极长链任务仍需人工兜底,Skills 调用逻辑也不够透明。但 1 天 1 版的迭代速度正在对冲这些不足。
在中文语境里,"搭子"是一个很微妙的词。不是下属,不是工具,是一起干活的伙伴。Agent 的终局形态,可能不是"助手"——助手听命于你;也不是"工具"——工具等你驾驭。"搭子"是一种更平等的关系:你负责意图和判断,它负责执行和兜底。
过去两年,AI 解决了"获取知识"的问题。但知识不等于结果,方案不等于交付。DuMate 代表的跃迁,是从"知识获取"到"执行交付"的跨越。
DuMate 还在进化,远不是终局。但它已经证明:当模型能力趋同,工程化闭环才是 Agent 赛道的真正分水岭。而中国互联网团队过去二十年"把产品跑通"的肌肉,此刻恰好派上了用场。
加入ZF讨论群,请先添加小助手微信
我们相信认知能够跨越阶层,
致力于为年轻人提供高质量的科技和财经内容。
稿件经采用可获邀进入Z Finance内部社群,优秀者将成为签约作者,00后更有机会成为Z Finance的早期共创成员。
我们正在招募新一期的实习生
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.