网易首页 > 网易号 > 正文 申请入驻

11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

0
分享至

AI大模型 · 深度观察


11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

一个 4B 模型,论文日榜第一。

各位刀友好,我是刀哥!先说个丢人的事。

9 月 10 日凌晨,AK(@_akhaliq,52万粉丝,Hugging Face 的机器学习增长负责人)发了条推文,三行字:NeoHorse-1,Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness。配图是论文页,标着" Paper of the day",17.9K 浏览。


一个 4B 模型,论文日榜第一。我很好奇,但结果丢人了。我盯着 Routing Harness 研究了一晚上,一直以为这模型自己会路由,就是能自己判断简单活自己干,硬骨头丢给其他大模型。

翻完论文才发现,全搞反了。

NeoHorse根本不负责路由。真正的路由器是基元律动此前开源的 Routing Harness——OpenSquilla,它架在模型池前面,每轮对话先估算"这个任务需要多强的能力"。

从 C0(边界清晰的低风险请求)到 C3(最高能力档)分四级,再决定派给谁。Claude Code 那种在 opus、sonnet、haiku 之间切换的做法,则是把路由写在了 Agent 自己的提示词里。

NeoHorse 是模型池里接单的那个。它只是干了一件没人干过的事:把路由器的派单记录,当成了自己的教材。

这个误会值多少钱?很可能决定一个 AI Agent 创业公司的生死。因为搞反这个关系的人,大概率也搞反了接下来 AI 竞争的焦点。


一、三条正在发生的行业共识

基元律动创始人王云鹤(前华为诺亚方舟实验室主任、盘古大模型负责人)在一篇博客里把这件事说得很直白:

Agent = Models + Harness,模型数量会持续增加、专业化程度加深、成本持续下降,模型之间不会归一,而是需要被组织。

所谓"七国八制",各家的长板各不相同,价格也不一样,真正的问题不是谁最强,而是怎么把这一堆模型组织起来解决一个任务

道理好理解,现实是不是这样,我们用数据说话。

  • 1单价在降,账单在涨。

    Agent 任务不是一问一答,是"搜索→规划→工具调用→代码→复核→修复"的循环,一个任务平均调用三个以上模型。根据基元律动公开的账单数据:最贵的模型只承担约10%的核心推理,却拿走约75%的 token 开销。

  • 2模型不会归一。

    还在等"一个最强模型终结比赛"的人,可以看看皇马银河战舰——齐达内、罗纳尔多、贝克汉姆、菲戈堆进同一支球队,纸面实力历史级,结果颗粒无收。

  • 模型圈现在一模一样:Kimi K3 把开源参数推到 2.8 万亿,Fable 5.1 和 GPT-6 Astra 把上下文卷到百万 token 级,每家都有长板,排名月月洗牌。这个格局不会收敛。

  • 3训练任务本身在升级。

    chat 是一问一答,reasoning 加思维链,coding 要求可验证执行,agent 是多步骤、多工具、多模型、带环境反馈。下一级台阶已经露出来:持续学习。竞争焦点正从"模型能力"转向"模型进化能力"。

三条合在一起,结论就浮出来了:模型不归一,所以 Agent 需要组织模型;而组织模型的那一层,每天看着所有任务的来龙去脉——谁擅长什么、在哪里翻车、翻车之后怎么爬起来。改进模型的方式,就握在这一层手里。

二、NeoHorse 具体做了什么

普通模型的训练语料是"题目+答案",NeoHorse 的语料是 Harness 里的真实执行轨迹:任务请求、能力需求评估、路由选择、工具调用、环境反馈、错误与恢复路径。

被中途替换的失败轨迹也留着,正确答案只说明怎么做对,翻车现场才说明哪里容易出错、出错后怎么恢复

这些轨迹不是拿来就训。先过结构校验,确认请求、回复、工具调用和环境结果一一对应;再过六维语义评估,其中一条是"有没有在正确的时机停下来"。

还有个很专业的细节:"完成"和"达标"分开记录,训练集和评测集严格隔离,不让模型提前见过考题。

训练方法上,路由器的 C0–C3 能力分档本来是线上派单用的,NeoHorse 把它离线复用成了课程表:由易到难排成三阶段,再做路由引导的在策略蒸馏。

模型

基模

NeoHorse

提升

4B

9B

结果:10 项评测平均分,4B 从基模的 58.94 提到 64.87(+5.93),9B 从基模的 65.60 提到 69.04(+3.44),4B 全部高于 Qwen3.5-4B 底座,已经接近 9B 底座水平(官方内部自测)。

最能说明问题的是这组对照:同一套课程配置下,Harness 真实轨迹比公开合成工具数据 Toucan 在五项可比测试上平均高 6.26 分。起作用的不是数据多,是数据从真实执行里获取的,数据质量高。

9 月 8 日 NeoHorse-1 开源,Apache 2.0,原生 262K 上下文,Hugging Face、ModelScope、GGUF 同步上线,首日下载 3,000+。


三、两层意义:飞轮补齐一环,RSI 跑通第一圈

商业上,基元律动采取的闭环是:开源 Harness 建生态(已验证)→ TokenRhythm API 商业化(进行中)→ 任务执行沉淀反馈(已就绪)→ 反馈训练 Agent-Native 模型 → 模型回到 API 降本提效。

五环里,"模型"此前一直靠外部供给,飞轮最关键的一环握在别人手里,轮子就转不起来。NeoHorse-1 补上它的方式,是验证了这件事:Harness 执行反馈,确实能训练出更好的模型。

把基元律动想象成一家足球俱乐部。开源 Harness 是对外开放的训练基地和青训方法论,全世界的球员和教练都可以来看、来用,这是生态。TokenRhythm API 是比赛日卖门票。

每场比赛的跑动热图、传球成功率、失误集锦,全部自动归档——这是任务执行沉淀的反馈。青训教练拿着这些录像和数据训练梯队小将——这是反馈训练模型。小将踢出来了升上一队,工资比外购球星便宜,配合还更默契——这是模型回到 API 降本提效。

之前的问题在于:一队主力全靠租借别家球星。租来的梅西再强,合同在别人手里,说收回就收回,而且他也不会按你的战术长球。NeoHorse-1 证明的是:自家青训营,真的能用自己的比赛数据,培养出踢得上主力的球员。

技术上,递归自我改进(RSI)被拆成两个环:Data-RSI——Agent 干活时,每次路由、工具调用、失败恢复都变成结构化记录,筛完进数据池,随系统运行自然增长;

Model-RSI——评测定位短板,调整下一轮数据分布,更新模型,放回模型池继续干。一个攒经验,一个改教案。NeoHorse-1 是两个环第一次在同一框架里闭环。

技术上的两个环,放进青训营打比方就是:Data-RSI 是每场比赛后自动归档的技术统计,谁跑位失误、哪次配合打成了,录像越攒越多,不用人催,赛季越长家底越厚。

Model-RSI 是教练组的赛季复盘,发现左路防守是短板,下赛季训练计划就加重左路比重,练完再拉上场检验。一个管攒录像,一个管改训练大纲。NeoHorse-1 是第一次,录像分析室和教练办公室在同一家俱乐部里转了起来。

基元律动公开数据

OpenSquilla 开源至今:7,000+ stars、17 万+ clone、1 万+ 装机

TokenRhythm API:单日 token 调用 500B+、54,000+ 用户


四、我的看法:它的位置在入口

NeoHorse 这条 4B/9B 产品线,不是去跟 Kimi K3、Fable、Astra 抢主战场的。它的位置在入口:简单任务 4B/9B 就地解决,复杂任务整理好现场再交给怪兽。

我一直认为大模型会不断吃掉外围 Agent 能力,GPT-6 Astra 这种把编程、研究、计算机操作全部内化的旗舰就是证据。

所以小模型的出路不是变得更全能,而是把入口那一段做到完美漂亮——听懂要什么、判断有多难、调工具、出错退回来。

质疑也摆在这:一轮验证够不够?(Harness 成果只有 NeoHorse-1,多代成才才叫体系,一批天才只能叫撞大运。)4B 能不能代表方向?都有道理。

我建议盯三个数字:模型进入 API 后的成本、成功率、毛利。飞轮是真的,这三个数会一圈比一圈好看;是假的,第二波数据就会露馅。

五、那它到底能干什么?五个能直接抄的用法

光讲道理没用,说点能上手摸的。它最适合的是高频、流程清晰、结果可验证的活,官方评测也证实了这点:

tau²-Bench(多轮人机工具交互)90.82,PinchBench(标准化工作流)82.25,WorkBuddy(职场多步骤任务)相比底座提升近 10 分(均为官方内部评测)。

现在可以参与 NeoHorse 的免费内测,也可以到魔搭上,根据自己的电脑配置,安装模型。把 4B 的 GGUF 装进了自己电脑,只需要三步:

pip install modelscope

modelscope download --model TokenRhythm/NeoHorse-1-4B-GGUF --local_dir ./NeoHorse-1-4B-GGUF

# Modelfile 就这几行,FROM 指向下载目录里那个 .gguf 文件

FROM ./NeoHorse-1-4B-GGUF/NeoHorse-1-4B-BF16.gguf

PARAMETER num_ctx 32768

PARAMETER temperature 1.0

ollama create neohorse-1-4b -f ./Modelfile

ollama run neohorse-1-4b

打开 ollama 也能选中 neohorse-1-4b 模型,开始对话。


做一个相对复杂,带工具调用的测试:确认今天北京日期,然后帮我看下厦门明天的天气,如果下雨就提醒我带伞。


成功了!

用法一:信息抽取,格式强迫症的福音

"把这段会议纪要整理成 JSON,字段固定为 owner、task、deadline,原文没提到的填 null,不要推测。"

后面粘上任意会议纪要。这类"抽字段"的活是每个自动化流程的第一步,量大、单价低,但格式又不能出错,让 4B 干这个,边际成本约等于零。

用法二:联网调研,逼它给证据

"NeoHorse-1 是什么时候开源的、用的什么协议?告诉我这两个信息你分别从哪里查到的。"

打开客户端的联网搜索后问。它的训练里专门有"结论要有证据支撑"这一项,所以更可能标注来源,而不是凭印象给个日期。

用法三:日志筛错,只许看不许编

"下面是一段服务日志。只依据日志内容输出 JSON:error_count、first_error_time、root_cause、evidence_lines。日志里没有的填 null。"

"没有的填 null"是关键,它在测模型会不会为了把答案填满而脑补。

用法四:多步计算,看中间结果丢不丢

"三笔订单:A 是 1288 元打 85 折,B 是 960 元打 9 折,C 是 1500 元减 260。先输出计划,再分别算实付,按从高到低排序,最后给总额。"

小模型最常见的塌方点就是算到第三步忘了第一步的数,但是NeoHorse没有。


用法五:写能跑的脚本

"写一个 Python 脚本:遍历当前目录下所有 .log 文件,统计每个文件里 ERROR 开头的行数,输出成 CSV。"

代码是"可验证执行"的任务,能不能跑、跑完对不对,一眼见分晓,正好是它后训练增益最集中的地方之一(HumanEval 4B 从 87.20 提到 96.95)。

使用路径主要是三条,按需选:

用法

怎么做

适合谁

本地聊天+联网

ollama 跑起来,客户端打开 Web Search

纯尝鲜,零成本

自动化流水线

Cherry Studio / Open WebUI 里注册工具

想把重复劳动交出去的人

嵌入自己的产品

SGLang/vLLM 起服务,OpenAI 兼容接口

在做 Agent 产品的团队

也说说它不适合什么:需要长程调试、复杂状态维护的重活,目前还是大模型的优势区;闲聊和创意写作也别找它,增益不在那儿;它是纯文本模型,没有视觉能力。另外,4B 处理高频轻量任务,9B 接多步执行,真遇到硬骨头,让路由把它送去该去的地方,这才是这套体系的正确打开方式。


公司里每周写周报写项目复盘。说实话大多数时候是应付,但偶尔认真回看一次"这事当时怎么搞砸的",下次就真能绕开那个坑。

NeoHorse 干的就是这件事,只不过它没有情绪、不会偷懒、每次翻车都被完整记录。白天在 Harness 里接单干活,晚上路由器翻它的执行记录,找出它在哪类任务上反复摔跤,下周的训练就多安排这类题。

十一个梅西赢不了球。但一个知道自己该干嘛、每场比赛都复盘的球队,加上一套会看录像的体系,能赢。这事在足球里成立过,现在有人在 AI 里又试了一次。我觉得,这事儿靠谱。

刀哥问一嘴

你用小模型做过什么?评论区聊聊。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
0-2惨败!4强出炉!就在刚刚,亚运会羽毛球爆大冷:世界冠军轰然倒下,陈雨菲复仇成功,圣坛组合强势横扫,国羽半决赛压力大

0-2惨败!4强出炉!就在刚刚,亚运会羽毛球爆大冷:世界冠军轰然倒下,陈雨菲复仇成功,圣坛组合强势横扫,国羽半决赛压力大

锐评利物浦
2026-09-22 17:04:31
1分钟充100公里!和加油一样快?国产15C锂电杀疯了

1分钟充100公里!和加油一样快?国产15C锂电杀疯了

徐德文科学频道
2026-09-22 15:09:59
随着国足0-0阿联酋,产生3个意想不到和1个事实,头名进亚运会8强

随着国足0-0阿联酋,产生3个意想不到和1个事实,头名进亚运会8强

侃球熊弟
2026-09-23 15:31:35
何穗生日晒与儿子合照,开心逗娃满眼都是宠溺,手工制作生日物品

何穗生日晒与儿子合照,开心逗娃满眼都是宠溺,手工制作生日物品

扒虾侃娱
2026-09-23 15:31:26
女篮亚运最奇葩一幕!小组赛0胜全败晋级8强:1胜却被淘汰出局?

女篮亚运最奇葩一幕!小组赛0胜全败晋级8强:1胜却被淘汰出局?

篮球快餐车
2026-09-23 04:04:59
3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

3换1交易!老鹰送出希尔德+内姆哈德+现金 从黄蜂换来芬尼史密斯

罗说NBA
2026-09-23 06:05:52
日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

细雨中的呼喊
2026-09-23 15:23:55
野村报告:10万亿化债,效果几何?

野村报告:10万亿化债,效果几何?

罗sir财话
2026-09-22 14:35:32
金建宇不幸离世,年仅28岁

金建宇不幸离世,年仅28岁

上观新闻
2026-09-23 13:07:49
特朗普遭美议员警告,绝不能在涉台问题上让步

特朗普遭美议员警告,绝不能在涉台问题上让步

共工之锚
2026-09-23 00:21:11
纪委通报5起招投标惊天贪腐案!现在的招投标,靠关系已不现实了

纪委通报5起招投标惊天贪腐案!现在的招投标,靠关系已不现实了

职场资深秘书
2026-09-23 12:35:00
伊朗总统结束美国之行,等候他的不是鲜花,而是总统罢免程序?

伊朗总统结束美国之行,等候他的不是鲜花,而是总统罢免程序?

大眼妹妹
2026-09-22 23:37:58
曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

曾是歌坛一代天王,却沦为臭名昭著的台独分子,今家破人亡下场惨

蜉蝣说
2026-09-22 11:49:00
你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

你见过最不讲卫生的女生是怎样的?网友:下回不准描述这么细致了

另子维爱读史
2026-09-22 18:51:38
3-0!中国女排击败日本队夺冠 一人立大功 赢球的最大功臣不是吴梦洁

3-0!中国女排击败日本队夺冠 一人立大功 赢球的最大功臣不是吴梦洁

南海浪花
2026-09-22 21:08:29
全欧过人王诞生!皇马 19 岁边锋,每 90 分钟 5.7 次过人!皇马新援登顶五大联赛过人榜

全欧过人王诞生!皇马 19 岁边锋,每 90 分钟 5.7 次过人!皇马新援登顶五大联赛过人榜

福酱的小时光
2026-09-23 10:10:40
“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

“这跟内衣有啥区别?”中学女儿的外出穿搭,让母亲绷不住了

世界圈
2026-09-22 15:46:08
轰动全球的事故系列:上海那场大火,烧醒了一座城

轰动全球的事故系列:上海那场大火,烧醒了一座城

呼呼历史论
2026-09-23 15:18:09
特努斯不愧是搞硬件出身的苹果CEO,给iPhone 18 Pro系列机型用低端零件,让用户花更多的钱买到更烂的产品

特努斯不愧是搞硬件出身的苹果CEO,给iPhone 18 Pro系列机型用低端零件,让用户花更多的钱买到更烂的产品

逍遥漠
2026-09-23 09:58:20
俄罗斯媒体确认了:俄罗斯总统普京所属统一俄罗斯党在俄国家杜马(议会下院)获得的席位数量,创下该党参选以来的历史最高纪录

俄罗斯媒体确认了:俄罗斯总统普京所属统一俄罗斯党在俄国家杜马(议会下院)获得的席位数量,创下该党参选以来的历史最高纪录

吉刻新闻
2026-09-22 14:00:24
2026-09-23 16:52:49
刀哥聊AI
刀哥聊AI
深度评测AI工具、AI大模型,资深大厂架构师,出海智能硬件创业者
107文章数 13关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

亲子
数码
本地
手机
艺术

亲子要闻

红金纳福,萌娃送财

数码要闻

破晓家族重磅新品发布 华硕商用PC进入AI Agent应用时代

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

苹果出手限制“摇一摇”广告

艺术要闻

穿浴衣的女子,日本写实画家新作

无障碍浏览 进入关怀版