网易首页 > 网易号 > 正文 申请入驻

11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

0
分享至

AI大模型 · 深度观察


11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

一个 4B 模型,论文日榜第一。

各位刀友好,我是刀哥!先说个丢人的事。

9 月 10 日凌晨,AK(@_akhaliq,52万粉丝,Hugging Face 的机器学习增长负责人)发了条推文,三行字:NeoHorse-1,Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness。配图是论文页,标着" Paper of the day",17.9K 浏览。


一个 4B 模型,论文日榜第一。我很好奇,但结果丢人了。我盯着 Routing Harness 研究了一晚上,一直以为这模型自己会路由,就是能自己判断简单活自己干,硬骨头丢给其他大模型。

翻完论文才发现,全搞反了。

NeoHorse根本不负责路由。真正的路由器是基元律动此前开源的 Routing Harness——OpenSquilla,它架在模型池前面,每轮对话先估算"这个任务需要多强的能力"。

从 C0(边界清晰的低风险请求)到 C3(最高能力档)分四级,再决定派给谁。Claude Code 那种在 opus、sonnet、haiku 之间切换的做法,则是把路由写在了 Agent 自己的提示词里。

NeoHorse 是模型池里接单的那个。它只是干了一件没人干过的事:把路由器的派单记录,当成了自己的教材。

这个误会值多少钱?很可能决定一个 AI Agent 创业公司的生死。因为搞反这个关系的人,大概率也搞反了接下来 AI 竞争的焦点。


一、三条正在发生的行业共识

基元律动创始人王云鹤(前华为诺亚方舟实验室主任、盘古大模型负责人)在一篇博客里把这件事说得很直白:

Agent = Models + Harness,模型数量会持续增加、专业化程度加深、成本持续下降,模型之间不会归一,而是需要被组织。

所谓"七国八制",各家的长板各不相同,价格也不一样,真正的问题不是谁最强,而是怎么把这一堆模型组织起来解决一个任务

道理好理解,现实是不是这样,我们用数据说话。

  • 1单价在降,账单在涨。

    Agent 任务不是一问一答,是"搜索→规划→工具调用→代码→复核→修复"的循环,一个任务平均调用三个以上模型。根据基元律动公开的账单数据:最贵的模型只承担约10%的核心推理,却拿走约75%的 token 开销。

  • 2模型不会归一。

    还在等"一个最强模型终结比赛"的人,可以看看皇马银河战舰——齐达内、罗纳尔多、贝克汉姆、菲戈堆进同一支球队,纸面实力历史级,结果颗粒无收。

  • 模型圈现在一模一样:Kimi K3 把开源参数推到 2.8 万亿,Fable 5.1 和 GPT-6 Astra 把上下文卷到百万 token 级,每家都有长板,排名月月洗牌。这个格局不会收敛。

  • 3训练任务本身在升级。

    chat 是一问一答,reasoning 加思维链,coding 要求可验证执行,agent 是多步骤、多工具、多模型、带环境反馈。下一级台阶已经露出来:持续学习。竞争焦点正从"模型能力"转向"模型进化能力"。

三条合在一起,结论就浮出来了:模型不归一,所以 Agent 需要组织模型;而组织模型的那一层,每天看着所有任务的来龙去脉——谁擅长什么、在哪里翻车、翻车之后怎么爬起来。改进模型的方式,就握在这一层手里。

二、NeoHorse 具体做了什么

普通模型的训练语料是"题目+答案",NeoHorse 的语料是 Harness 里的真实执行轨迹:任务请求、能力需求评估、路由选择、工具调用、环境反馈、错误与恢复路径。

被中途替换的失败轨迹也留着,正确答案只说明怎么做对,翻车现场才说明哪里容易出错、出错后怎么恢复

这些轨迹不是拿来就训。先过结构校验,确认请求、回复、工具调用和环境结果一一对应;再过六维语义评估,其中一条是"有没有在正确的时机停下来"。

还有个很专业的细节:"完成"和"达标"分开记录,训练集和评测集严格隔离,不让模型提前见过考题。

训练方法上,路由器的 C0–C3 能力分档本来是线上派单用的,NeoHorse 把它离线复用成了课程表:由易到难排成三阶段,再做路由引导的在策略蒸馏。

模型

基模

NeoHorse

提升

4B

9B

结果:10 项评测平均分,4B 从基模的 58.94 提到 64.87(+5.93),9B 从基模的 65.60 提到 69.04(+3.44),4B 全部高于 Qwen3.5-4B 底座,已经接近 9B 底座水平(官方内部自测)。

最能说明问题的是这组对照:同一套课程配置下,Harness 真实轨迹比公开合成工具数据 Toucan 在五项可比测试上平均高 6.26 分。起作用的不是数据多,是数据从真实执行里获取的,数据质量高。

9 月 8 日 NeoHorse-1 开源,Apache 2.0,原生 262K 上下文,Hugging Face、ModelScope、GGUF 同步上线,首日下载 3,000+。


三、两层意义:飞轮补齐一环,RSI 跑通第一圈

商业上,基元律动采取的闭环是:开源 Harness 建生态(已验证)→ TokenRhythm API 商业化(进行中)→ 任务执行沉淀反馈(已就绪)→ 反馈训练 Agent-Native 模型 → 模型回到 API 降本提效。

五环里,"模型"此前一直靠外部供给,飞轮最关键的一环握在别人手里,轮子就转不起来。NeoHorse-1 补上它的方式,是验证了这件事:Harness 执行反馈,确实能训练出更好的模型。

把基元律动想象成一家足球俱乐部。开源 Harness 是对外开放的训练基地和青训方法论,全世界的球员和教练都可以来看、来用,这是生态。TokenRhythm API 是比赛日卖门票。

每场比赛的跑动热图、传球成功率、失误集锦,全部自动归档——这是任务执行沉淀的反馈。青训教练拿着这些录像和数据训练梯队小将——这是反馈训练模型。小将踢出来了升上一队,工资比外购球星便宜,配合还更默契——这是模型回到 API 降本提效。

之前的问题在于:一队主力全靠租借别家球星。租来的梅西再强,合同在别人手里,说收回就收回,而且他也不会按你的战术长球。NeoHorse-1 证明的是:自家青训营,真的能用自己的比赛数据,培养出踢得上主力的球员。

技术上,递归自我改进(RSI)被拆成两个环:Data-RSI——Agent 干活时,每次路由、工具调用、失败恢复都变成结构化记录,筛完进数据池,随系统运行自然增长;

Model-RSI——评测定位短板,调整下一轮数据分布,更新模型,放回模型池继续干。一个攒经验,一个改教案。NeoHorse-1 是两个环第一次在同一框架里闭环。

技术上的两个环,放进青训营打比方就是:Data-RSI 是每场比赛后自动归档的技术统计,谁跑位失误、哪次配合打成了,录像越攒越多,不用人催,赛季越长家底越厚。

Model-RSI 是教练组的赛季复盘,发现左路防守是短板,下赛季训练计划就加重左路比重,练完再拉上场检验。一个管攒录像,一个管改训练大纲。NeoHorse-1 是第一次,录像分析室和教练办公室在同一家俱乐部里转了起来。

基元律动公开数据

OpenSquilla 开源至今:7,000+ stars、17 万+ clone、1 万+ 装机

TokenRhythm API:单日 token 调用 500B+、54,000+ 用户


四、我的看法:它的位置在入口

NeoHorse 这条 4B/9B 产品线,不是去跟 Kimi K3、Fable、Astra 抢主战场的。它的位置在入口:简单任务 4B/9B 就地解决,复杂任务整理好现场再交给怪兽。

我一直认为大模型会不断吃掉外围 Agent 能力,GPT-6 Astra 这种把编程、研究、计算机操作全部内化的旗舰就是证据。

所以小模型的出路不是变得更全能,而是把入口那一段做到完美漂亮——听懂要什么、判断有多难、调工具、出错退回来。

质疑也摆在这:一轮验证够不够?(Harness 成果只有 NeoHorse-1,多代成才才叫体系,一批天才只能叫撞大运。)4B 能不能代表方向?都有道理。

我建议盯三个数字:模型进入 API 后的成本、成功率、毛利。飞轮是真的,这三个数会一圈比一圈好看;是假的,第二波数据就会露馅。

五、那它到底能干什么?五个能直接抄的用法

光讲道理没用,说点能上手摸的。它最适合的是高频、流程清晰、结果可验证的活,官方评测也证实了这点:

tau²-Bench(多轮人机工具交互)90.82,PinchBench(标准化工作流)82.25,WorkBuddy(职场多步骤任务)相比底座提升近 10 分(均为官方内部评测)。

现在可以参与 NeoHorse 的免费内测,也可以到魔搭上,根据自己的电脑配置,安装模型。把 4B 的 GGUF 装进了自己电脑,只需要三步:

pip install modelscope

modelscope download --model TokenRhythm/NeoHorse-1-4B-GGUF --local_dir ./NeoHorse-1-4B-GGUF

# Modelfile 就这几行,FROM 指向下载目录里那个 .gguf 文件

FROM ./NeoHorse-1-4B-GGUF/NeoHorse-1-4B-BF16.gguf

PARAMETER num_ctx 32768

PARAMETER temperature 1.0

ollama create neohorse-1-4b -f ./Modelfile

ollama run neohorse-1-4b

打开 ollama 也能选中 neohorse-1-4b 模型,开始对话。


做一个相对复杂,带工具调用的测试:确认今天北京日期,然后帮我看下厦门明天的天气,如果下雨就提醒我带伞。


成功了!

用法一:信息抽取,格式强迫症的福音

"把这段会议纪要整理成 JSON,字段固定为 owner、task、deadline,原文没提到的填 null,不要推测。"

后面粘上任意会议纪要。这类"抽字段"的活是每个自动化流程的第一步,量大、单价低,但格式又不能出错,让 4B 干这个,边际成本约等于零。

用法二:联网调研,逼它给证据

"NeoHorse-1 是什么时候开源的、用的什么协议?告诉我这两个信息你分别从哪里查到的。"

打开客户端的联网搜索后问。它的训练里专门有"结论要有证据支撑"这一项,所以更可能标注来源,而不是凭印象给个日期。

用法三:日志筛错,只许看不许编

"下面是一段服务日志。只依据日志内容输出 JSON:error_count、first_error_time、root_cause、evidence_lines。日志里没有的填 null。"

"没有的填 null"是关键,它在测模型会不会为了把答案填满而脑补。

用法四:多步计算,看中间结果丢不丢

"三笔订单:A 是 1288 元打 85 折,B 是 960 元打 9 折,C 是 1500 元减 260。先输出计划,再分别算实付,按从高到低排序,最后给总额。"

小模型最常见的塌方点就是算到第三步忘了第一步的数,但是NeoHorse没有。


用法五:写能跑的脚本

"写一个 Python 脚本:遍历当前目录下所有 .log 文件,统计每个文件里 ERROR 开头的行数,输出成 CSV。"

代码是"可验证执行"的任务,能不能跑、跑完对不对,一眼见分晓,正好是它后训练增益最集中的地方之一(HumanEval 4B 从 87.20 提到 96.95)。

使用路径主要是三条,按需选:

用法

怎么做

适合谁

本地聊天+联网

ollama 跑起来,客户端打开 Web Search

纯尝鲜,零成本

自动化流水线

Cherry Studio / Open WebUI 里注册工具

想把重复劳动交出去的人

嵌入自己的产品

SGLang/vLLM 起服务,OpenAI 兼容接口

在做 Agent 产品的团队

也说说它不适合什么:需要长程调试、复杂状态维护的重活,目前还是大模型的优势区;闲聊和创意写作也别找它,增益不在那儿;它是纯文本模型,没有视觉能力。另外,4B 处理高频轻量任务,9B 接多步执行,真遇到硬骨头,让路由把它送去该去的地方,这才是这套体系的正确打开方式。


公司里每周写周报写项目复盘。说实话大多数时候是应付,但偶尔认真回看一次"这事当时怎么搞砸的",下次就真能绕开那个坑。

NeoHorse 干的就是这件事,只不过它没有情绪、不会偷懒、每次翻车都被完整记录。白天在 Harness 里接单干活,晚上路由器翻它的执行记录,找出它在哪类任务上反复摔跤,下周的训练就多安排这类题。

十一个梅西赢不了球。但一个知道自己该干嘛、每场比赛都复盘的球队,加上一套会看录像的体系,能赢。这事在足球里成立过,现在有人在 AI 里又试了一次。我觉得,这事儿靠谱。

刀哥问一嘴

你用小模型做过什么?评论区聊聊。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
超越孙杨最佳成绩,张展硕霸气创亚洲纪录,拿下亚运会第4金

超越孙杨最佳成绩,张展硕霸气创亚洲纪录,拿下亚运会第4金

体娱一家亲
2026-09-23 16:43:00
体制内的饭局基本消失了

体制内的饭局基本消失了

砚田文化
2026-09-16 18:33:32
亚运会奖牌榜更新:日本32枚,韩国23枚,中国代表团太让国人自豪

亚运会奖牌榜更新:日本32枚,韩国23枚,中国代表团太让国人自豪

错过美好
2026-09-22 19:22:36
57:13,俄罗斯选举结果出炉,能换下普京的人出现?中方明确表态

57:13,俄罗斯选举结果出炉,能换下普京的人出现?中方明确表态

影孖看世界
2026-09-22 04:20:03
印度不忍了!印度队在日本没人管,印媒怒骂:平行时空的日本!

印度不忍了!印度队在日本没人管,印媒怒骂:平行时空的日本!

林子说事
2026-09-23 10:21:27
5.43亿美金!超越库里!NBA王朝终结者悄悄改写联盟格局

5.43亿美金!超越库里!NBA王朝终结者悄悄改写联盟格局

微评体育圈
2026-09-23 16:59:16
“运城13岁女孩疑被性侵案”两嫌疑人被移送起诉,前期办案人员被立案调查 专家:事后交往、反抗微弱不等同于“自愿”

“运城13岁女孩疑被性侵案”两嫌疑人被移送起诉,前期办案人员被立案调查 专家:事后交往、反抗微弱不等同于“自愿”

红星新闻
2026-09-23 10:26:30
8999元!OPPO新机官宣:9月24日,全面开售!

8999元!OPPO新机官宣:9月24日,全面开售!

科技堡垒
2026-09-23 11:46:39
可达超强台风!“舒力基”大概率登陆闽粤沿海!国庆假期或将上演双台风共舞

可达超强台风!“舒力基”大概率登陆闽粤沿海!国庆假期或将上演双台风共舞

农财宝典水产版
2026-09-22 17:49:58
A股:大家提前做好准备吧,又有消息传来,周四大概率将这样走

A股:大家提前做好准备吧,又有消息传来,周四大概率将这样走

财经大拿
2026-09-23 14:04:26
两局狂轰11-1!18岁张本美和怎么也没想到,孙颖莎王曼昱这两座大山还没翻过去,如今国乒这位22岁白纸骑兵又成一大难题!日媒连夜警告

两局狂轰11-1!18岁张本美和怎么也没想到,孙颖莎王曼昱这两座大山还没翻过去,如今国乒这位22岁白纸骑兵又成一大难题!日媒连夜警告

小七说篮球
2026-09-22 17:05:27
小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

荒野老五
2026-09-23 12:39:41
中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

中秋前夕,全国月饼市场断崖式下滑,“月饼卖不动”登顶热搜第1,月饼促销潮已经提前开启,折扣普遍在6至9折

大风新闻
2026-09-22 16:56:09
认得3个算我输!50年前的6样老物件,第1个就难倒我,最后一个村长也认不出

认得3个算我输!50年前的6样老物件,第1个就难倒我,最后一个村长也认不出

白浅娱乐聊
2026-09-17 02:34:21
引发热议!女子教你“最大化利用”Costco会员资格:空气炸锅用了3年直接退

引发热议!女子教你“最大化利用”Costco会员资格:空气炸锅用了3年直接退

油了个管
2026-09-22 19:32:35
烧光350亿,又一家国产造车新势力倒下,正式宣告破产

烧光350亿,又一家国产造车新势力倒下,正式宣告破产

诗意世界
2025-12-31 10:45:29
运城13岁女孩遭强奸案,“闺蜜”被认定为共犯

运城13岁女孩遭强奸案,“闺蜜”被认定为共犯

中国新闻周刊
2026-09-22 23:54:02
再见巴特勒?史诗级交易方案,库里联手班切罗,让其他队怎么打

再见巴特勒?史诗级交易方案,库里联手班切罗,让其他队怎么打

夕落秋山
2026-09-23 13:13:12
杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

木子爱娱乐大号
2026-09-23 15:30:25
香芋短T搭配高腰瑜伽裤,简约穿搭勾勒熟女柔和曲线

香芋短T搭配高腰瑜伽裤,简约穿搭勾勒熟女柔和曲线

只要高兴就好
2026-09-23 08:12:20
2026-09-23 17:43:01
刀哥聊AI
刀哥聊AI
深度评测AI工具、AI大模型,资深大厂架构师,出海智能硬件创业者
107文章数 13关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

数码
艺术
健康
房产
教育

数码要闻

爱适易和贝克巴斯怎么选:扭力账与沉没成本

艺术要闻

穿浴衣的女子,日本写实画家新作

痘痘没成熟,千万别硬挤!

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

教育要闻

最新!全国化学奥赛北京队名单来了!26人进入决赛,来自这11所学校

无障碍浏览 进入关怀版