AI大模型 · 深度观察
11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向
一个 4B 模型,论文日榜第一。
各位刀友好,我是刀哥!先说个丢人的事。
9 月 10 日凌晨,AK(@_akhaliq,52万粉丝,Hugging Face 的机器学习增长负责人)发了条推文,三行字:NeoHorse-1,Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness。配图是论文页,标着" Paper of the day",17.9K 浏览。
![]()
一个 4B 模型,论文日榜第一。我很好奇,但结果丢人了。我盯着 Routing Harness 研究了一晚上,一直以为这模型自己会路由,就是能自己判断简单活自己干,硬骨头丢给其他大模型。
翻完论文才发现,全搞反了。
NeoHorse根本不负责路由。真正的路由器是基元律动此前开源的 Routing Harness——OpenSquilla,它架在模型池前面,每轮对话先估算"这个任务需要多强的能力"。
从 C0(边界清晰的低风险请求)到 C3(最高能力档)分四级,再决定派给谁。Claude Code 那种在 opus、sonnet、haiku 之间切换的做法,则是把路由写在了 Agent 自己的提示词里。
NeoHorse 是模型池里接单的那个。它只是干了一件没人干过的事:把路由器的派单记录,当成了自己的教材。
这个误会值多少钱?很可能决定一个 AI Agent 创业公司的生死。因为搞反这个关系的人,大概率也搞反了接下来 AI 竞争的焦点。
![]()
一、三条正在发生的行业共识
基元律动创始人王云鹤(前华为诺亚方舟实验室主任、盘古大模型负责人)在一篇博客里把这件事说得很直白:
Agent = Models + Harness,模型数量会持续增加、专业化程度加深、成本持续下降,模型之间不会归一,而是需要被组织。
所谓"七国八制",各家的长板各不相同,价格也不一样,真正的问题不是谁最强,而是怎么把这一堆模型组织起来解决一个任务。
道理好理解,现实是不是这样,我们用数据说话。
- 1单价在降,账单在涨。
Agent 任务不是一问一答,是"搜索→规划→工具调用→代码→复核→修复"的循环,一个任务平均调用三个以上模型。根据基元律动公开的账单数据:最贵的模型只承担约10%的核心推理,却拿走约75%的 token 开销。
- 2模型不会归一。
还在等"一个最强模型终结比赛"的人,可以看看皇马银河战舰——齐达内、罗纳尔多、贝克汉姆、菲戈堆进同一支球队,纸面实力历史级,结果颗粒无收。
模型圈现在一模一样:Kimi K3 把开源参数推到 2.8 万亿,Fable 5.1 和 GPT-6 Astra 把上下文卷到百万 token 级,每家都有长板,排名月月洗牌。这个格局不会收敛。
- 3训练任务本身在升级。
chat 是一问一答,reasoning 加思维链,coding 要求可验证执行,agent 是多步骤、多工具、多模型、带环境反馈。下一级台阶已经露出来:持续学习。竞争焦点正从"模型能力"转向"模型进化能力"。
三条合在一起,结论就浮出来了:模型不归一,所以 Agent 需要组织模型;而组织模型的那一层,每天看着所有任务的来龙去脉——谁擅长什么、在哪里翻车、翻车之后怎么爬起来。改进模型的方式,就握在这一层手里。
二、NeoHorse 具体做了什么
普通模型的训练语料是"题目+答案",NeoHorse 的语料是 Harness 里的真实执行轨迹:任务请求、能力需求评估、路由选择、工具调用、环境反馈、错误与恢复路径。
被中途替换的失败轨迹也留着,正确答案只说明怎么做对,翻车现场才说明哪里容易出错、出错后怎么恢复。
这些轨迹不是拿来就训。先过结构校验,确认请求、回复、工具调用和环境结果一一对应;再过六维语义评估,其中一条是"有没有在正确的时机停下来"。
还有个很专业的细节:"完成"和"达标"分开记录,训练集和评测集严格隔离,不让模型提前见过考题。
训练方法上,路由器的 C0–C3 能力分档本来是线上派单用的,NeoHorse 把它离线复用成了课程表:由易到难排成三阶段,再做路由引导的在策略蒸馏。
模型
基模
NeoHorse
提升
4B
9B
结果:10 项评测平均分,4B 从基模的 58.94 提到 64.87(+5.93),9B 从基模的 65.60 提到 69.04(+3.44),4B 全部高于 Qwen3.5-4B 底座,已经接近 9B 底座水平(官方内部自测)。
最能说明问题的是这组对照:同一套课程配置下,Harness 真实轨迹比公开合成工具数据 Toucan 在五项可比测试上平均高 6.26 分。起作用的不是数据多,是数据从真实执行里获取的,数据质量高。
9 月 8 日 NeoHorse-1 开源,Apache 2.0,原生 262K 上下文,Hugging Face、ModelScope、GGUF 同步上线,首日下载 3,000+。
![]()
三、两层意义:飞轮补齐一环,RSI 跑通第一圈
商业上,基元律动采取的闭环是:开源 Harness 建生态(已验证)→ TokenRhythm API 商业化(进行中)→ 任务执行沉淀反馈(已就绪)→ 反馈训练 Agent-Native 模型 → 模型回到 API 降本提效。
五环里,"模型"此前一直靠外部供给,飞轮最关键的一环握在别人手里,轮子就转不起来。NeoHorse-1 补上它的方式,是验证了这件事:Harness 执行反馈,确实能训练出更好的模型。
把基元律动想象成一家足球俱乐部。开源 Harness 是对外开放的训练基地和青训方法论,全世界的球员和教练都可以来看、来用,这是生态。TokenRhythm API 是比赛日卖门票。
每场比赛的跑动热图、传球成功率、失误集锦,全部自动归档——这是任务执行沉淀的反馈。青训教练拿着这些录像和数据训练梯队小将——这是反馈训练模型。小将踢出来了升上一队,工资比外购球星便宜,配合还更默契——这是模型回到 API 降本提效。
之前的问题在于:一队主力全靠租借别家球星。租来的梅西再强,合同在别人手里,说收回就收回,而且他也不会按你的战术长球。NeoHorse-1 证明的是:自家青训营,真的能用自己的比赛数据,培养出踢得上主力的球员。
技术上,递归自我改进(RSI)被拆成两个环:Data-RSI——Agent 干活时,每次路由、工具调用、失败恢复都变成结构化记录,筛完进数据池,随系统运行自然增长;
Model-RSI——评测定位短板,调整下一轮数据分布,更新模型,放回模型池继续干。一个攒经验,一个改教案。NeoHorse-1 是两个环第一次在同一框架里闭环。
技术上的两个环,放进青训营打比方就是:Data-RSI 是每场比赛后自动归档的技术统计,谁跑位失误、哪次配合打成了,录像越攒越多,不用人催,赛季越长家底越厚。
Model-RSI 是教练组的赛季复盘,发现左路防守是短板,下赛季训练计划就加重左路比重,练完再拉上场检验。一个管攒录像,一个管改训练大纲。NeoHorse-1 是第一次,录像分析室和教练办公室在同一家俱乐部里转了起来。
基元律动公开数据
OpenSquilla 开源至今:7,000+ stars、17 万+ clone、1 万+ 装机
TokenRhythm API:单日 token 调用 500B+、54,000+ 用户
![]()
四、我的看法:它的位置在入口
NeoHorse 这条 4B/9B 产品线,不是去跟 Kimi K3、Fable、Astra 抢主战场的。它的位置在入口:简单任务 4B/9B 就地解决,复杂任务整理好现场再交给怪兽。
我一直认为大模型会不断吃掉外围 Agent 能力,GPT-6 Astra 这种把编程、研究、计算机操作全部内化的旗舰就是证据。
所以小模型的出路不是变得更全能,而是把入口那一段做到完美漂亮——听懂要什么、判断有多难、调工具、出错退回来。
质疑也摆在这:一轮验证够不够?(Harness 成果只有 NeoHorse-1,多代成才才叫体系,一批天才只能叫撞大运。)4B 能不能代表方向?都有道理。
我建议盯三个数字:模型进入 API 后的成本、成功率、毛利。飞轮是真的,这三个数会一圈比一圈好看;是假的,第二波数据就会露馅。
五、那它到底能干什么?五个能直接抄的用法
光讲道理没用,说点能上手摸的。它最适合的是高频、流程清晰、结果可验证的活,官方评测也证实了这点:
tau²-Bench(多轮人机工具交互)90.82,PinchBench(标准化工作流)82.25,WorkBuddy(职场多步骤任务)相比底座提升近 10 分(均为官方内部评测)。
现在可以参与 NeoHorse 的免费内测,也可以到魔搭上,根据自己的电脑配置,安装模型。把 4B 的 GGUF 装进了自己电脑,只需要三步:
pip install modelscope
modelscope download --model TokenRhythm/NeoHorse-1-4B-GGUF --local_dir ./NeoHorse-1-4B-GGUF
# Modelfile 就这几行,FROM 指向下载目录里那个 .gguf 文件
FROM ./NeoHorse-1-4B-GGUF/NeoHorse-1-4B-BF16.gguf
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
ollama create neohorse-1-4b -f ./Modelfile
ollama run neohorse-1-4b
打开 ollama 也能选中 neohorse-1-4b 模型,开始对话。
![]()
做一个相对复杂,带工具调用的测试:确认今天北京日期,然后帮我看下厦门明天的天气,如果下雨就提醒我带伞。
![]()
成功了!
用法一:信息抽取,格式强迫症的福音
"把这段会议纪要整理成 JSON,字段固定为 owner、task、deadline,原文没提到的填 null,不要推测。"
后面粘上任意会议纪要。这类"抽字段"的活是每个自动化流程的第一步,量大、单价低,但格式又不能出错,让 4B 干这个,边际成本约等于零。
用法二:联网调研,逼它给证据
"NeoHorse-1 是什么时候开源的、用的什么协议?告诉我这两个信息你分别从哪里查到的。"
打开客户端的联网搜索后问。它的训练里专门有"结论要有证据支撑"这一项,所以更可能标注来源,而不是凭印象给个日期。
用法三:日志筛错,只许看不许编
"下面是一段服务日志。只依据日志内容输出 JSON:error_count、first_error_time、root_cause、evidence_lines。日志里没有的填 null。"
"没有的填 null"是关键,它在测模型会不会为了把答案填满而脑补。
用法四:多步计算,看中间结果丢不丢
"三笔订单:A 是 1288 元打 85 折,B 是 960 元打 9 折,C 是 1500 元减 260。先输出计划,再分别算实付,按从高到低排序,最后给总额。"
小模型最常见的塌方点就是算到第三步忘了第一步的数,但是NeoHorse没有。
![]()
用法五:写能跑的脚本
"写一个 Python 脚本:遍历当前目录下所有 .log 文件,统计每个文件里 ERROR 开头的行数,输出成 CSV。"
代码是"可验证执行"的任务,能不能跑、跑完对不对,一眼见分晓,正好是它后训练增益最集中的地方之一(HumanEval 4B 从 87.20 提到 96.95)。
使用路径主要是三条,按需选:
用法
怎么做
适合谁
本地聊天+联网
ollama 跑起来,客户端打开 Web Search
纯尝鲜,零成本
自动化流水线
Cherry Studio / Open WebUI 里注册工具
想把重复劳动交出去的人
嵌入自己的产品
SGLang/vLLM 起服务,OpenAI 兼容接口
在做 Agent 产品的团队
也说说它不适合什么:需要长程调试、复杂状态维护的重活,目前还是大模型的优势区;闲聊和创意写作也别找它,增益不在那儿;它是纯文本模型,没有视觉能力。另外,4B 处理高频轻量任务,9B 接多步执行,真遇到硬骨头,让路由把它送去该去的地方,这才是这套体系的正确打开方式。
![]()
公司里每周写周报写项目复盘。说实话大多数时候是应付,但偶尔认真回看一次"这事当时怎么搞砸的",下次就真能绕开那个坑。
NeoHorse 干的就是这件事,只不过它没有情绪、不会偷懒、每次翻车都被完整记录。白天在 Harness 里接单干活,晚上路由器翻它的执行记录,找出它在哪类任务上反复摔跤,下周的训练就多安排这类题。
十一个梅西赢不了球。但一个知道自己该干嘛、每场比赛都复盘的球队,加上一套会看录像的体系,能赢。这事在足球里成立过,现在有人在 AI 里又试了一次。我觉得,这事儿靠谱。
刀哥问一嘴
你用小模型做过什么?评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.