网易首页 > 网易号 > 正文 申请入驻

深度|基元律动发布 NeoHorse-Jev,开源 Jev 综合评测第一

0
分享至



你玩过贪吃蛇吗?

游戏刚开始时,怎么走都不容易出错。但随着蛇身越来越长,留给自己的活动空间被不断压缩,任何一次错误转向,都可能让整局游戏瞬间结束。

如果让一个 AI 模型来玩贪吃蛇,它要做的并不只是简单的“去找食物”,而是每走一步都要重新审视盘面,在上、下、左、右四个方向之间快速比较,并把判断实时转化为下一次转向。

最近,有一个 AI 完成了一场这样的测试: 3000 步,89 个目标,蛇还活着。

这意味着,在数千次连续决策中,它不仅要做对眼前这一步,还要尽可能避免前面的选择把后续空间一步步“走死”。


图 1|贪吃蛇演示:3,000 步、89 个目标、蛇身长度 95,存活到回合结束。右侧同步展示候选方向、概率与最终选择。

做出这个表现的,是创业公司基元律动(tokenrhythm.ai)最新发布的轻量级模型 NeoHorse-Jev-4B 。

这家由华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的团队,将研发重点放在了实时决策上。作为一款仅 4B(40亿)参数规模的模型,NeoHorse-Jev-4B 主打毫秒级的响应速度。在包含六组评测的本轮基准测试中,它最终凭借 77.70 的综合 AVG 分数 ,拿下了成绩完整的开源参评模型第一名。目前,基元律动已同步开源了该模型的 权重、推理 源码 以及部署示例 ,方便开发者直接上手使用。


小身材大能量:用更少的参数,实现毫秒级“极速决策”

凭借更小的参数体积,NeoHorse-Jev-4B 展现出了极为出色的综合性能。

在本轮六组涵盖决策、迁移、知识与语义判断的基准测试中, NeoHorse-Jev-4B 取得了 77.70 的综合 AVG 分数 ,一举超越参数规模更大的 Open-Jev-9B(领先 2.03 分),在成绩完整的开源参评模型中位居第一。

尤其是在 Nimble、VitaminC、MASSIVE 这三项核心测试中,NeoHorse-Jev-4B 的平均得分高达 83.26 分,相比对应原始模型的 71.76 分大幅提升了 11.50 分 。这种显著的跨越,得益于团队针对决策场景进行的专门优化,让模型从基础的语言理解力成功转化为可直接调用的“判断力”。


评测数据与说明:

  • 数据源自 9 月 24 日评测汇总及同目录下的三项成绩截图;汇总报告中本模型采用 vLLM 推理后端。

  • “第一”限定为本轮六组评测结果完整的参评开源模型,并不代表各单项成绩均为第一;此外,本轮评测尚未覆盖市场上全部开源 Jev 类模型。

除了性能上的突破,NeoHorse-Jev-4B 在实用性上也做了针对性设计——让开发者能够像调用传统程序函数一样,轻松接入模型的决策能力。

开发者只需用自然语言定义好具体任务,模型就能直接返回软件系统可识别的概率分布与量化分数。这种设计省去了原本需要手动编写复杂逻辑规则的繁琐过程,直接把模型的“理解力”转换成了标准化的能力接口。

目前,模型针对常见的业务场景提供了三种核心调用方式:

  • Choice(单选): “这条请求应该路由给哪一个下游工具?”

  • Noul(是非判断): “这段用户生成内容(UGC)是否符合合规规则?”

  • Score(打分评价): “这个搜索结果与用户意图的相关度有多高?”

开发者只需要用自然语言定义问题和候选项,模型便可以直接返回概率或分数,应用随后按照结果继续执行。

换句话说,过去很多依赖 if-else、规则引擎甚至额外分类模型完成的“判断层”,被重新封装成可以直接调用的模型能力。这也是 Jev 类模型和传统生成式模型最核心的差异之一: 不直接把答案“说出来”,而是尽快完成一次决策。

这种差异也直接反映在推理链路上。

传统生成式模型通常要经历: 理解输入 → 逐 Token 生成答案 → 解析答案 → 执行 而 NeoHorse-Jev-4B 的路径被缩短为: 理解输入 → 返回候选概率 → 执行

NeoHorse-Jev-4B 使用 prefill-only 推理,直接计算不同候选项的概率,而不需要逐字生成自然语言答案,相当于省掉了生成阶段最主要的一段延迟。

在一组由 1158 个真实文本请求 构成的混合负载测试中,32 并发情况下,服务端记录的平均决策耗时为 74.3 ms ,也就是一次判断平均不到 0.1 秒;客户端完整请求的平均耗时为 273.3 ms。

尤其当并发提高到 256 时,系统每秒可以成功处理 347.05 个请求 ,该档测试中的 6,948 次请求全部成功。

需要说明的是,这里的流程对比并不是传统生成模型与 NeoHorse 在完全相同条件下的模型测速。74.3 ms 指的是服务端返回的 Decision 计时,273.3 ms 则包含完整客户端请求链路;74.3 ms 和 347.05 请求/秒也分别对应 32 并发和 256 并发两个不同测试档位。

这些数字说明了一件事:Jev 模型优化的不是“写话有多快”,而是“做一次判断够不够便宜、够不够快”,以至于可以被高频嵌入软件执行链路”。

这也正是 4B 规模的意义所在。大模型负责深思熟虑,而软件内部海量的高频细碎决策——工具路由、意图识别、内容过滤、搜索排序——并不需要百亿参数的模型每次都完整做一遍大题。真正有价值的,是用毫秒级的成本,完成成千上万次“足够好”的判断。


从游戏到具身智能:让每一次判断,都直接变成行动

开场的贪吃蛇,只是 NeoHorse-Jev-4B 展示能力的第一步。从俄罗斯方块、Flappy Bird,到四方麻将与炸弹人竞技,甚至跨越到自动驾驶和机械臂具身仿真——同一套标准化决策接口,正在被快速接入越来越多的复杂场景: 输入当前状态 -> 实时比较候选选项 -> 返回概率与得分 -> 驱动动作执行。 每一次毫秒级的判断,都在直接推动具体业务场景向前运转。

1. 俄罗斯方块:一局消除 59 行

每一个方块落下前,NeoHorse-Jev-4B 都要在极短时间内对“不同落点 x 不同朝向”的所有候选组合进行概率评估。随着棋盘局面的实时变化,模型的决策策略随之动态更新。

这段演示的结果面板记录了 190 次落子、59 行消除、6,500 分 。


图 2|一局游戏的加速回放。右侧展示候选落点与朝向、对应概率及最终选择,结尾展示本局结果。

2. Flappy Bird:把握起落,连续穿越管道

何时振翅,何时滑行,模型来判断。 NeoHorse-Jev-4B 根据小鸟的实时高度、飞行速度以及前方管道的结构化文本状态,持续输出下一步动作策略,精准穿过狭窄的管道间隙。

在完整的回合测试中,模型 单次成功穿越了 28 根管道 ,而在同组 6 个回合的综合测试中, 平均通过管道数达到了 27.67 根 。


图 3|Flappy Bird 的 12 秒回放节选,以 2 倍速播放。模型接收文字状态输入,右侧展示判断分数与动作;完整回合成绩见画面底部。

3. 麻将:从逐手选择到自摸胡牌

摸到一张牌,该留下什么、打出什么?如何根据场上已出现的公开牌型调整策略?

基于本家手牌与公共盘面信息,NeoHorse-Jev-4B 在每一个回合的候选动作中进行概率筛选。在简化为 108 张牌规则的四方对局演示中,模型一路推演并最终以 “NEO 自摸胡牌” 完成收官。


图 4|简化 108 张规则的四方麻将演示。右侧显示候选动作概率;模型使用本家手牌、公开信息与牌型辅助。

4. 四方炸弹竞技:在动态对抗中赢下本局

走位避险,还是原地放置炸弹?面对三名不断行动的对手以及随时间收缩的安全区域,NeoHorse-Jev-4B 必须在博弈中持续做出下一步选择。

在一局包含“三个 AI 模型 + 一个规则机器人”的混战展示局中,模型成功应对了复杂的动态对抗,坚持到最后并锁定胜局(NEO WINS)。


图 5|三个模型与一个规则机器人同场竞技的展示局。画面保留各方动作、概率面板及运行配置标注。

5. 自动驾驶仿真:152 次决策,到达终点

在城镇道路的仿真环境里,NeoHorse-Jev-4B 负责持续输出车辆的下一步驾驶动作,驱动车辆沿着预定路线行驶。如果说前面的几类 demo 主要展示了模型在规则环境中的连续决策能力,那么更有行业意义的,是它开始进入更接近真实应用的仿真任务。

在自动驾驶仿真中,NeoHorse-Jev-4B 需要根据结构化状态输入,持续选择下一步驾驶动作,推动车辆沿既定路线前进。界面会同步显示候选动作概率、当前速度、剩余距离以及决策进度。

这段回放共记录 152 次决策 ,最终车辆到达终点,并实现 0 次碰撞、0 次违规 。这意味着,模型的判断不再只是“过关”或“得分”,而开始具备与安全约束、路径执行相关的任务属性。


图 6|城镇路线驾驶仿真回放。模型使用结构化状态输入,场景提供原生规划与安全辅助;上述结果对应本次演示。

6. 机械臂:84 次决策,打开仿真保险柜

在机械臂仿真任务中,NeoHorse-Jev-4B 则把判断力进一步带进了具身场景。

在 Meta-World 的 door-open-v3 任务中,模型结合多模态输入理解环境状态,逐步完成接近柜门、调整位置和开门等动作。整个过程中,它一共进行了 84 次决策 ,最终任务状态显示 “SUCCESS” 。


图 7| Meta-World 的 door-open-v3 任务。84 次决策后,画面亮起“SUCCESS”。

更值得注意的是, 这款模型并未针对具身数据进行专门训练 。也就是说,这一结果更多体现的是,基于 NeoHorse-1-4B 的通用能力,决策接口本身已经具备了一定的跨场景迁移潜力。

把这些演示连起来看,NeoHorse-Jev-4B 想传递的重点,其实并不只是几个游戏或仿真项目里的单点成绩,而是同一种调用范式正在跨场景复用。从屏幕里的小游戏,到多主体对抗,再到自动驾驶和机械臂仿真,这条路径所展示的,是模型能力从“回答问题”向“驱动动作”延伸的可能性。


全量开源:让每个应用都能接入“极速判断力”

相比只发布一个模型分数,基元律动这次更强调的是可用性。

NeoHorse-Jev-4B 同步开放了模型权重、推理源码与调用示例,支持 Python、命令行、HTTP 等接入方式,并兼容 vLLM、SGLang 部署。模型按 Apache-2.0 协议发布,开发者可以直接在自己的环境中完成测试、集成和二次开发。

除了文本输入,NeoHorse-Jev-4B 还支持单张图片与文本联合输入。这意味着,同一套“输入状态—返回判断—执行动作”的接口,不再只处理抽象文本,也开始具备连接可见环境状态的能力。

目前,模型与相关文件已经上线 Huggingface / ModelScope ,代码与部署示例同步发布在 GitHub ,Hugging Face 也开放了对应社区入口。

ModelScope:

https://www.modelscope.cn/collections/TokenRhythm/NeoHorse-Jev

HuggingFace:

https://huggingface.co/collections/TokenRhythm/neohorse-jev

GitHub:

https://github.com/TokenRhythm/NeoHorse

当这种判断能力被压缩进更小的模型、以更低延迟被频繁调用,AI 进入软件和真实环境的方式,也可能随之发生变化。

最后,NeoHorse-Jev 还被安排完成了一次“奔月”——带着嫦娥飞向月宫,也给这场偏工程和技术向的发布,留了一点中秋节的彩蛋。






特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
曝乌克兰攻入俄罗斯领土布良斯克!消灭叛徒团长伊萨耶夫

曝乌克兰攻入俄罗斯领土布良斯克!消灭叛徒团长伊萨耶夫

项鹏飞
2026-09-23 18:48:33
外交部:中方敦促新西兰有关机构停止散布谎言、制造矛盾

外交部:中方敦促新西兰有关机构停止散布谎言、制造矛盾

界面新闻
2026-09-24 15:27:49
浙江省经济和信息化厅厅长、省卫生健康委员会主任、省政府外事办公室主任,同日调整

浙江省经济和信息化厅厅长、省卫生健康委员会主任、省政府外事办公室主任,同日调整

中国青年报
2026-09-24 00:38:12
光子真的同时走了所有路径?《科学》子刊完成费曼路径积分核心假设的首次直接检验

光子真的同时走了所有路径?《科学》子刊完成费曼路径积分核心假设的首次直接检验

万象经验
2026-09-03 11:30:15
1953年,梁漱溟当众硬刚毛主席,全场震怒,伟人轻叹:你从来不听劝

1953年,梁漱溟当众硬刚毛主席,全场震怒,伟人轻叹:你从来不听劝

纪史行者
2026-08-29 00:05:06
不买软件就买个包吧:WinRAR联名挎包卖150美元

不买软件就买个包吧:WinRAR联名挎包卖150美元

灰度测试中
2026-09-24 16:56:14
两境先后再访任正非,“境模式”会成华为汽车战略主航道?

两境先后再访任正非,“境模式”会成华为汽车战略主航道?

南方都市报
2026-09-24 11:56:53
不忍看!中国连输日本:男足0-7 男篮20分惨败 男乒无缘9连冠

不忍看!中国连输日本:男足0-7 男篮20分惨败 男乒无缘9连冠

念洲
2026-09-24 20:40:34
打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

打?奉陪到底,仙宾礁爆发激战,中方开始算账,第一个收拾波兰

史鹷的生活科普
2026-09-23 17:56:49
中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

中国28岁留学生嫖娼16岁日本女高中生,被抓狡辩:为了学日语!

圆圆神神神
2025-08-09 21:49:27
记者:贝尔特兰将很快出售到欧洲,曼联和国米是主要候选下家

记者:贝尔特兰将很快出售到欧洲,曼联和国米是主要候选下家

懂球帝
2026-09-24 20:54:18
晚年毛主席原谅了很多人,为何唯独不原谅潘汉年?主席对他寒了心

晚年毛主席原谅了很多人,为何唯独不原谅潘汉年?主席对他寒了心

温读
2025-03-13 18:28:10
余承东再表态:聚焦尊界、享界、智界、尚界快速提升

余承东再表态:聚焦尊界、享界、智界、尚界快速提升

北京商报
2026-09-24 17:00:08
张帅6-0送蛋!郑钦文0-2鲍里妮 首负意大利选手 中国队1-1被追平

张帅6-0送蛋!郑钦文0-2鲍里妮 首负意大利选手 中国队1-1被追平

侃球熊弟
2026-09-24 20:07:57
华为Mate90凭什么敢卖一万还受关注?

华为Mate90凭什么敢卖一万还受关注?

小眼睛小世界
2026-09-24 09:24:46
宏远速递!广东官方重要发声,周边狂卖2000万,萨姆纳正式归队

宏远速递!广东官方重要发声,周边狂卖2000万,萨姆纳正式归队

多特体育说
2026-09-23 22:31:11
时装周:杨紫扛住镜头,刘涛气场逆天,却被罕见同框的井柏然刘雯惊喜到

时装周:杨紫扛住镜头,刘涛气场逆天,却被罕见同框的井柏然刘雯惊喜到

娱乐圈十三太保
2026-09-24 17:22:39
分手传闻迎来结局?鹿晗关晓彤同步官宣,难怪两人对传闻不管不顾

分手传闻迎来结局?鹿晗关晓彤同步官宣,难怪两人对传闻不管不顾

王觪晓
2026-09-23 18:32:02
马科斯刚捏住莎拉命脉,还没来得及高兴,突然又收到一条坏消息

马科斯刚捏住莎拉命脉,还没来得及高兴,突然又收到一条坏消息

史之韵
2026-09-24 22:06:07
我82岁了,大病一场彻底醒悟:钱宁愿烂在银行,也绝不全补贴儿孙

我82岁了,大病一场彻底醒悟:钱宁愿烂在银行,也绝不全补贴儿孙

千秋文化
2026-06-30 19:14:22
2026-09-25 03:31:00
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

游戏要闻

数毛社评《魔兽世界:无限》:史上最大视觉飞跃

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

房产
本地
教育
时尚
公开课

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

痛快!中小学体育将推行“2115”计划,教育部给出保障,每周体育活动时间多达10小时

檀健次和孟子义,邀你一起来Fendi跳舞

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版