网易首页 > 网易号 > 正文 申请入驻

深度|基元律动发布 NeoHorse-Jev,开源 Jev 综合评测第一

0
分享至



你玩过贪吃蛇吗?

游戏刚开始时,怎么走都不容易出错。但随着蛇身越来越长,留给自己的活动空间被不断压缩,任何一次错误转向,都可能让整局游戏瞬间结束。

如果让一个 AI 模型来玩贪吃蛇,它要做的并不只是简单的“去找食物”,而是每走一步都要重新审视盘面,在上、下、左、右四个方向之间快速比较,并把判断实时转化为下一次转向。

最近,有一个 AI 完成了一场这样的测试: 3000 步,89 个目标,蛇还活着。

这意味着,在数千次连续决策中,它不仅要做对眼前这一步,还要尽可能避免前面的选择把后续空间一步步“走死”。


图 1|贪吃蛇演示:3,000 步、89 个目标、蛇身长度 95,存活到回合结束。右侧同步展示候选方向、概率与最终选择。

做出这个表现的,是创业公司基元律动(tokenrhythm.ai)最新发布的轻量级模型 NeoHorse-Jev-4B 。

这家由华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的团队,将研发重点放在了实时决策上。作为一款仅 4B(40亿)参数规模的模型,NeoHorse-Jev-4B 主打毫秒级的响应速度。在包含六组评测的本轮基准测试中,它最终凭借 77.70 的综合 AVG 分数 ,拿下了成绩完整的开源参评模型第一名。目前,基元律动已同步开源了该模型的 权重、推理 源码 以及部署示例 ,方便开发者直接上手使用。


小身材大能量:用更少的参数,实现毫秒级“极速决策”

凭借更小的参数体积,NeoHorse-Jev-4B 展现出了极为出色的综合性能。

在本轮六组涵盖决策、迁移、知识与语义判断的基准测试中, NeoHorse-Jev-4B 取得了 77.70 的综合 AVG 分数 ,一举超越参数规模更大的 Open-Jev-9B(领先 2.03 分),在成绩完整的开源参评模型中位居第一。

尤其是在 Nimble、VitaminC、MASSIVE 这三项核心测试中,NeoHorse-Jev-4B 的平均得分高达 83.26 分,相比对应原始模型的 71.76 分大幅提升了 11.50 分 。这种显著的跨越,得益于团队针对决策场景进行的专门优化,让模型从基础的语言理解力成功转化为可直接调用的“判断力”。


评测数据与说明:

  • 数据源自 9 月 24 日评测汇总及同目录下的三项成绩截图;汇总报告中本模型采用 vLLM 推理后端。

  • “第一”限定为本轮六组评测结果完整的参评开源模型,并不代表各单项成绩均为第一;此外,本轮评测尚未覆盖市场上全部开源 Jev 类模型。

除了性能上的突破,NeoHorse-Jev-4B 在实用性上也做了针对性设计——让开发者能够像调用传统程序函数一样,轻松接入模型的决策能力。

开发者只需用自然语言定义好具体任务,模型就能直接返回软件系统可识别的概率分布与量化分数。这种设计省去了原本需要手动编写复杂逻辑规则的繁琐过程,直接把模型的“理解力”转换成了标准化的能力接口。

目前,模型针对常见的业务场景提供了三种核心调用方式:

  • Choice(单选): “这条请求应该路由给哪一个下游工具?”

  • Noul(是非判断): “这段用户生成内容(UGC)是否符合合规规则?”

  • Score(打分评价): “这个搜索结果与用户意图的相关度有多高?”

开发者只需要用自然语言定义问题和候选项,模型便可以直接返回概率或分数,应用随后按照结果继续执行。

换句话说,过去很多依赖 if-else、规则引擎甚至额外分类模型完成的“判断层”,被重新封装成可以直接调用的模型能力。这也是 Jev 类模型和传统生成式模型最核心的差异之一: 不直接把答案“说出来”,而是尽快完成一次决策。

这种差异也直接反映在推理链路上。

传统生成式模型通常要经历: 理解输入 → 逐 Token 生成答案 → 解析答案 → 执行 而 NeoHorse-Jev-4B 的路径被缩短为: 理解输入 → 返回候选概率 → 执行

NeoHorse-Jev-4B 使用 prefill-only 推理,直接计算不同候选项的概率,而不需要逐字生成自然语言答案,相当于省掉了生成阶段最主要的一段延迟。

在一组由 1158 个真实文本请求 构成的混合负载测试中,32 并发情况下,服务端记录的平均决策耗时为 74.3 ms ,也就是一次判断平均不到 0.1 秒;客户端完整请求的平均耗时为 273.3 ms。

尤其当并发提高到 256 时,系统每秒可以成功处理 347.05 个请求 ,该档测试中的 6,948 次请求全部成功。

需要说明的是,这里的流程对比并不是传统生成模型与 NeoHorse 在完全相同条件下的模型测速。74.3 ms 指的是服务端返回的 Decision 计时,273.3 ms 则包含完整客户端请求链路;74.3 ms 和 347.05 请求/秒也分别对应 32 并发和 256 并发两个不同测试档位。

这些数字说明了一件事:Jev 模型优化的不是“写话有多快”,而是“做一次判断够不够便宜、够不够快”,以至于可以被高频嵌入软件执行链路”。

这也正是 4B 规模的意义所在。大模型负责深思熟虑,而软件内部海量的高频细碎决策——工具路由、意图识别、内容过滤、搜索排序——并不需要百亿参数的模型每次都完整做一遍大题。真正有价值的,是用毫秒级的成本,完成成千上万次“足够好”的判断。


从游戏到具身智能:让每一次判断,都直接变成行动

开场的贪吃蛇,只是 NeoHorse-Jev-4B 展示能力的第一步。从俄罗斯方块、Flappy Bird,到四方麻将与炸弹人竞技,甚至跨越到自动驾驶和机械臂具身仿真——同一套标准化决策接口,正在被快速接入越来越多的复杂场景: 输入当前状态 -> 实时比较候选选项 -> 返回概率与得分 -> 驱动动作执行。 每一次毫秒级的判断,都在直接推动具体业务场景向前运转。

1. 俄罗斯方块:一局消除 59 行

每一个方块落下前,NeoHorse-Jev-4B 都要在极短时间内对“不同落点 x 不同朝向”的所有候选组合进行概率评估。随着棋盘局面的实时变化,模型的决策策略随之动态更新。

这段演示的结果面板记录了 190 次落子、59 行消除、6,500 分 。


图 2|一局游戏的加速回放。右侧展示候选落点与朝向、对应概率及最终选择,结尾展示本局结果。

2. Flappy Bird:把握起落,连续穿越管道

何时振翅,何时滑行,模型来判断。 NeoHorse-Jev-4B 根据小鸟的实时高度、飞行速度以及前方管道的结构化文本状态,持续输出下一步动作策略,精准穿过狭窄的管道间隙。

在完整的回合测试中,模型 单次成功穿越了 28 根管道 ,而在同组 6 个回合的综合测试中, 平均通过管道数达到了 27.67 根 。


图 3|Flappy Bird 的 12 秒回放节选,以 2 倍速播放。模型接收文字状态输入,右侧展示判断分数与动作;完整回合成绩见画面底部。

3. 麻将:从逐手选择到自摸胡牌

摸到一张牌,该留下什么、打出什么?如何根据场上已出现的公开牌型调整策略?

基于本家手牌与公共盘面信息,NeoHorse-Jev-4B 在每一个回合的候选动作中进行概率筛选。在简化为 108 张牌规则的四方对局演示中,模型一路推演并最终以 “NEO 自摸胡牌” 完成收官。


图 4|简化 108 张规则的四方麻将演示。右侧显示候选动作概率;模型使用本家手牌、公开信息与牌型辅助。

4. 四方炸弹竞技:在动态对抗中赢下本局

走位避险,还是原地放置炸弹?面对三名不断行动的对手以及随时间收缩的安全区域,NeoHorse-Jev-4B 必须在博弈中持续做出下一步选择。

在一局包含“三个 AI 模型 + 一个规则机器人”的混战展示局中,模型成功应对了复杂的动态对抗,坚持到最后并锁定胜局(NEO WINS)。


图 5|三个模型与一个规则机器人同场竞技的展示局。画面保留各方动作、概率面板及运行配置标注。

5. 自动驾驶仿真:152 次决策,到达终点

在城镇道路的仿真环境里,NeoHorse-Jev-4B 负责持续输出车辆的下一步驾驶动作,驱动车辆沿着预定路线行驶。如果说前面的几类 demo 主要展示了模型在规则环境中的连续决策能力,那么更有行业意义的,是它开始进入更接近真实应用的仿真任务。

在自动驾驶仿真中,NeoHorse-Jev-4B 需要根据结构化状态输入,持续选择下一步驾驶动作,推动车辆沿既定路线前进。界面会同步显示候选动作概率、当前速度、剩余距离以及决策进度。

这段回放共记录 152 次决策 ,最终车辆到达终点,并实现 0 次碰撞、0 次违规 。这意味着,模型的判断不再只是“过关”或“得分”,而开始具备与安全约束、路径执行相关的任务属性。


图 6|城镇路线驾驶仿真回放。模型使用结构化状态输入,场景提供原生规划与安全辅助;上述结果对应本次演示。

6. 机械臂:84 次决策,打开仿真保险柜

在机械臂仿真任务中,NeoHorse-Jev-4B 则把判断力进一步带进了具身场景。

在 Meta-World 的 door-open-v3 任务中,模型结合多模态输入理解环境状态,逐步完成接近柜门、调整位置和开门等动作。整个过程中,它一共进行了 84 次决策 ,最终任务状态显示 “SUCCESS” 。


图 7| Meta-World 的 door-open-v3 任务。84 次决策后,画面亮起“SUCCESS”。

更值得注意的是, 这款模型并未针对具身数据进行专门训练 。也就是说,这一结果更多体现的是,基于 NeoHorse-1-4B 的通用能力,决策接口本身已经具备了一定的跨场景迁移潜力。

把这些演示连起来看,NeoHorse-Jev-4B 想传递的重点,其实并不只是几个游戏或仿真项目里的单点成绩,而是同一种调用范式正在跨场景复用。从屏幕里的小游戏,到多主体对抗,再到自动驾驶和机械臂仿真,这条路径所展示的,是模型能力从“回答问题”向“驱动动作”延伸的可能性。


全量开源:让每个应用都能接入“极速判断力”

相比只发布一个模型分数,基元律动这次更强调的是可用性。

NeoHorse-Jev-4B 同步开放了模型权重、推理源码与调用示例,支持 Python、命令行、HTTP 等接入方式,并兼容 vLLM、SGLang 部署。模型按 Apache-2.0 协议发布,开发者可以直接在自己的环境中完成测试、集成和二次开发。

除了文本输入,NeoHorse-Jev-4B 还支持单张图片与文本联合输入。这意味着,同一套“输入状态—返回判断—执行动作”的接口,不再只处理抽象文本,也开始具备连接可见环境状态的能力。

目前,模型与相关文件已经上线 Huggingface / ModelScope ,代码与部署示例同步发布在 GitHub ,Hugging Face 也开放了对应社区入口。

ModelScope:

https://www.modelscope.cn/collections/TokenRhythm/NeoHorse-Jev

HuggingFace:

https://huggingface.co/collections/TokenRhythm/neohorse-jev

GitHub:

https://github.com/TokenRhythm/NeoHorse

当这种判断能力被压缩进更小的模型、以更低延迟被频繁调用,AI 进入软件和真实环境的方式,也可能随之发生变化。

最后,NeoHorse-Jev 还被安排完成了一次“奔月”——带着嫦娥飞向月宫,也给这场偏工程和技术向的发布,留了一点中秋节的彩蛋。






特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
今日八月十六,别忘:1要走,2要吃,3不做,寓意幸福安康,丰收美满

今日八月十六,别忘:1要走,2要吃,3不做,寓意幸福安康,丰收美满

小茉莉美食记
2026-09-26 00:45:05
正式退出,梁靖崑官宣离队,独自离京,原因曝光,谁注意王皓的回应

正式退出,梁靖崑官宣离队,独自离京,原因曝光,谁注意王皓的回应

乒乓助手
2026-08-18 02:08:26
理记:拿“国家大事”当遮羞布的,不是蠢就是坏

理记:拿“国家大事”当遮羞布的,不是蠢就是坏

迷世书童
2026-09-23 15:48:17
荷兰首相游说美方:别再限制ASML对华出口

荷兰首相游说美方:别再限制ASML对华出口

观察者网
2026-09-25 14:33:01
这三个国家不欢迎中国人,满脸都是嫌弃,却总有国人上赶着去

这三个国家不欢迎中国人,满脸都是嫌弃,却总有国人上赶着去

墨兰史书
2026-09-18 03:30:06
全球震动!哈佛研究证实:中国不是崛起,而是正在慢慢回归

全球震动!哈佛研究证实:中国不是崛起,而是正在慢慢回归

叹为观止易
2026-09-24 17:14:28
回顾:被宠坏的“恶少”李天一,被判10年后出狱,仍然死性不改

回顾:被宠坏的“恶少”李天一,被判10年后出狱,仍然死性不改

白云故事
2025-01-24 18:25:03
100元门票不收了!游客暴涨!市民直呼:很有生活气,不一样了——

100元门票不收了!游客暴涨!市民直呼:很有生活气,不一样了——

BRTV新闻
2026-09-21 19:17:46
苏联解体,叛逃少将马尔果夫申请回国,我国经研究给出明确回应

苏联解体,叛逃少将马尔果夫申请回国,我国经研究给出明确回应

磊子讲史
2026-03-20 17:24:40
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
四川一男子火锅店喝酒,见老板娘长得漂亮,竟要老板娘陪他喝酒…

四川一男子火锅店喝酒,见老板娘长得漂亮,竟要老板娘陪他喝酒…

一口娱乐
2026-09-26 00:58:26
梅西谢幕时,C罗的发布会为何让全网破防?

梅西谢幕时,C罗的发布会为何让全网破防?

宝哥精彩赛事
2026-09-25 11:55:04
比亚迪“大块头”:续航1600km,四季度上市

比亚迪“大块头”:续航1600km,四季度上市

高科技爱好者
2026-09-25 23:01:33
孙中山临终喊的不是蒋介石,一个连候补委员都不是的人,怎么十年后坐上了头把交椅

孙中山临终喊的不是蒋介石,一个连候补委员都不是的人,怎么十年后坐上了头把交椅

纪史行者
2026-09-26 04:35:05
马斯克他爸在上海吃大餐,穿中式外套搓麻将,还秀了新买的翡翠

马斯克他爸在上海吃大餐,穿中式外套搓麻将,还秀了新买的翡翠

嘴角上翘的弧度
2026-09-25 15:03:49
这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

这很科学:89%的人幻想过同时和多人发生性行为,算精神出轨吗?

宇宙时空
2026-05-26 18:20:10
可惜了,广州东站!

可惜了,广州东站!

楼市灭霸
2026-09-25 22:33:57
10点睡觉是错误的?医生建议:过了70岁,睡觉尽量要做到这5点

10点睡觉是错误的?医生建议:过了70岁,睡觉尽量要做到这5点

荆医生科普
2026-07-29 14:48:43
反差!小米澎程“上市次周”锁单量大幅下滑,网友:不及预期?

反差!小米澎程“上市次周”锁单量大幅下滑,网友:不及预期?

大厂财经社
2026-09-25 11:03:30
NASA局长:嫦娥七号推迟,我们可能躲过了一颗子弹

NASA局长:嫦娥七号推迟,我们可能躲过了一颗子弹

Ping值焦虑
2026-09-24 23:07:15
2026-09-26 05:36:49
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

游戏要闻

《生化9》收入或破5亿美元 Xbox版销量占比为8.6%

头条要闻

特朗普:这次访问富有成效

头条要闻

特朗普:这次访问富有成效

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

好甜!井柏然刘雯结伴看李荣浩演唱会

财经要闻

月饼卖不动了...

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

汽车要闻

小鹏G9L VS 保时捷卡宴,同场实测讲解

态度原创

本地
时尚
手机
艺术
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

怎么度过这个夜晚,才算不辜负这轮明月?

手机要闻

华为深夜突然推送!702MB鸿蒙大更新,正式版实锤了?

艺术要闻

看完瞬间清醒!尼采一句话,治好了我的精神内耗!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版