网易首页 > 网易号 > 正文 申请入驻

深度解读:关于 Jev 的几大疑问

0
分享至


刷屏全网的 Jev,是 AI 革命,还是营销噱头?

作者丨高允毅

编辑丨岑 峰

这几天,全网都被 Jev 刷屏。

说它是这周最火的大模型,一点也不夸张。推特上诸多大佬用它打马里奥,过滤垃圾信息,炒币,称它为“Agent时代的系统1”;也有人说这就是一个 JSON 分类器,值得吹?

有人说它比 DeepSeek 还快,做同一个任务,28 秒 Jev 已经刷完 428 条数据,完成打标签和分类,DeepSeek V4.1-Flash 才做到第 6 条。

有人已经开始思考,这种判断速度放进自动驾驶场景,能不能更上一层楼。还有人在实测中,摸到了它的使用边界。

可能是天下苦 LLM “慢思考”久矣,让 Jev 的“快思考”在这个节点火爆全球——Jev的技术路线,与苦苦钻研o1这种“慢思考”、能写长篇大论的深度推理模型可谓“反其道而行之”,只做一件事:决策判断。这就好比,大家都在培养一个全能作家,TypeSafe AI偏偏弄了一个只能打分的裁判。

这到底是什么?吹的成分大,还是今年的最大创新路线?目前众说纷纭。

我们综合了官网技术报告和业界的深度解读,把它摊开来看。

01


Jev 是什么?来自官网的解释

Jev 是 ChatGPT 早期核心贡献者之一 、RLHF 之父 Diogo Almeida 创立 TypeSafe AI后,闭关两年的开山之作。它与以往的模型很不同的点是,它不生成文本


它接收非结构化输入或问题,返回带类型的概率决策,代码可直接依据结果执行动作。简单理解,这是一个“自动判断器”,你给它输入一些内容,它还你一个“决策结果”。

它只做三件事,bool、choice、score,bool 是 yes 或者 no 判断,choice 是做选择,score 是打分。

所以,Jev 最大的特点就是“极速”与“极省”。官网介绍,它比普通 LLM 快 20-200 倍,成本低近两个数量级,输出 Token 免费。

这种快,来自于新的模型架构、并行采样器以及一种全新训练方法“校准决策强化学习(RLCD) ”。其中,最值得注意的,他现在选择 RLCD,是出于对他当年创造的 RLHF 的反思。

当年, GPT-3 还只会文字接龙,RLHF 就是基于人类的反馈诞生的强化学习,它让 AI 的表达与人类偏好对齐,从而催生了 ChatGPT。

但随着 RLHF 被大规模使用,人们发现大模型开始为了讨好人类瞎回答,尤其是面对那些人类都无法理解、无法打分的复杂问题时,RLHF 会“不懂装懂”。

于是,可验证奖励的强化学习(RLVR ) 诞生了,它基于客观的编译器或数学验算程序的反馈,对就是对,错就是错,直接开启了 OpenAI o1/o3、DeepSeek-R1 为代表的“大模型深度推理时代”。

但为了追求“正确”,模型的深度思考,让生成答案变得非常慢、极其消耗算力。但在海量的企业自动化业务中,“毫秒级响应且高准确度”才是真实痛点。

于是, RLCD 诞生了。Diogo Almeida 认为让大模型盲目堆规模和长篇大论打草稿,并不适合高频的工业级决策。RLCD 要做的,就是逼机器输出“认知内的概率答案”,有几成把握说几成把握,绝不瞎编。所以,Diogo Almeida表示,在这种训练模式下,Jev不会有幻觉。

RLCD 不再是传统 LLM 一个字一个字往外蹦生成模式,通过“并行采样”,在机器内部同时看一堆选项,并在 70ms-500ms内输出结构化的最终决策。同时,在 System One 这类封闭决策任务上,它可以取得和 GPT-5.6 Terra 相当的表现。


这种特质导致 Jev 很适合那些需要高频、实时、结论明确的场景,比如医院分诊台,快递分拣中心,处理海量数据,以及各种打分系统等。

作为 TypeSafe AI 旗下 System One 模型体系的首款公开产品,Jev 的出现,本质上是 Diogo Almeida 对 “快思考” 类商业化需求前景的押注:当智能决策的成本下降两个数量级,将会解锁海量自动化场景。

02


这是一个 JSON 分类器吗?

关于 Jev 是否是个“分类器”,已经没有异议。争议在于,这算不算创新。

知乎 AI 领域答主赵泠下了一个定义,这不是下一代 AI 新模型,它本质是 smarter 的 if-else 。

所谓 if-else 就是“条件判断逻辑”,非 A 即 B,在传统程序里,它是确定的唯一的。但大模型是用概率分布来模拟人类的条件反射,其中的 if-else 更像是 “最优概率路径” 。

这就注定了 Jev 与 LLM 完全不在同一个维度上,它的能力边界从一开始就被严格框死,不具备自由文本生成能力,也无法解决任何开放性问题。

它的用处,是当好大模型的专用“智能决策网关”。大模型负责理解自然语言、做复杂推理,Jev 负责后续的路由、审核、风险评分、格式校验这类判断子任务。

再加上它仅有 32k 的上下文窗口,进一步坐实它的定位,就是让系统里的判断环节更灵活、更便宜。

至于 Jev 所谓的“无幻觉”,赵泠认为这是典型的营销话术,本质是重新定义了"幻觉"这个词。

我们通常说的大模型幻觉,是事实错误,而 Jev 的无幻觉,是基于它不会输出定义之外的内容,这是“格式正确”,并不意味着它不会产生另一种幻觉,即“判断错误”。

在输出结果上,Jev 确实“极快”“极省”,这是放弃通用生成能力、只做判断,换来的“速度与成本”,与其说技术创新,更像是选择了一条更加狭窄的技术路径。所以,当有人用 2 小时,基于 Qwen-2.5-1B 模型复刻出类似的产品时,有人嘲笑这件事没有任何技术护城河。

赵泠点出,这种快和便宜,是以牺牲准确率为代价的。在同样的判断任务上,Jev 的准确率其实不如当代前沿大模型直接输出结果。它的核心竞争力从来不是"更准",而是"更快、更便宜、够用就行"。它证明了,把判别模型走到极致,在Agent时代或许具有不可替代的价值。

Jev 不是没用,只是从工程角度而言,没吹的那么神。

03


这种快速的判断可靠吗?

也有人在实测后提出,这不是一个单纯的 smarter 的 if-else ,它的本质还是基于 Transformer 模型调教的。

小马智行的架构师程墨,看到 Jev 后,马上联想到 L4 自动驾驶的决策大部分是 Code,核心就是 if-else,那 Jev 会做紧急判断吗?

他设立一个经典场景,在两车道上,一辆车以200迈的速度狂奔,而在左边车道100英尺处有一只狗,右边车道100英尺处有一位女士,该怎么做。

他给出的选项是走左车道,走右车道,急刹车,缓刹车,还有走中间,从狗和女士中间穿过去。

在此之前,他已经给 Jev 设定了什么是“良好驾驶行为”,并且规定三个条件,安全为主,不要违反交通规则,尽快到达目的地。

不到一秒,Jev 给出了答案:“急刹车”。

程墨随后又把规则改成"优先到达,其次交规,最后才是安全"。一个明显的变化是,Jev依然选择急刹,只是概率从 94% 骤降到 77%。



于是,程墨干脆设定 Jev 不要管安全和交通规则,越快越好。出乎意料的是,Jev 依然选择“急刹”,而且概率回升到 80%。

这说明 Jev 有一套自己的“默认规则”,这些规则会优先于用户给它的指令。它更像一个基于 Transformer 的大模型:先理解所有规则,再自己做出最终选择。所以,它依然拥有大模型的种种缺陷,不会“指哪打哪”。

Monad 团队的开发者 Jarrod Watts 把 Jev 用在了币圈,结果翻了车。

他本来想用 Monad 区块链实时抓取 Kuru 交易所 MON-USDC 交易对的盘口数据,看挂出来的买入价和卖出价。然后把这些实时数据喂给 Jev,让 Jev 判断下一步价格是涨还是跌,程序再根据判断自动挂限价单,低买高卖赚差价。

这本来是想全网秀一把“如何稳定赚做市差价”,不料策略连续运行后,在杠杆的放大效应下,账户出现巨大回撤。

这件事的错误点就在于,他把交易策略简化成了一道“涨还是跌”的判断题。在充斥着诱空诱多、假盘口、对抗性挂单的真实市场里,Jev 却只能做简单判断,而所谓的“最优概率路径”被市场主力的假动作反复带偏,连续给出错误的买卖决策。

越是把 Jev 往 “全权决策” 的位置上放,速度反而成了亏钱的放大器。

04


为什么偏偏是Jev火了?

Jev爆火的原因,是因为它精准击中了AI开发者的三大痛点:太慢、太贵、太不可控

随着各路开发者陆续上手实测,Jev 的使用边界也越来越清晰起来。

Browser Use 创始人曾对 Jev 进行过一次长程浏览器交互测试,结果 20 道题, Jev 只做对了 1 题。

还有人尝试用 Jev 重写 Pi Agent 的部分模块,最后发现,核心环节根本无法被替代,Jev 只能去处理一些数据分类、文本压缩等边界清晰的子任务。

可以说,Jev 在复杂的开放任务中行不通。它的正确打开方式,是有限解空间 + 高实时要求 + 结构化输出。只要任务被严格限定在封闭边界内,它就能将低延迟和极低成本的优势发挥到极致。

比如,Computer Use 场景中,它能根据有限集合快速做出“点击”或“滚动”的动作映射。游戏里的 NPC AI、机器人的运动控制、自动驾驶的紧急避险层,可以实时响应。

在量化交易、社交 App 风控审核、设备监控、工单分流等高频场景中,它能替代臃肿的传统代码。

甚至在复杂的 Agent 系统里,我们也可以把工具调用的结果校验、输出内容的风险检测、流程分支的路由判断等封闭子任务全权剥离给 Jev,从而把昂贵的大模型算力解放出来,让其专注处理最核心的深层推理。

与之相对的,它的短板体现在,Jev 无法编写文本,没有复杂推理能力,中文泛化表现不佳,无法独立进行复杂的工具调用,在真实、动态复杂网络环境, Jev 容易误判。

某种程度上,Jev 的出现,是 AI 行业在经历了几年的 “通用大模型军备竞赛” 之后,开始往 “分工细化” 的方向走了。它把 “快速结构化判断” 这件事做到了极致,这才是用好它的核心。

Jev的爆火撕开了大模型“生成为王”的假象。它告诉我们:在很多实际业务场景中,我们需要的也许是一个又快又准的“裁判”,而不是一个滔滔不绝的“作家”。

https://typesafe.ai/blog/introducing-system-one-models-and-jev

https://www.zhihu.com/question/2083549123160925836

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
油价四连跌:9月24日的调价窗口,可能要变卦了

油价四连跌:9月24日的调价窗口,可能要变卦了

沙雕小琳琳
2026-09-23 12:59:28
中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

风干迷茫人
2026-09-23 11:14:24
中午2点!CCTV5直播国足冲击亚运会4强,王钰栋停赛,安东尼奥欲带队再创历史

中午2点!CCTV5直播国足冲击亚运会4强,王钰栋停赛,安东尼奥欲带队再创历史

篮球圈里的那些事
2026-09-23 18:32:44
财政部为什么是党组、公安部为什么是党委?

财政部为什么是党组、公安部为什么是党委?

画生笔记
2026-09-20 09:10:50
日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

史之铭
2026-09-21 17:26:54
4-2横扫张本智和!19岁国乒天才连斩5大世界名将,一战封神

4-2横扫张本智和!19岁国乒天才连斩5大世界名将,一战封神

阿讯说天下
2026-05-30 14:20:24
到底为什么,每次中美峰会前,日本都要抢先去

到底为什么,每次中美峰会前,日本都要抢先去

江平舟
2026-09-22 19:24:25
国足0-0阿联酋,赛后迎2个好消息和1个坏消息,淘汰赛能避开日本

国足0-0阿联酋,赛后迎2个好消息和1个坏消息,淘汰赛能避开日本

侃球熊弟
2026-09-23 15:30:21
美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

扶苏聊历史
2026-09-12 17:43:57
亚运会乒乓球:王楚钦险翻车!决胜局15-13过关,国乒男团1-0领先,林诗栋接场!

亚运会乒乓球:王楚钦险翻车!决胜局15-13过关,国乒男团1-0领先,林诗栋接场!

刘姚尧的文字城堡
2026-09-23 19:44:50
简约半高领无袖上衣,日常居家也能勾勒柔和曲线

简约半高领无袖上衣,日常居家也能勾勒柔和曲线

只要高兴就好
2026-09-23 13:39:54
2分05秒77刷新亚洲纪录,彭旭玮200米仰泳摘金

2分05秒77刷新亚洲纪录,彭旭玮200米仰泳摘金

甜度百分百21
2026-09-22 18:21:50
杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

股侠指北针
2026-09-23 14:49:04
没结果,会谈结束,日本难掩失望,当地时间9月22日,日本首相高市早苗和特朗普的会面草草结束

没结果,会谈结束,日本难掩失望,当地时间9月22日,日本首相高市早苗和特朗普的会面草草结束

扶苏聊历史
2026-09-23 16:33:52
《街霸》春丽演员回应粗大腿"造假":没空P图!

《街霸》春丽演员回应粗大腿"造假":没空P图!

游民星空
2026-09-22 10:11:25
发现一个现象:父母有退休金的家庭,基本上都会有这几种共性!

发现一个现象:父母有退休金的家庭,基本上都会有这几种共性!

小虎新车推荐员
2026-09-23 15:25:02
孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

孙杨也没想到,自己保持了13年的记录,被18岁的张展硕打破了

观锐器
2026-09-22 13:32:20
8分3.5篮板,杨瀚森季前赛证明自己!邓顿:不会为了收视让瀚森上

8分3.5篮板,杨瀚森季前赛证明自己!邓顿:不会为了收视让瀚森上

爱尔爱电影
2026-09-23 14:45:08
加拿大籍华人求助:11岁孩子遭校方警方双重施压停课,走投无路求国人支招

加拿大籍华人求助:11岁孩子遭校方警方双重施压停课,走投无路求国人支招

小徐讲八卦
2026-09-23 07:02:16
战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

战胜心魔,唐钱婷亚运会女子100米蛙泳突破,为中国队拿回金牌

体娱一家亲
2026-09-23 17:08:01
2026-09-23 20:39:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

亲子
旅游
数码
公开课
军事航空

亲子要闻

用幼儿园洗菜池洗鞋的食堂员工,就是奴才

旅游要闻

秀我中国|层林尽染 二龙山农场尽展好风光

数码要闻

国补3299元起 Xiaomi Pad 9 Pro发布:12.5英寸高分高刷护眼屏

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版