网易首页 > 网易号 > 正文 申请入驻

深度解读:关于 Jev 的几大疑问

0
分享至


刷屏全网的 Jev,是 AI 革命,还是营销噱头?

作者丨高允毅

编辑丨岑 峰

这几天,全网都被 Jev 刷屏。

说它是这周最火的大模型,一点也不夸张。推特上诸多大佬用它打马里奥,过滤垃圾信息,炒币,称它为“Agent时代的系统1”;也有人说这就是一个 JSON 分类器,值得吹?

有人说它比 DeepSeek 还快,做同一个任务,28 秒 Jev 已经刷完 428 条数据,完成打标签和分类,DeepSeek V4.1-Flash 才做到第 6 条。

有人已经开始思考,这种判断速度放进自动驾驶场景,能不能更上一层楼。还有人在实测中,摸到了它的使用边界。

可能是天下苦 LLM “慢思考”久矣,让 Jev 的“快思考”在这个节点火爆全球——Jev的技术路线,与苦苦钻研o1这种“慢思考”、能写长篇大论的深度推理模型可谓“反其道而行之”,只做一件事:决策判断。这就好比,大家都在培养一个全能作家,TypeSafe AI偏偏弄了一个只能打分的裁判。

这到底是什么?吹的成分大,还是今年的最大创新路线?目前众说纷纭。

我们综合了官网技术报告和业界的深度解读,把它摊开来看。

01


Jev 是什么?来自官网的解释

Jev 是 ChatGPT 早期核心贡献者之一 、RLHF 之父 Diogo Almeida 创立 TypeSafe AI后,闭关两年的开山之作。它与以往的模型很不同的点是,它不生成文本


它接收非结构化输入或问题,返回带类型的概率决策,代码可直接依据结果执行动作。简单理解,这是一个“自动判断器”,你给它输入一些内容,它还你一个“决策结果”。

它只做三件事,bool、choice、score,bool 是 yes 或者 no 判断,choice 是做选择,score 是打分。

所以,Jev 最大的特点就是“极速”与“极省”。官网介绍,它比普通 LLM 快 20-200 倍,成本低近两个数量级,输出 Token 免费。

这种快,来自于新的模型架构、并行采样器以及一种全新训练方法“校准决策强化学习(RLCD) ”。其中,最值得注意的,他现在选择 RLCD,是出于对他当年创造的 RLHF 的反思。

当年, GPT-3 还只会文字接龙,RLHF 就是基于人类的反馈诞生的强化学习,它让 AI 的表达与人类偏好对齐,从而催生了 ChatGPT。

但随着 RLHF 被大规模使用,人们发现大模型开始为了讨好人类瞎回答,尤其是面对那些人类都无法理解、无法打分的复杂问题时,RLHF 会“不懂装懂”。

于是,可验证奖励的强化学习(RLVR ) 诞生了,它基于客观的编译器或数学验算程序的反馈,对就是对,错就是错,直接开启了 OpenAI o1/o3、DeepSeek-R1 为代表的“大模型深度推理时代”。

但为了追求“正确”,模型的深度思考,让生成答案变得非常慢、极其消耗算力。但在海量的企业自动化业务中,“毫秒级响应且高准确度”才是真实痛点。

于是, RLCD 诞生了。Diogo Almeida 认为让大模型盲目堆规模和长篇大论打草稿,并不适合高频的工业级决策。RLCD 要做的,就是逼机器输出“认知内的概率答案”,有几成把握说几成把握,绝不瞎编。所以,Diogo Almeida表示,在这种训练模式下,Jev不会有幻觉。

RLCD 不再是传统 LLM 一个字一个字往外蹦生成模式,通过“并行采样”,在机器内部同时看一堆选项,并在 70ms-500ms内输出结构化的最终决策。同时,在 System One 这类封闭决策任务上,它可以取得和 GPT-5.6 Terra 相当的表现。


这种特质导致 Jev 很适合那些需要高频、实时、结论明确的场景,比如医院分诊台,快递分拣中心,处理海量数据,以及各种打分系统等。

作为 TypeSafe AI 旗下 System One 模型体系的首款公开产品,Jev 的出现,本质上是 Diogo Almeida 对 “快思考” 类商业化需求前景的押注:当智能决策的成本下降两个数量级,将会解锁海量自动化场景。

02


这是一个 JSON 分类器吗?

关于 Jev 是否是个“分类器”,已经没有异议。争议在于,这算不算创新。

知乎 AI 领域答主赵泠下了一个定义,这不是下一代 AI 新模型,它本质是 smarter 的 if-else 。

所谓 if-else 就是“条件判断逻辑”,非 A 即 B,在传统程序里,它是确定的唯一的。但大模型是用概率分布来模拟人类的条件反射,其中的 if-else 更像是 “最优概率路径” 。

这就注定了 Jev 与 LLM 完全不在同一个维度上,它的能力边界从一开始就被严格框死,不具备自由文本生成能力,也无法解决任何开放性问题。

它的用处,是当好大模型的专用“智能决策网关”。大模型负责理解自然语言、做复杂推理,Jev 负责后续的路由、审核、风险评分、格式校验这类判断子任务。

再加上它仅有 32k 的上下文窗口,进一步坐实它的定位,就是让系统里的判断环节更灵活、更便宜。

至于 Jev 所谓的“无幻觉”,赵泠认为这是典型的营销话术,本质是重新定义了"幻觉"这个词。

我们通常说的大模型幻觉,是事实错误,而 Jev 的无幻觉,是基于它不会输出定义之外的内容,这是“格式正确”,并不意味着它不会产生另一种幻觉,即“判断错误”。

在输出结果上,Jev 确实“极快”“极省”,这是放弃通用生成能力、只做判断,换来的“速度与成本”,与其说技术创新,更像是选择了一条更加狭窄的技术路径。所以,当有人用 2 小时,基于 Qwen-2.5-1B 模型复刻出类似的产品时,有人嘲笑这件事没有任何技术护城河。

赵泠点出,这种快和便宜,是以牺牲准确率为代价的。在同样的判断任务上,Jev 的准确率其实不如当代前沿大模型直接输出结果。它的核心竞争力从来不是"更准",而是"更快、更便宜、够用就行"。它证明了,把判别模型走到极致,在Agent时代或许具有不可替代的价值。

Jev 不是没用,只是从工程角度而言,没吹的那么神。

03


这种快速的判断可靠吗?

也有人在实测后提出,这不是一个单纯的 smarter 的 if-else ,它的本质还是基于 Transformer 模型调教的。

小马智行的架构师程墨,看到 Jev 后,马上联想到 L4 自动驾驶的决策大部分是 Code,核心就是 if-else,那 Jev 会做紧急判断吗?

他设立一个经典场景,在两车道上,一辆车以200迈的速度狂奔,而在左边车道100英尺处有一只狗,右边车道100英尺处有一位女士,该怎么做。

他给出的选项是走左车道,走右车道,急刹车,缓刹车,还有走中间,从狗和女士中间穿过去。

在此之前,他已经给 Jev 设定了什么是“良好驾驶行为”,并且规定三个条件,安全为主,不要违反交通规则,尽快到达目的地。

不到一秒,Jev 给出了答案:“急刹车”。

程墨随后又把规则改成"优先到达,其次交规,最后才是安全"。一个明显的变化是,Jev依然选择急刹,只是概率从 94% 骤降到 77%。



于是,程墨干脆设定 Jev 不要管安全和交通规则,越快越好。出乎意料的是,Jev 依然选择“急刹”,而且概率回升到 80%。

这说明 Jev 有一套自己的“默认规则”,这些规则会优先于用户给它的指令。它更像一个基于 Transformer 的大模型:先理解所有规则,再自己做出最终选择。所以,它依然拥有大模型的种种缺陷,不会“指哪打哪”。

Monad 团队的开发者 Jarrod Watts 把 Jev 用在了币圈,结果翻了车。

他本来想用 Monad 区块链实时抓取 Kuru 交易所 MON-USDC 交易对的盘口数据,看挂出来的买入价和卖出价。然后把这些实时数据喂给 Jev,让 Jev 判断下一步价格是涨还是跌,程序再根据判断自动挂限价单,低买高卖赚差价。

这本来是想全网秀一把“如何稳定赚做市差价”,不料策略连续运行后,在杠杆的放大效应下,账户出现巨大回撤。

这件事的错误点就在于,他把交易策略简化成了一道“涨还是跌”的判断题。在充斥着诱空诱多、假盘口、对抗性挂单的真实市场里,Jev 却只能做简单判断,而所谓的“最优概率路径”被市场主力的假动作反复带偏,连续给出错误的买卖决策。

越是把 Jev 往 “全权决策” 的位置上放,速度反而成了亏钱的放大器。

04


为什么偏偏是Jev火了?

Jev爆火的原因,是因为它精准击中了AI开发者的三大痛点:太慢、太贵、太不可控

随着各路开发者陆续上手实测,Jev 的使用边界也越来越清晰起来。

Browser Use 创始人曾对 Jev 进行过一次长程浏览器交互测试,结果 20 道题, Jev 只做对了 1 题。

还有人尝试用 Jev 重写 Pi Agent 的部分模块,最后发现,核心环节根本无法被替代,Jev 只能去处理一些数据分类、文本压缩等边界清晰的子任务。

可以说,Jev 在复杂的开放任务中行不通。它的正确打开方式,是有限解空间 + 高实时要求 + 结构化输出。只要任务被严格限定在封闭边界内,它就能将低延迟和极低成本的优势发挥到极致。

比如,Computer Use 场景中,它能根据有限集合快速做出“点击”或“滚动”的动作映射。游戏里的 NPC AI、机器人的运动控制、自动驾驶的紧急避险层,可以实时响应。

在量化交易、社交 App 风控审核、设备监控、工单分流等高频场景中,它能替代臃肿的传统代码。

甚至在复杂的 Agent 系统里,我们也可以把工具调用的结果校验、输出内容的风险检测、流程分支的路由判断等封闭子任务全权剥离给 Jev,从而把昂贵的大模型算力解放出来,让其专注处理最核心的深层推理。

与之相对的,它的短板体现在,Jev 无法编写文本,没有复杂推理能力,中文泛化表现不佳,无法独立进行复杂的工具调用,在真实、动态复杂网络环境, Jev 容易误判。

某种程度上,Jev 的出现,是 AI 行业在经历了几年的 “通用大模型军备竞赛” 之后,开始往 “分工细化” 的方向走了。它把 “快速结构化判断” 这件事做到了极致,这才是用好它的核心。

Jev的爆火撕开了大模型“生成为王”的假象。它告诉我们:在很多实际业务场景中,我们需要的也许是一个又快又准的“裁判”,而不是一个滔滔不绝的“作家”。

https://typesafe.ai/blog/introducing-system-one-models-and-jev

https://www.zhihu.com/question/2083549123160925836

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
克洛普首训穿未发售新版猎鹰,面带笑容开展训练课

克洛普首训穿未发售新版猎鹰,面带笑容开展训练课

懂球帝
2026-09-23 15:04:07
2026事业单位档案倒查来了,这次彻底动真格!

2026事业单位档案倒查来了,这次彻底动真格!

职场资深秘书
2026-09-23 12:16:29
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
立秋后,养肺就是在保命!肺最喜欢的 4 件事,你一定要记牢

立秋后,养肺就是在保命!肺最喜欢的 4 件事,你一定要记牢

山西圈儿
2026-09-21 15:38:38
岛内风向已变!大陆接到消息,郑丽文有100%的把握,踹走民进党

岛内风向已变!大陆接到消息,郑丽文有100%的把握,踹走民进党

叮当当科技
2026-09-23 02:19:16
小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

荒野老五
2026-09-23 12:39:41
裙子下面不一定要配运动鞋,像蒋欣、宋佳、朱珠这样穿,美得优雅高级

裙子下面不一定要配运动鞋,像蒋欣、宋佳、朱珠这样穿,美得优雅高级

全球时尚
2026-09-23 22:11:37
用户点外卖定位出错索性将餐送给小哥,小哥私信一段话感动全网,网友热议:AI无法写出的真情实感

用户点外卖定位出错索性将餐送给小哥,小哥私信一段话感动全网,网友热议:AI无法写出的真情实感

扬子晚报
2026-09-23 13:10:20
8月新增新冠确诊77.1万例,死亡6例

8月新增新冠确诊77.1万例,死亡6例

华医网
2026-09-23 15:29:46
信访新规划硬杠:越级上访就问责,可如果基层不受理,去哪说理去

信访新规划硬杠:越级上访就问责,可如果基层不受理,去哪说理去

职场资深秘书
2026-09-23 16:47:12
A股:今天跌到3936了,提前准备好,明天周四很可能这样走

A股:今天跌到3936了,提前准备好,明天周四很可能这样走

明心
2026-09-23 15:14:06
向太聊张智霖儿子不肯上大学:养孩子像开盲盒,相比砸钱鸡娃,培养孩子兜底能力更关键

向太聊张智霖儿子不肯上大学:养孩子像开盲盒,相比砸钱鸡娃,培养孩子兜底能力更关键

韩小娱
2026-09-23 08:22:33
75年我知青下乡,结果遭遇大队会计处处刁难,父亲平反后他害怕了

75年我知青下乡,结果遭遇大队会计处处刁难,父亲平反后他害怕了

白云故事
2025-04-03 08:50:13
损失惨重!乌军扫荡哈尔科夫,俄损失30万部队,能源命脉被拿捏

损失惨重!乌军扫荡哈尔科夫,俄损失30万部队,能源命脉被拿捏

军情观察家
2026-09-22 13:07:27
菲弹劾法庭修改计票规则 副总统莎拉定罪门槛下调

菲弹劾法庭修改计票规则 副总统莎拉定罪门槛下调

海外网
2026-09-23 19:55:01
这3种手术千万别乱做!医生提醒:后遗症缠身时,后悔都晚了

这3种手术千万别乱做!医生提醒:后遗症缠身时,后悔都晚了

侯医生谈健康
2026-09-07 06:50:12
笑死,可惜父母没接住这泼天的富贵,网友:差点就过上好日子了!

笑死,可惜父母没接住这泼天的富贵,网友:差点就过上好日子了!

夜深爱杂谈
2026-09-22 09:12:14
背后有高人指点?胡塞给300名俘虏开大会,全放回家还发路费?

背后有高人指点?胡塞给300名俘虏开大会,全放回家还发路费?

军武次位面
2026-09-22 19:03:25
王楚钦也没想到,身居高位的王励勤,竟成林诗栋赢球的“大克星”

王楚钦也没想到,身居高位的王励勤,竟成林诗栋赢球的“大克星”

云景侃记
2026-09-23 22:28:25
2026-09-23 23:16:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

男子遭前女友亲友殴打反抗被压制致死 被告人获刑8年

头条要闻

男子遭前女友亲友殴打反抗被压制致死 被告人获刑8年

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

14.79万元-18.79万元 别克至境E7全系标配44项舒享配置

态度原创

本地
数码
亲子
艺术
公开课

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

数码要闻

雷蛇推出Mako灰鲭鲨音箱系统:2.1配置,到手价1199元

亲子要闻

查出唇腭裂要记住 3要3不要

艺术要闻

23幅 Zalkar Tenirberdiev风景油画选(二)

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版