网易首页 > 网易号 > 正文 申请入驻

不写字的 AI 凭什么刷屏? Jev,把「判断」做成了软件零件

0
分享至


AI 圈这几天最受关注的名字,是一个不会聊天的模型,Jev。

它不写文章、不写代码,也不陪用户聊天。有人问它「这封邮件紧急吗」,它不会先写三段分析再下结论,而是直接回答「紧急,概率 95%」。

发布才一周,创始人发布的官宣帖在 X 上的浏览量冲上数千万;主流 AI 模型网关 Vercel,上线 24 小时内就有近 13% 的付费团队接入。有人拿它打《毁灭战士》,移动、瞄准、绕障一气呵成,流畅得不像机器;有人让它和 GPT-6 Astra 在《我的世界》里用 8 分 43 秒打赢末影龙,总花销不到 1 美元,其中 Jev 只占 0.01 美元;还有开发者实测 6 个代码 PR 后推算,审 1000 个只需 7 美分,而同等工作交给 Claude Opus 5 要 14.5 美元。

一个不会聊天的模型,为什么能引来整个技术圈集体关注?

热度从哪里来

先交代出身。Jev 来自美国创业公司 TypeSafe AI。创始人 Diogo Almeida 是 OpenAI 老将,也是 InstructGPT 和 RLHF(基于人类反馈的强化学习)论文的共同作者,这两项工作正是 ChatGPT 技术路线的重要前身。2024 年他离开 OpenAI,带队隐身研发两年,直到 2026 年 9 月 15 日才正式亮相。资本早已押注,DCVC 领投了 4000 万美元种子轮。

Jev 这个名字本身也经过设计,取自 19 世纪英国经济学家威廉·杰文斯。杰文斯用「杰文斯悖论」说明一个道理:效率提升,有时反而会带来更大的总体消耗。一家 AI 公司拿一位经济学家当名字,隐隐指向它对「效率」的执念,这正是 Jev 的立身之本。

发布当天,它在 Hacker News 冲到 1800 多分、近 500 条评论;OpenRouter、Cloudflare、LangChain 等主流平台先后接入;几天之内,社区还出现了开源仿制版。

发布 36 小时,TypeSafe 收到的内测申请就涉及约 14 万名开发者;9 月 21 日 Jev 向所有人开放,每位新用户直接送 5 美元额度,约合 1.2 亿 token。按官方口径,一次判断通常只烧几百个 token,省着点够个人尝鲜几十万次。换句话说,它几乎把「决策」这件过去很贵的事,做到了接近免费,热度的含金量也在这里。

为什么一个不会说话的模型能引爆这样的热度?因为过去两年,大家可能让 AI 干了太多它不擅长的事。

看看社区都拿它干了什么。有人把它接进 Claude Code 做上下文清理,让长对话不再越聊越笨;也有人因此翻车,用不做推理的分类模型去删改 Agent 历史,模型忘掉了试过的操作、陷入循环。还有人拿它实时判断跑酷游戏里下一个平台落点、给 Agent 验收任务、在 40 秒内拆完 724 条实时广告。这些用法有个共同点,都不是要它「说」,而是要它「判」。

过去一年,Agent 概念正当红,可真正落地时大家才发现:一个 Agent 跑起来,要做的不是「想」,而是无数次「判断」,调哪个工具、留哪些上下文、这次操作有没有风险、结果要不要人工复查。这些高频判断题交给动不动就「深度思考」的大模型,既慢又贵。Jev 的走红正踩在这个节点上,在最需要的时候递上一把顺手又便宜的刀。

Jev 是什么:把「判断」做成零件

做 AI 产品的人都熟悉一个困境:系统里每天有海量琐碎判断,这封邮件算不算投诉,这笔退款该不该自动批,这条评论要不要删。

最常见的做法,是每次都请一个大模型来回答。但大模型的核心工作方式是「生成」:用户要一个「是或否」,它可能先写三段分析再给结论,按字数收费,还要等上几秒甚至几十秒,回来的文字还得让程序拆解、校验,格式不对就重来。

更麻烦的是,大模型说「我很确定」时,这句话本身不附带刻度。「很确定」到底是七成还是九成?剩下那部分不确定性落在哪个方向?无从得知。于是大量本该由机器自动完成的判断,卡在一种两难里:用大模型太贵太慢,靠写死的规则又不够灵活。

TypeSafe 把这类模型命名为「System One」,借用了诺贝尔经济学奖得主卡尼曼《思考,快与慢》里的框架:人脑有两套系统,System 1 负责不费力的直觉快判断,System 2 负责缓慢的深度推理。GPT、Claude 这些主流模型全是「System 2」路线,逐字推演、组织语言、生成答案,能力强,但慢、贵、输出不可控。

Jev 则是第一个公开的「System One」模型。它放弃文本生成,专做决策:给它一段状态,比如一份文档、一条工单、一段聊天记录,再附上几个预设好类型的问题,它一次并行返回所有答案,每个答案都带概率和置信度。

这个概念并非空穴来风,卡尼曼的理论本身就给出了依据:人脑在做大量琐碎决策时,靠的正是那个不费力的系统一;只有在真正复杂的问题上,才启动缓慢的系统二。TypeSafe 想做的,就是给软件也装一个「系统一」,让高频、明确、低风险的判断变得又快又便宜,把宝贵的「系统二」留给真正需要深度推理的任务。


人脑的快慢思考,如何变成 AI 的两种路线

工作流程大致五步:先描述决策需求,系统生成问题集供用户挑选;再从历史标注数据里选样本喂给它,优化判断逻辑;最终对每个输入返回「决策结果+置信概率」,用户可以设阈值,低于阈值的转人工或交回大模型。要提醒一句:Jev 本身无状态,不记忆历史;所谓「复用」要靠外部配置层,把高置信度的判断模式沉淀下来反复调用。

输出形式只有三种,全是「强类型」:Choice(从选项里选一个)、Score(在刻度上打分)、Noul(判断一件事成立与否,返回 0 到 1 的概率)。它不可能输出类型之外的东西,也就从结构上杜绝了生成式模型那种「幻觉」:它不会编造一篇不存在的文章,最多只是选错一个选项。


Jev 只输出三种「强类型」结果:Choice、Score、Noul


Jev 的工作流程:把「判断」做成软件可直接使用的零件

快 20–200 倍、省 40–400 倍:一次分工的胜利

按 TypeSafe 官方数据:端到端响应时间 70 到 500 毫秒,传统大模型要 3 秒到 300 多秒,快 20 到 200 倍;每百万输入 token 只要 0.042 美元,输出免费,成本低 40 到 400 倍。这一设计带来的数字相当夸张。但这两个区间的上限,是厂商在自家工作流里跑出的最乐观值,独立实测通常达不到那么多倍。一次请求还能并行回答多个判断问题,问题多了延迟也基本不变。


同一个判断,两种响应速度

这里不妨打个比方。过去请 AI 做事,像请一位作家替人写报告,他文采飞扬,可用户要的只是一个「是或否」,他还得先洋洋洒洒写八百字。Jev 则像请了一位裁判,什么都不写,只在摆好的选项里果断亮分。同样是做判断,前者的强项在表达,后者的强项在决策。而软件后端九成以上的调用,需要的恰恰是后者。

TypeSafe 反复强调的一个词是「校准」,训练方法叫 RLCD(面向校准决策的强化学习)。这里要打个折扣:让「模型说有 95% 把握的答案,在真实世界里大约 95% 是对的」,是 RLCD 的设计目标,并不是已经拿到验证的结论,官方目前还没公布可靠性图或 ECE(期望校准误差)数据。而且官方文档自己说明,「把握」衡量的是各选项之间的相对偏好,不等于答案的绝对正确率。

TypeSafe 自评的四项业务工作流里,Jev 准确率 67.8%,最强的基线模型是 74.1%;OpenRouter 用 3080 条真实客服语料(Banking77)实测,Jev 是 81.0%,Claude Opus 5 是 84.4%。也就是说,它并不「更准」,只是把速度和成本压了下来。准确率恰恰是最需要冷静看待的一项,这也是为什么高置信度要设阈值转人工,在把判断交给它之前,最好先用自己的数据测一测。

另外提醒中文读者:Jev 对中文的支持目前弱于英文,官方文档明确标注 CJK 语言「可用但准确率不等同英文」,中文场景建议先用自有材料测过再决定。这个服务目前在中国大陆还无法直接使用,官方并没有公布地区限制名单,主要是服务节点集中在美国西海岸、尚未覆盖亚太,想用的中文开发者得先想想接入渠道。

置信概率的意义:一条输入,两条路径

这引出 Jev 真正的用法:完全信任模型,要担出错风险;完全人工审核,又效率低下。现在可以按业务容错率设一个阈值:高置信度直接自动化执行,低置信度转人工或升级到大模型,既提升自动化比例,又守住风险底线。

用一位开发者的比喻:以前的 LLM 像是返回一个自由格式的字符串,得自己写正则、解析、异常处理、重试;Jev 像是直接返回一个强类型对象,字段类型确定、值域确定,连置信度都算好了。

至于「快而可靠」里的「可靠」,实际测试要打个问号。有媒体拿 190 次财报任务实测:第一轮 45 次全对,是因为增长率事先算好喂给了它,那一串「满格把握」说明不了什么;一旦把正确选项从列表里拿掉,Jev 会把八成以上的置信度押在与事实矛盾的描述上,毛利率题连错 10 次时,报出的把握也都在八成以上。它真正的卖点是便宜,而不是这份「把握」。

当然,官方也坦承,并非所有任务都能获得同等提升,这些数字是基于自有业务自动化工作流跑出来的。横向看,Jev 单次请求能并行处理多个判断问题,数量增加而延迟基本不变,这让它特别适合嵌入现有软件:代码继续控制业务流程,Jev 只负责其中一个范围明确的判断,像是给程序加了一个只管判断的专职模块。

JEV 与传统大语言模型(LLM)在响应速度与调用成本上的对比(对数刻度)

哪里该用,哪里别碰

Jev 擅长的高频固定判断,恰恰是 Agent 落地时最拖后腿的部分。在一个真正的 Agent 里,它至少能顶三个位置。

  • 模型路由:判断这次请求该调用哪个大模型,还是根本不用调用、直接走预设逻辑,能省下大把 token 钱。
  • 工具调用门槛:判断该不该调工具、调哪个工具,不必每次都让大模型做选择,响应快得多。
  • 验证与监督:对大模型生成的结果做校验,看是否符合要求、有没有风险,不必把输出再喂给大模型审一遍。


Jev 在 Agent 里顶的三个位置

落到具体业务上,客服工单分类、用户意图识别、内容合规校验、商品打标、实时风控、查询路由到知识库,凡是「从几个明确选项里做决定」的活,都是它的主场。

但边界同样清晰:如果要的是写文案、生成摘要、创作故事、开放域问答这类「生成非固定结果」的场景,Jev 帮不上忙,还得回到大模型。如果决策逻辑极其复杂、选项没有固定边界、或者样本少得连判断依据都没有,也别硬用。它只支持文本输入,选择字段的候选上限是 255(官方文档),评测也主要基于自有业务工作流,而非 MMLU 等公开基准。

一句话:它是一把精密的扳手,不是瑞士军刀。放对位置,它是利器;放错位置,就成了隐患。

更现实的用法,是把它当 Agent 架构里的一层。过去一个 Agent 跑起来,判断一次调一次 LLM,路由一次调一次,验证一次再调一次,延迟、成本和不确定性层层叠加。把高频判断拆给 Jev 后,架构就变成「规则+决策模型+LLM+工具」的多层协同:LLM 继续负责复杂推理,Jev 负责那些又小又急的判断题。这种拆法,可能是它在工程上最值钱的地方。

热闹背后的真问题

围绕 Jev 的争议不少,Redis 之父 antirez 就公开泼冷水:Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰恰说明 AI 泡沫里的大多数人分不清什么重要、什么不重要。这种质疑不无道理,Jev 并没有抬高 AI 的能力上限,它只是把「判断」这件小事做得又快又便宜。

也有人直接说它「不就是个 JSON 分类器吗」。但大模型研究工程师 Sebastian Raschka 提醒别低估它:传统分类器训练完标签就固定了,场景一变就要重训;Jev 能在运行时接收自然语言标签,结合上下文对动态选项做判断,泛化能力完全不同。2026 年 9 月 20 日,谷歌 Gemma 官方账号发了条「DiffusionGemma as Jev」,把自家的扩散模型适配成 Jev 式决策接口,风向的变化比争吵更说明问题。

技术之外,Jev 真正触及的,是行业一个长久的困惑:为什么模型已经这么能聊,大规模自动化却没有随之而来?TypeSafe 的答案是,聊天形态的模型,天生不是软件该依赖的接口。软件需要的不是一篇篇「文章」,而是一个个确定、可靠、能插进控制流的判断。把「判断」单独拆成一层,让大模型专注复杂推理,这可能是 Agent 架构下一轮演进的起点。

质疑者担心的是热度跑在能力前面;支持者看重的是它把「判断」做成了一种可复用的基础能力。两者其实并不矛盾,分野恐怕要等 Agent 真正大规模落地后才有答案。对普通读者而言,比起记住这些数字,更值得留意的是这个信号:当判断开始按件计价、按毫秒交付,软件自动化的门槛,正在被一点点磨低。

(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 焦燕)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
董卿中秋诗会被临时取消,主办方说“舆论不好”:当初用她名字宣传时怎么不说

董卿中秋诗会被临时取消,主办方说“舆论不好”:当初用她名字宣传时怎么不说

师维
2026-09-25 22:51:34
玩命偷渡!中国男子花6万美元把自己塞进备胎,入境美国时被警犬发现

玩命偷渡!中国男子花6万美元把自己塞进备胎,入境美国时被警犬发现

大洛杉矶LA
2026-09-25 02:22:35
搞笑经典俄罗斯冷笑话,刚跟一个从俄罗斯留学回来的朋友聊天,我说我想去俄罗斯旅游!

搞笑经典俄罗斯冷笑话,刚跟一个从俄罗斯留学回来的朋友聊天,我说我想去俄罗斯旅游!

天天明星
2026-09-24 13:25:03
外媒聚焦华盛顿欢迎仪式连用“罕见”:“美方的安排与以往我所见过的都截然不同!”

外媒聚焦华盛顿欢迎仪式连用“罕见”:“美方的安排与以往我所见过的都截然不同!”

海外网
2026-09-25 07:11:04
4-0,3-0!亚运男足四强诞生两队,韩国零封,沙特和越南惨败回家

4-0,3-0!亚运男足四强诞生两队,韩国零封,沙特和越南惨败回家

显微镜下的人性
2026-09-26 01:46:24
中国国家领导人访美 这四个细节足以看懂分量!

中国国家领导人访美 这四个细节足以看懂分量!

看看新闻Knews
2026-09-25 01:25:04
日本正被中美“联手”推向深渊

日本正被中美“联手”推向深渊

孝沛与世界
2026-09-22 02:08:33
国务院发话!国家体育总局再出击!没提樊振东,却句句在“撑腰”

国务院发话!国家体育总局再出击!没提樊振东,却句句在“撑腰”

瓜农娟姐
2026-08-03 16:32:43
中秋夜,蓝月蒙尘:曼城115项指控114项成立,英超足球史上最大财务审判落锤

中秋夜,蓝月蒙尘:曼城115项指控114项成立,英超足球史上最大财务审判落锤

智道足球
2026-09-26 06:48:01
港股为何爆量跳空破位下跌?

港股为何爆量跳空破位下跌?

风风顺
2026-09-26 02:05:05
再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

再也瞒不下去了!德国专家曾指出,中美之所以尚未爆发冲突,不是因为美国没本事,而是美国可能已经察觉到了形势的严峻

z千年历史老号
2026-09-14 17:23:40
保密期限已至,中央首长宣布:毛岸英的真相,已经可以公布了!

保密期限已至,中央首长宣布:毛岸英的真相,已经可以公布了!

磊子讲史
2025-03-26 17:04:06
中秋利好,欧美大涨

中秋利好,欧美大涨

中国基金报
2026-09-25 16:42:37
河南焦作一饭店老板心疼员工上班骑电动车,奖励优秀员工每人一辆宝马车,老板:门店发展离不开全体员工的付出,店是大家一起撑起来的

河南焦作一饭店老板心疼员工上班骑电动车,奖励优秀员工每人一辆宝马车,老板:门店发展离不开全体员工的付出,店是大家一起撑起来的

大风新闻
2026-09-25 17:40:05
Shams:出于精简阵容考虑,灰熊已经裁掉了拉塞尔

Shams:出于精简阵容考虑,灰熊已经裁掉了拉塞尔

懂球帝
2026-09-26 02:18:32
又美又飒!17岁陈妤颉高举五星红旗:黑人也追不上她 连破2个纪录

又美又飒!17岁陈妤颉高举五星红旗:黑人也追不上她 连破2个纪录

风过乡
2026-09-25 21:56:03
黄芪有个“好搭档”!连喝三天,补气通络,浑身都有劲!

黄芪有个“好搭档”!连喝三天,补气通络,浑身都有劲!

新时代的两性情感
2026-09-25 01:01:22
“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

“我占了天大便宜还没人能拿我怎么样!”产假复工第一天辞职,薅尽公司羊毛,还发视频得意狂笑

蝴蝶花雨话教育
2026-09-24 00:05:17
尴尬了!丈夫吐槽妻子几万月子中心不好好吃饭,天天点外卖,网友吵翻:没得公主的命,却得了公主的病

尴尬了!丈夫吐槽妻子几万月子中心不好好吃饭,天天点外卖,网友吵翻:没得公主的命,却得了公主的病

火山詩话
2026-09-24 06:51:49
军训刚结束,安徽一考生从重庆商大退学,本人回应:亏30分8000名,早知道报考警校了

军训刚结束,安徽一考生从重庆商大退学,本人回应:亏30分8000名,早知道报考警校了

育学笔谈
2026-09-25 22:10:18
2026-09-26 07:04:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139898文章数 862649关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

特朗普:这次访问富有成效

头条要闻

特朗普:这次访问富有成效

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

好甜!井柏然刘雯结伴看李荣浩演唱会

财经要闻

月饼卖不动了...

汽车要闻

小鹏G9L VS 保时捷卡宴,同场实测讲解

态度原创

教育
亲子
艺术
时尚
数码

教育要闻

姚洋:孩子上职高不可怕,怕的是几年下来没学到真本事

亲子要闻

周口广电小主持人“原来月亮有这么多名字”

艺术要闻

看完瞬间清醒!尼采一句话,治好了我的精神内耗!

怎么度过这个夜晚,才算不辜负这轮明月?

数码要闻

苹果单核封神却遭偷家!玄戒O3多核狂屠全场,高通这次真挤牙膏了?

无障碍浏览 进入关怀版