网易首页 > 网易号 > 正文 申请入驻

速度快193倍、成本低444倍——只做“选择题”的Jev爆火出圈

0
分享至

刚刚过去的周末,一个叫Jev的模型在开发者社区迅速出圈。

它不能像ChatGPT那样陪人聊天,不能写长文,也不会一本正经地生成代码。

它的工作更像一道高频选择题:继续还是停止?通过还是拦截?这封邮件该转给谁?

看起来能力被“砍掉”不少,为什么反而火了?

因为Jev瞄准的就是一件事情:判断,在“零幻觉”的基础上做判断。


一个叫Jev的模型在开发者社区迅速出圈

Jev由ChatGPT联合创始人Diogo Almeida主导开发。他在X上写道:“参与共同发明ChatGPT之后,我一直在问自己:为什么超人级别的聊天模型没有带来AGI?”两年隐身研发后,他给出了自己的答案——一套全新的决策模型,或许比更强的聊天更有效。

根据TypeSafe官网公布的测试数据,Jev在自动化工作流任务上比现有大语言模型快193.6倍,成本低444.6倍。输入每百万Token仅需0.042美元,输出Token免费。上线后需求量一度超出预期,API短暂无法正常响应。



上线后需求量一度超出预期

目前,Jev已向所有用户开放,无需候补名单,注册即获5美元额度(约1.2亿Token)。


Jev已向所有用户开放

一个人,两件相反的事

Diogo Almeida的履历有一种内在张力。

他曾在OpenAI参与构建RLHF(基于人类反馈的强化学习)和InstructGPT,这套方法直接催生了ChatGPT。

然后他离开了,开始反思这套方法。

他在一场演讲中直接提出问题:“今天的AI已经能挑战高等数学,为什么企业还是不敢把客服决策交给它?”

他的答案是:“今天的AI非常擅长协助,但还不擅长自动化。”

协助,是人坐在屏幕前,AI帮你干活,你来检查。

自动化,是人根本不在场,AI在后台自己判断、自己执行。

Almeida把问题指向了RLHF本身。他在演讲中说:“为什么今天的大模型总需要有人在回路里?因为训练它的时候,我们字面意义上就把人塞进了那个回路里。”

RLHF让模型学会了一件事:什么样的回答,人更喜欢?

这对聊天产品是优点。但对自动化系统,却是问题所在。


创始人抛出自己的问题

Jev是什么:一个会做判断的函数

TypeSafe官网将Jev定义为:“把非结构化状态输入,输出类型化的概率决策。”

换成人话:你给它一段信息,它告诉你答案是什么,以及它有多大把握。并且不会产生一点幻觉。

它不生成文字。它只做三件事:

  • Noul:是非判断,返回一个0到1之间的概率,代表某件事为真的可能性

  • Choice:从预定义列表中选一项,最多支持255个选项,适合分类和路由

  • Score:按照设定的尺度打分,用于衡量紧迫程度、质量或风险

每次回答都附带完整的概率分布和置信度。强类型输出,不需要写JSON提示词,不需要额外解析器。



TypeSafe官网将Jev定义为:把非结构化状态输入,输出类型化的概率决策

为什么快,为什么便宜

普通大语言模型生成答案的方式是:一个Token一个Token地往外输出,每个Token都依赖上一个。

Jev的采样方式是并行的。所有输出在一次查询中同时生成。这是速度差距的根本来源。

根据TypeSafe官网数据:

  • Jev端到端响应时间:70毫秒至500毫秒

  • 现有前沿模型:3秒至329秒

  • 速度差距:40倍至200倍(System One类型任务)

价格方面:

  • Jev输入:每百万Token 0.042美元(每十亿Token 42美元)

  • 现有前沿模型输入:每百万Token 0.20美元至10美元

  • 输出Token:免费


图为漫画图

TypeSafe官网注明,193.6倍速度提升和444.6倍成本降低的数据,来自其自动化工作流评测,“预计这些数字处于实际收益的较高端”。评测由公司模型能力团队成员制作,存在一定偏差可能性。

“校准”才是真正的核心

速度和价格之外,TypeSafe强调的另一个关键词是“校准”。

现有大语言模型即使被要求给出置信度,也往往过度自信且不一致。TypeSafe官网指出:“如果一个模型能完成某项任务95%的时间,但不告诉你它什么时候处于那5%,它就无法自动化那项任务。”

为此,TypeSafe开发了新的训练方法RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。

目标是:如果模型说某件事有80%的概率,那么在它判断为80%的一批事情里,最终应该真的有大约80%发生。

这在自动化系统里直接决定了如何分配任务:

  • 置信度 > 90%:直接自动执行

  • 置信度在70%至90%之间:交给更强的大模型复核

  • 置信度 < 70%:转给人来决策

Earendil公司CTO Armin Ronacher对此解释道:“归根结底,这种方式将幻觉问题的处理责任稍微转移到了用户身上。用户需要决定:如果这种情况出现的概率只有50%,那或许可以忽略它。但如果概率达到95%,那我就可以利用它了。


图为漫画图

并行判断:一次问十个问题

Jev还有一个特点:同一次请求中的多个问题,共享一份输入,但独立并行评估。

公众号“数字生命卡兹克”做了个实测:他把一条新闻扔进去,可以同时问——是否AI相关?是否广告?是否融资?应归哪个分类?是否值得推送?

Jev一口气把这些判断全部做完,速度不变。

传统大语言模型需要逐个问题生成回答,或者把所有问题塞进一个提示词,再解析输出。

这个并行特性,在多问题场景下优势最为明显。


Jev还有一个特点:同一次请求中的多个问题,共享一份输入,但独立并行评估

开发者已经在用它做什么

Jev上线后,开发者社区迅速涌现出大量实际应用案例。

信息流过滤:开发者Marcel Pociot接入Jev做了一个浏览器插件,用于过滤X平台上不想看的内容。每条帖子的判断平均耗时380毫秒。

广告分析有人用Jev在40秒内分析724条实时广告,共做出8724次判断。

浏览器代理:Browser Use的开源项目jev-ultrafast,将Jev用作浏览器操作的判断层。以查机票为例,每一轮程序同时问多个问题:下一步点击还是输入?点哪个编号?这些问题共用同一份网页状态,分别作答。

上下文压缩:将Jev接入Claude Code,判断哪些上下文内容是关键信息,实现近乎即时的上下文压缩。

安全分类器:Vercel公司软件工程师Pranit Sharma表示,用Jev替代OpenAI的ChatGPT Luna 5.6来运行命令安全性分类器后,处理速度提高了5到18倍,准确性也大幅提升。

邮件分类:Bryo AI的CTO Nikhil Mudholkar测试了Jev和Gemini在分类商业邮件方面的表现。他的测试结果显示,Gemini准确率略高,但成本高出10到20倍。

营销分析:有团队将Jev接入营销分析流程,扫描Meta广告库、比较广告格式存活周期,把原本需要人工完成的判断提速了30倍,成本压到3美元以内。

游戏演示TypeSafe官网展示了Jev玩Doom的演示,每秒可做出约10次决策,Jev依据结构化游戏状态做出实时操作判断,每小时成本约7美元。在Ably Pong演示中,Jev在12秒内做出47次操作决策,而Gemini、Claude和GPT在同样时间里只做出两三次。



演示画面截图

“零幻觉”不等于“永远答对”

Jev官网上写着“Zero Hallucinations”,即“零幻觉”。

这句话很抓眼球,也容易被误读。

TypeSafe在技术说明中给出的含义是:Jev的输出类型和结构预先定义,因此模型不会产生类型错误,不会突然跳出指定格式、捏造一个不存在的字段,或在限定选项外随意发挥。

例如,程序只允许它在“通过、拒绝、人工复核”三个选项里选,它不会输出一首诗,也不会附带一段Markdown说明。


Jev官网上写着“Zero Hallucinations”

这解决的是自动化系统中的结构可靠性问题。

但它不等于模型不会选错。TypeSafe自己的FAQ也明确承认:Jev“仍然可能出错”。

为什么是现在爆火:Agent需要的,可能正是这些小决定

Jev的出现,正好踩中了Agent开发中的一个现实问题。

一个能操作网页、调用工具、处理文件的Agent,在完成任务前,往往要经历大量微小判断。

下一步点击哪个元素?这个工具返回的结果是否有效?上下文里哪部分已经没用?这个任务是真的完成了,还是看起来完成了?

这些判断单独看不难,但一旦进入高频工作流,成本会迅速堆积。

Jev这次爆火,至少有三个清晰原因。

第一,它的定位足够反常。

当行业持续追逐更长的推理、更强的聊天、更大的上下文时,Jev直接放弃生成文本,只解决选择、分类、打分和路由。

第二,它击中了Agent的成本问题。

如果一个系统每天要做数十万次小判断,20—200倍的速度差异、40—400倍的成本差异,即使只在部分任务上成立,也足以吸引开发者测试。

第三,它把“不确定性”做成了接口的一部分。

过去,模型总能给答案;真正让自动化系统头疼的是,模型常常不知道自己什么时候会错。

Jev给出的答案是:不只返回结论,也返回对结论的把握程度。

为什么叫Jev,为什么叫System One

TypeSafe把Jev所在的模型类别命名为“System One Models”。

名称来自丹尼尔·卡尼曼《思考,快与慢》中关于“系统1”和“系统2”的区分:前者偏快速、直觉式判断,后者偏慢速、审慎推理。

Jev显然押注前者。

TypeSafe的产品定位并不是让Jev替代所有大模型。

官方列出的适用任务包括分类、路由、打分、信息提取、工作流分支、内容审核、模型输出验证,以及在大数据上进行批量处理。

复杂推理、长文生成、写代码、创作内容,仍属于传统大语言模型更擅长的领域。

在这种分工下,Jev负责先做大量低延迟决策;当它不够确定时,再把问题交给更慢、更贵、但更适合生成与推理的大模型,或者交给人工。


页面截图

融资与开放

TypeSafe AI由Diogo Almeida与Erik Gafni、Sasha Sheng共同创办,公司隐身运营约两年。

2026年9月15日正式亮相,同步宣布完成4000万美元种子轮融资,由DCVC领投。

TypeSafe表示,目前市面上采用这一路线的公司只有他们一家。Ronacher预计,随着这种模式的实用价值逐渐被验证,跟进者会陆续出现。

被问及公司是否算前沿实验室时,Almeida说:“前沿实验室的主要产物要么是恐惧,要么是炒作,我希望我们的主要产品是智慧,我们不属于那种一门心思创造无限财富,或者搞宗教式叙事,或者试图在数据中心里造神的实验室。”

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国脑梗发病率世界第一!医生:罪魁祸首已揪出,3种蔬菜要少吃

中国脑梗发病率世界第一!医生:罪魁祸首已揪出,3种蔬菜要少吃

纸上的心语
2026-08-11 09:16:55
轮到人民币出牌了!人民币或将暴涨至5.5?黄金率先扛不住了

轮到人民币出牌了!人民币或将暴涨至5.5?黄金率先扛不住了

蜉蝣说
2026-09-21 18:12:32
晚年徐向前回忆当年危急局势坦言:西安事变若是没有发生,红军极有可能再度踏上长征之路,当年西北战局究竟凶险到何种地步?

晚年徐向前回忆当年危急局势坦言:西安事变若是没有发生,红军极有可能再度踏上长征之路,当年西北战局究竟凶险到何种地步?

唠叨说历史
2026-09-18 10:58:41
“葬爱家族出了个当官的!”浙大教授因发型走红,学校回应来了!

“葬爱家族出了个当官的!”浙大教授因发型走红,学校回应来了!

番外行
2026-09-20 19:07:52
每体:B席在皇马逐渐失去位置,近5场西甲仅1次首发

每体:B席在皇马逐渐失去位置,近5场西甲仅1次首发

懂球帝
2026-09-21 17:48:05
辽宁女子在韩国登机口发现一台遗落手机,因锁屏显示中文将它带回国内,当事人:已快递给陕西的失主,并谢绝了其500元感谢费

辽宁女子在韩国登机口发现一台遗落手机,因锁屏显示中文将它带回国内,当事人:已快递给陕西的失主,并谢绝了其500元感谢费

极目新闻
2026-09-21 18:37:19
南航旧案:男上司和女下属1000天开房410次,做丈夫都没这么勤快

南航旧案:男上司和女下属1000天开房410次,做丈夫都没这么勤快

四海神君
2026-09-21 07:00:22
深圳市委:坚决拥护党中央对覃伟中审查调查的决定

深圳市委:坚决拥护党中央对覃伟中审查调查的决定

澎湃新闻
2026-09-21 23:24:04
卖爆了?歼-10CE和“枭龙”拿下约112架大单,中国战机要火了

卖爆了?歼-10CE和“枭龙”拿下约112架大单,中国战机要火了

军武速递
2026-09-21 21:07:20
有些机关事业单位都不给退休人员发放生活补贴,更别说企业单位了

有些机关事业单位都不给退休人员发放生活补贴,更别说企业单位了

郭爱华追问教育
2026-09-21 06:12:40
大热倒灶?3名中国夺冠热门选手无缘奖牌,网友不满:大赛掉链子

大热倒灶?3名中国夺冠热门选手无缘奖牌,网友不满:大赛掉链子

罗掌柜体育
2026-09-21 09:22:48
于子迪2分06秒10有多强?历史第2快成绩,一众名将被甩在身后

于子迪2分06秒10有多强?历史第2快成绩,一众名将被甩在身后

全景体育V
2026-09-21 17:29:13
世界第一传奇超模27岁儿子去世!因金发神颜爆红却陷毒瘾深渊,最终死于戒断所!

世界第一传奇超模27岁儿子去世!因金发神颜爆红却陷毒瘾深渊,最终死于戒断所!

英国报姐
2026-09-21 23:12:04
中阿大战刷净胜球!毛伟杰回左路更凶,徐彬替补吧,老蒯+依木兰不上浪费了

中阿大战刷净胜球!毛伟杰回左路更凶,徐彬替补吧,老蒯+依木兰不上浪费了

刀锋体育
2026-09-21 08:15:57
央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

央美教授画“红领巾小孩”被骂上热搜!网友:这审美我真的看不懂

西楼知趣杂谈
2026-09-20 11:00:05
教育部同意,两所高校合并!

教育部同意,两所高校合并!

教书心
2026-09-20 07:02:48
打虎!覃伟中被查

打虎!覃伟中被查

看看新闻Knews
2026-09-21 18:21:35
“秋老虎”没走?周三最高气温升至31℃!本周北京还将迎两次降雨!

“秋老虎”没走?周三最高气温升至31℃!本周北京还将迎两次降雨!

北青网-北京青年报
2026-09-21 15:13:19
闲鱼变“黄鱼”!

闲鱼变“黄鱼”!

梳子姐
2026-09-21 17:20:28
王祖贤做客访谈节目,否认因情伤退圈,回应休息20年选择:“缘来缘去就好了”

王祖贤做客访谈节目,否认因情伤退圈,回应休息20年选择:“缘来缘去就好了”

韩小娱
2026-09-21 16:04:46
2026-09-22 00:00:49
华尔街见闻官方 incentive-icons
华尔街见闻官方
中国领先的金融商业信息提供商
152538文章数 2654773关注度
往期回顾 全部

科技要闻

吃AI红利的凡人,年薪10万美元,每天3万步

头条要闻

覃伟中被查:上月刚辞任深圳市长 曾在中石化任职21年

头条要闻

覃伟中被查:上月刚辞任深圳市长 曾在中石化任职21年

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

张佳宁穿搭宽松小腹微凸 引发怀孕猜测

财经要闻

酒鬼酒经销商半年跑了40%

汽车要闻

全系800V/红旗司南智驾 红旗天工07预售权益价16.99万起

态度原创

旅游
健康
家居
时尚
本地

旅游要闻

中国演出行业协会:2025年全国大中型旅游演艺项目票房收入超174亿元

专家提醒:癫痫发作别掐人中!

家居要闻

2026建博会(广州) 公装联探展交流活动

白月光清单|| 只要它不停产,我能爱到80岁!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

无障碍浏览 进入关怀版