自从 ChatGPT 出现,很多人对 AI 的印象就固定在了一个输入框里:你问,它答。
写文章、改代码、解释问题,这种方式很好用。可软件里的许多任务,根本不需要一篇回答。
一封邮件是否紧急?工单该分给谁?下一步要不要转人工?
程序需要的往往只是一个选项或分数。让通用模型反复处理这些小判断,等待时间和费用就会累积。
开发者已经在用结构化输出、小模型和固定规则解决这些问题。TypeSafe AI 提出了另一种尝试:把模型专门训练成一个做判断的工具。
它叫 Jev,不会写文章,也不陪你聊天。
01 实际效果怎么样?
先看它处理这些小判断的速度。
官方把同一组 27 个业务问题交给了 Jev 和 GPT-5.6 Terra。
界面记录的完成时间分别是 0.114 秒和 8.566 秒,费用分别为 0.000081 美元和 0.013880 美元。
这一次演示中,Jev 约快 75 倍,成本约为对方的 1/171。
![]()
▲ 视频:同一组 27 个问题的官方对照演示,原速节选;倍率仅对应本次演示。
外部测试也显示了类似取舍。
Every 用 12 段合成文字测试写作问题识别,Jev 比高推理设置的 Claude Fable 5.1 快约 25 倍,估算成本约为其 1/580;但 7 个预设问题只找到了 6 个,对方则全部找到。
样本很小,速度优势和漏检都值得保留。
当判断需要连续发生时,响应速度就更重要了。官方用 Doom 和维基百科跳转演示了这种用途:其中 Doom 输入的是整理后的文字状态,并非直接看画面。
![]()
▲ 视频:Jev 参与 Doom 实时控制的官方演示,原速节选。
不过,响应快还得看判断准不准。官方的成本—准确率图把两者放在一起:越靠左越便宜,越靠上准确率越高。Jev 位于最左侧,但准确率并非最高。
这里比较的是 4 个自建工作流的平均结果,参考答案来自其他强模型的预测,不能当成通用能力排名。
![]()
▲ 图:官方 4 个工作流评测。横轴为单次工作流成本,采用对数刻度;纵轴为该评测口径下的准确率。Jev 成本最低,准确率并非最高。
02 Jev 是什么,能做什么?
这些演示有个共同点:每一步都只需要一个判断结果。
TypeSafe AI 把专门处理这类任务的 Jev 称为决策模型。
创始人 Diogo Almeida 在 OpenAI 参与了 RLHF(基于人类反馈的强化学习)和 InstructGPT 的基础研究,研究如何让模型更好地遵循人的指令。
他是 InstructGPT 论文作者之一,也参与了 GPT-4 的指令遵循和 API 评测。
在 Jev 里,这类判断被做成了三种基本能力:从给定选项中选择(Choice)、按标准打分(Score),以及对一个陈述返回 0 到 1 的判断值(Noul)。
多个问题可以同时评估,结果直接交给软件使用。
官方文档举了一个例子:客户说 Stripe 账户连接失败已经三天,正在影响销售。
Jev 可以同时判断该分给哪个部门、客户有多不满、事情是否紧急。
程序拿到结果后,按规则分派工单;如果需要写回复,再交给能生成文字的模型。
安全告警、内容检查、邮件筛选,也可以这样拆成一连串小判断。下面这张官方示意图里,Jev 负责判断,代码负责把结果接到关闭、排队、通知等动作上。
![]()
▲ 图:TypeSafe 官方示例,多个 Jev 判断与普通代码组合成安全告警处理流程。
03 它和 ChatGPT 的区别在哪?
分派工单、筛选内容,聊天模型也能做。要看 Jev 的不同,得比较底层模型的输出方式:ChatGPT 是完整的助手产品,Jev 则是供软件调用的模型。
对比项
聊天模型
Jev
输出
文字、代码,也能输出结构化结果
预设选项、分数和概率
适合任务
写作、解释、开放式问答
分类、评分、流程中的小判断
使用方式
对话或通过 API 调用
作为判断环节接入软件
Jev 不生成自由文本,也不会展开解释为什么选了这个答案。
所以,区别不在于“能不能返回 JSON”,而在于专门做判断后,能否更快、更便宜,同时保持足够的准确率。
它还有一个明确的边界:选项只有 A、B、C,就不会凭空输出 D。但它仍可能把本该选 A 的题选成 B。
官方所说的类型安全,保证的是输出符合结构,不能理解成“零判断错误”。
TypeSafe 还强调概率校准:大量被赋予 80% 概率的事件,实际发生比例应接近 80%。
这是训练目标;返回一个精确到小数的数字,本身并不能证明判断可靠。是否适合自己的任务,还得拿实际材料检验。
04 我们怎么用?收费吗?
现在 Jev 仍处于 Early Access,官网有候补名单入口,也提供 Playground 和 API 接入文档。
Playground 需要登录,新账号是否立即获得权限,本文尚未验证。
拿到权限后,就可以先在 Playground 里输入一段业务材料,设定要判断的问题和选项;确认效果后,再通过 API 或 SDK 接进自己的软件。
比如内容团队可以先准备一批人工标注过的中文稿,让它检查“这段是否重复前文且没有新增信息”。
先看漏检和误报,再决定哪些结果自动处理、哪些交给编辑复核。问题越具体,越容易检验它到底有没有用。
官方当前标价是每百万输入 Token 0.042 美元,输出不收费。它是收费服务,“输出免费”也不代表整个请求免费。
05 最后
这样的价格,在任务反复发生时才更有吸引力。Jev 值得关注的用处也在这里:频繁地分流、检查,或选择下一步动作。
如果它能在自己的业务数据上保持可接受的错误率,速度和成本优势才会真正兑现。
对多数人来说,聊天模型仍然更通用。
但很显然聊天不是唯一的场景,很多行业内部的流程、系统、软件每天都有无数次的各种判断。
Jev 的机会,或许就在那里。
关注 AI范儿,一起看 AI 新工具能解决哪些实际问题。
06 参考资料
1. TypeSafe 官方发布说明与评测条件
https://typesafe.ai/blog/introducing-system-one-models-and-jev
2. Every 实测
https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds
3. OpenAI GPT-4 贡献名单
https://openai.com/contributions/gpt-4/
4. API 接入文档
https://docs.typesafe.ai/introduction/quickstart
5. TypeSafe 官网与价格
https://typesafe.ai/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.