作者:朱雪莹
这两天,AI 模型 Jev 在开发者圈迅速刷屏。它的特别之处不在于能聊天,也不在于会写代码,而是把能力收缩到一件事上:做判断。
和 ChatGPT 这类通用大模型不同,Jev 不负责生成大段答案,也不以对话体验为卖点。PANews 文中提到,正是这样一个看起来像是「被砍掉一大半能力」的模型,反而突然火了起来。
目前,开发者已经把 Jev 用在多个具体场景里。有人用它在 40 秒内分析 724 条实时广告,总共做出 8724 次判断;有人把它接入 Claude Code,专门清理无用上下文;也有人让它给 AI Agent 当「裁判」,检查任务是否真的完成。LangChain 也已经开始测试 Jev 作为 Agent 评估器的表现。
速度和价格,是 Jev 这次出圈的另一层原因。根据 TypeSafe 公布的测试,Jev 最高可提速约 193.6 倍,成本最多降低 444.6 倍。其输入价格为每百万 Token 0.042 美元,输出 Token 免费。
文章认为,一个能力看起来更少的 AI 之所以受到关注,原因在于 Agent 时代对模型的需求正在变化。真正高频发生的,未必是复杂推理,而可能是大量、快速、便宜的判断:下一步做什么、调用哪个工具、任务是否完成。这类判断未来还需要由 AI 在后台自行完成,而不是持续依赖人盯着屏幕。
从 RLHF 走出来的人,开始反思 RLHF
Jev 模型创始人 Diogo Almeida 的经历,是理解这款模型的重要背景。根据 PANews,Almeida 曾在 OpenAI 工作,参与过 GPT-4、ChatGPT 以及 InstructGPT/RLHF 相关工作,也就是参与构建了当前大模型最重要的一套后训练范式。
不过,在一个多月前的一场演讲中,他把问题直接抛向 RLHF 之后的下一步,主题就是「What's Next After RLHF?」。PANews 认为,如今回头看,这场演讲几乎可以视作 Jev 的「思想说明书」。
在演讲里,Diogo Almeida 先提出了一个看似矛盾的问题:今天的大模型已经能挑战高难度数学题,代码、推理和各类 benchmark 持续提升,但到了企业真正想自动化的业务里,人却始终拿不掉。
他举的例子是客服。让 AI 查资料、总结文档、起草回复,问题不大;但如果让 AI 自己决定「这笔钱退不退」「这个用户要不要赔偿」,企业就会立刻谨慎起来。表面上看,这些决策比高等数学简单得多,但企业并不愿意直接交给 AI。
Diogo Almeida 给出的回答是:「Today's AI is incredible at assistance, not automation.」也就是,今天的 AI 很擅长协助人完成工作,但还不太能自己把工作独立做完。
在他的划分里,像 Claude Code 这样的产品依然属于 ChatGPT 开启的「协助时代」。它可以写代码、改文件,但人通常仍然坐在电脑前持续检查,出错后再让它修改。
真正的自动化则不同。人在很多时候根本不在场,AI 需要在后台自己判断、自己执行,一天可能运行几十万次,甚至几百万次,用户甚至不会看到它具体做了什么。
问题随之变得更尖锐:为什么今天的 AI 已经足够聪明,却仍然离不开人?Diogo Almeida 把矛头指向了 RLHF。
按照他的说法,RLHF 的基本逻辑并不复杂,就是收集人的偏好,再让模型越来越符合人的偏好。也正因为如此,模型从训练开始就在学习:什么样的回答更容易被人喜欢。
这也解释了大模型一个常见特征:即便不知道答案,它也常常能把话说得很像那么回事。Diogo Almeida 在现场举了一个例子:有人给 ChatGPT 发去一段放屁的录音,并告诉它这是自己创作的一首音乐,请它「真诚、坦率」地评价,结果 ChatGPT 仍然一本正经地夸赞这是一首带有阴森、诡异氛围的环境音乐。
他用一句话概括这种倾向:「Overpromising is a feature.」也就是,过度承诺不是 Bug,而是 feature。
对聊天产品来说,这未必是致命问题,因为用户还在屏幕前,回答错了可以纠正。但在自动化系统里,机器并不关心回答是否好听,它只需要知道两件事:到底该怎么做,以及模型自己到底有多大把握。
Jev不再让模型「说一段话」
在这样的思路下,Jev 的设计显得很反常。普通大模型即便最终只需要回答「A 还是 B」,往往也要经过完整的 Token 生成过程。Jev 直接砍掉了这部分。
按照文中介绍,Jev 目前主要处理三类任务:
- Noul:回答 Yes 还是 No;
- Choice:从几个选项里选一个;
- Score:按照标准打分。
它返回的不是一段解释,而是判断结果和对应概率,不负责写长文,也不陪用户聊天。
官方公布的端到端延迟低至 70—500 毫秒,相比前沿模型快 20—200 倍,价格低 40—400 倍。PANews 认为,真正关键的不只是「快」,而是输出里附带的概率。
为此,TypeSafe 提出了一套新的训练方法:RLCD,Reinforcement Learning for Calibrated Decisions,校准决策强化学习。它试图解决的问题很直接:如果 AI 告诉你某件事有 80% 的概率发生,这个 80% 到底能不能信。
理想状态下,模型判断为 80% 概率的一批事件,最后就应该大约有 80% 真的发生。这个特性在自动化系统里很关键。比如,99% 把握的任务可以直接执行;51% 把握的任务,则可以转交给更强、更贵的大模型,甚至交给人工处理。
文章把问题归结为一句话:真正麻烦的,不是 AI 不知道,而是 AI 不知道自己不知道。
从这个角度看,Jev 想改变的不是单纯的模型速度,而是 AI 输出的对象。过去 ChatGPT 生成的答案主要是给人看的;Jev 给出的判断和概率,则是准备直接交给软件使用的。
Agent时代需要的,可能是海量小判断
这也解释了 Jev 为什么会在当下受到关注。随着 Agent 开始进入实际运行阶段,系统会产生大量细碎但高频的判断:下一步调用哪个工具、网页该点哪个按钮、某条信息是否还有用、任务是否已经完成、结果要不要重新检查。
这些问题单独看并不复杂,但一个 Agent 一天可能要做几十万次、几百万次判断。如果每一次都调用最强的大模型,花几秒钟做复杂推理,再输出一大段 Token,成本和延迟都会迅速上升。
Jev 想切入的,正是这一层:把大量高频的小决定交给它处理,而把真正需要复杂推理的任务留给更强的大模型。这也是 TypeSafe 把 Jev 称为「System One Model」的原因。
这个概念来自丹尼尔·卡尼曼提出的「系统 1」和「系统 2」:前者负责快速、直觉式判断,后者负责慢速、复杂思考。Jev 的命名也来自「杰文斯悖论」——当一种资源变得越来越便宜,人们未必会减少使用,反而可能用得更多。
如果调用一次 AI 很贵,使用场景通常只会集中在最重要的任务上;但如果一次判断便宜到几乎可以忽略,那么一封邮件、一条日志、一次工具调用、一个网页按钮,甚至 Agent 执行过程中的每一步,都可能加入一次 AI 判断。
Jev的热度,未必等于结论已经成立
不过,PANews 也提到,现在就说 Jev 代表下一代 AI,还为时过早。它所谓的「零幻觉」,更多是指不会跳出规定答案类型去自由发挥,并不意味着不会选错;而 193.6 倍提速、444.6 倍降本这样的极端数据,也主要来自 TypeSafe 自己的测试。
因此,这次 Jev 爆火真正值得关注的,未必是它能不能挑战 GPT 或 Claude,而是它背后提出的问题:过去几年,整个行业都在想,怎样让 AI 想得更久、说得更多;但如果未来真正需要的是几十亿次机器之间的判断,AI 为什么每一次都要先「说一段话」?
按照文章的概括,ChatGPT 教会了机器如何和人说话,而 Jev 押注的下一步则是:当人不再坐在屏幕前,机器能不能自己做决定。

