TypeSafe AI 在 9 月中发布了一个不生成文字的模型 Jev。根据官方公告,这一模型被归类为「System One 模型」,接收一段状态和一组预先定义好的问题后,并行完成评估,直接返回带概率的类型化答案,整个过程中不会生成任何字符串。发布不到一周,已经出现数个开源跟进版本。
输入状态与问题,输出带概率的答案
常见语言模型在接收上下文后,会逐个 token 生成回复。即便最终输出只是一个很小的 JSON 对象,每个 token 仍依赖前面已经生成的内容,应用端还需要再做解析和验证。
Jev 采用了不同做法。TypeSafe 的技术文件显示,问题和答案类型会被预先声明。模型支持 3 种基本类型:
- Choice:从一份清单中选出一个选项,返回选择结果、各选项概率和信心值;
- Score:按照评分标准对状态打分,返回分数、概率分布和信心值;
- Noul:回答「这个陈述是否为真」,返回一个 0 到 1 之间的数值。
技术文件还提到,这 3 种问题类型可以在同一次 API 调用中混合,并行完成评估,而且「增加问题几乎不会改变响应时间」,也「不会造成上下文腐化」。
概率输出是设计重点
Jev 返回的不是单一结论,而是带概率的结果,这改变了应用端的写法。以工单分流为例,如果模型给工程组 91%、账务组 9%,程序可以直接自动路由;如果两边分别是 52% 和 48%,程序则可以选择升级处理、补充上下文,或者改为调用更强的模型。
在这种设计下,阈值和后续处理由程序决定,模型负责提供一般 if 判断无法从非结构化文本中直接推导出的语义判断。TypeSafe 在官网将其描述为「决策,而非字符串」,以及「软件可以直接据以行动的类型化输出」。
不过,类型安全能拦住的是格式错误,不是判断错误。模型虽然无法返回声明范围之外的选项,但仍可能在允许范围内选错答案。
速度与价格数据均来自官方
TypeSafe 官网列出的数据包括:System One 任务延迟 0.114 秒、每次任务成本 0.000081 美元、每 10 亿输入 token 42 美元。公司还宣称,其输入价格比 Claude Fable 5.1 低 238 倍,整体「快 193.6 倍、便宜 444.6 倍」。
官方公告另外给出的响应时间区间为 70 毫秒到 500 毫秒,对照现有前沿模型的 3 秒到 329 秒。
不过,这些数字都来自 TypeSafe 自行公布的测试结果,目前没有独立第三方复测可供对照。公司表示,Jev 建立在新的架构、并行采样器,以及一套名为 RLCD(校准决策强化学习)的训练方法之上。目前该模型仍处于早期访问阶段,开发者需要排队等待。
一周内已有开源项目跟进
这一类别的扩散速度也受到关注。根据 Hacker News 的投稿时间,从 9 月 16 日开始,陆续出现了可在本地 GPU 上运行的开源替代方案、用现有语言模型模拟 Jev 行为的实现,以及延迟测试项目。
Hugging Face 上也已经能查到同方向模型,包括 9 月 16 日上架的 system-one-qwen3.5-4b-scorer,以及 9 月 18 日上架、主打计算机操作的 cua-s1-forms。后者上线两天内累计 57 个收藏,并已出现社区转出的 ONNX 和 CoreML 版本。
围绕 Jev 的讨论,已经不只是单一产品是否好用,也延伸到另一个问题:把判断能力从文字生成中拆出来,是否值得单独发展成一类模型。

