9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不生成文本,只负责做判断。
两周后,围绕这一方向的竞争已经迅速铺开。OpenAI 在开发者日推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也发布了 Strands Decider。国内方面,上海人工智能实验室开源了多模态决策模型 Intern-Decision;9 月 30 日,成立不到五个月的上海公司 StartLux(原点星辉)发布开源模型 StartLux-Decision,并称其在公开评测中超过 Jev。
一个新品类在两周内就从首发走到多方入场,这样的推进速度,即便放在大模型行业里也并不常见。StartLux 背后的掌舵人,则是盛大网络联合创始人陈大年。
Jev 把「判断」从「生成」里拆了出来
TypeSafe 将 Jev 定义为「System One 模型」,名称来自卡尼曼《思考,快与慢》中的系统一概念,也就是人类快速、直觉式的思维。与之对应的系统二,则更偏向慢思考。过去两年,大模型的发展重点大多放在系统二方向,强调更长的推理链和更深的思考过程。
但在 Agent 真正开始运行后,实际需求并不完全一样。一个 Agent 任务里,频繁出现的往往不是复杂推理,而是大量细碎判断:工单该分给哪个团队、某条命令能不能放行、页面下一步该点哪个按钮、任务是否已经完成。
此前,这类判断通常有两种处理方式:要么交给大模型顺带完成,先生成一段文字,再从中解析结果;要么写成固定规则,但规则很难覆盖长尾情况。前者速度慢、成本高,后者则不够灵活。
Jev 的做法是,只回答带有预设选项的问题,例如单选题、评分题或是非题,并直接返回带概率的结构化结果。它的定价为每百万输入 token 0.042 美元,输出免费。
按文中说法,Jev 实际上是把「判断」从「生成」中剥离出来,做成了一种低成本、高频使用的基础设施。
市场反馈也很快。Vercel 披露,Jev 上线 24 小时内,其 AI Gateway 上 13% 的付费用户已经开始使用该模型,这一比例是此前任何模型发布时的两倍。TypeSafe 以经济学家杰文斯的名字为模型命名,指向杰文斯悖论:某种资源越便宜,需求反而可能越大。
不过,Jev 也有明显限制。它是闭源托管模型,没有公开权重,也不支持本地部署,用户只能调用 TypeSafe 自家的 API。这个缺口,给后来者留下了空间。
国内团队迅速跟进,开源和本地化成为共同选择
国内团队很快开始布局类 Jev 模型。
上海人工智能实验室推出的 Intern-Decision 提供 0.8B、2B、4B 三个规格,主打多模态能力,能够理解图像和界面后再做决策。团队给出的数据称,其推理速度比 Jev 快 2 到 3 倍。
StartLux 则一次性发布了从 0.8B 到 27B 的五档规格,并配齐量化文件,直接面向本地部署场景。
按 StartLux 公布的数据,27B 版本在 Decision Index 0.2.1 的 38 项测试中,有 31 项高于 Jev 1.13,综合分为 63.88,对比 Jev 的 57.91。团队还展示了一组国际象棋对弈结果,在 36 局中赢下 35 局。
不过,这些数字也有明确前提。文中提到,这些结果来自团队基于公开工具、对照 9 月 28 日榜单快照完成的自测。与此同时,这个赛道的排名变化很快。StartLux 发布第二天,Cloudflare 就表示,自家 Clef 在同一套榜单上已经领先。至于国际象棋演示,文中认为它并不是决策模型的核心战场,更像是一种展示方式。
相比谁暂时排在第一,更值得注意的是,中国团队几乎都选择了开源和本地化路线。
原因并不难理解。Jev 采用闭源云端托管方式,对数据敏感、对跨境调用存在顾虑的国内开发者来说,本身就是门槛。公开权重、支持在本地机器运行,正好补上了 Jev 没有覆盖的部分。
还有一个细节也被点出。Cloudflare 的 Clef 基于 Qwen 后训练,亚马逊的 Strands Decider 也以 Qwen 为底座,APUS 的方案同样运行在 Qwen 上。按文中说法,在这一轮决策模型热潮里,中国开源基座已经成为全球玩家共用的底层能力。
StartLux 为什么把重点放在本地 AI
回到 StartLux 本身,这家公司成立于今年,CEO 是陈大年,CTO 是郭权玮博士。
陈大年的经历在中国互联网行业并不陌生。文中提到,他在 1998 年写出上网计费软件 ENCounter,次年与陈天桥共同创办盛大,后来又做了 WiFi 万能钥匙。
StartLux 对自己的定位是「主打本地模型」,希望把模型能力和数据都留在用户自己的设备上。此前,这家公司曾因 StartLux-27B 受到关注。该模型以 Qwen3.6-27B 为基座进行后训练,在中国信通院的 MCP 专项测试中拿到 39.25 分,超过 284B 参数的 DeepSeek-V4-Flash。文中同时说明,这是一项聚焦工具调用的专项测试,并不代表通用能力已经全面领先。
在 StartLux 的规划中,「本地 AI」并不是一个可以下载到电脑上的小模型,而是一整套个人 AI 系统:27B 模型承担通用能力,决策模型负责高频判断,上层是 Agent 和记忆系统,底层则是量化与推理系统。
放在这套架构里,决策模型对本地场景的重要性甚至高于云端。云端可以继续堆算力,但个人电脑的显存、内存和功耗都有明确上限。如果每一个小判断都调用 27B 模型,本地 Agent 很难真正跑起来。按 StartLux 公布的数据,4B 版本在压缩到 Q4 量化后约为 2.71GB,与原始权重的决策一致率仍达到 98.3%。
对一家押注本地路线的公司来说,决策模型不是单纯追逐热点的新产品,而是整套本地系统能否运行起来的关键部件。
文中还提到,Jev 对 StartLux 的意义并不是替它选定方向。从时间线看,StartLux 的决策模型立项明显晚于 Jev。Jev 真正证明的是另一件事:把智能拆成不同层级、让不同模型各司其职,这条路线已经得到市场付费验证,而这正好与 StartLux 一直强调的本地架构逻辑相吻合。
另一个被提到的数字是「3 天」。StartLux 将这一速度归因于自己的 Auto Research 体系,让 AI 参与数据构造、训练、评测和失败分析。文中认为,这套方法能否在不同模型品类之间持续复用,比一次榜单成绩更能说明公司的能力。
决策模型会不会很快进入价格竞争
不过,决策模型这一层到底能形成多深的护城河,文中认为现在还很难下结论。
Jev 号称在隐身状态下研究了两年;OpenAI 用两周时间,基于自家小模型做出了 Decisions API;StartLux 用了 3 天;Cloudflare 和亚马逊也都在半个月内跟进。Jev 发布时,就有分析人士判断,大厂会很快推出自己的决策模型,Jev 最终需要和「前沿版本的自己」打价格战。
如果一个新品类在两周内就能被快速复制,它本身就很难成为真正的壁垒。
对 StartLux 来说,真正的考验也不在决策模型这一层。郭权玮提到,长任务稳定性、异常恢复、上下文管理和整体体验,都比单纯把模型跑起来更难。
按计划,StartLux 首个面向公众的本地智能体验版本有望在年内推出。
从按时计费的上网工具,到 WiFi 万能钥匙,陈大年过去做过的多款产品,都属于高频、底层、依赖规模的生意。决策模型同样是一件高频、底层的事。问题在于,当「判断」便宜到人人都能做,价值最终会落在模型本身,还是落在把这些模型组装成产品的人手里,仍有待市场给出答案。

