Jev 发布还不到一周,开源社区已经开始复刻这种「不写答案、直接给概率」的模型。目标都很接近:省掉逐 token 生成,直接给出选项和概率。但具体实现上,已经分成了几条不同路线。
直接读取现成模型分数
SemIf 是最简单的一种做法,连模型都不用重新训练。它直接使用现成的 Qwen,在模型准备回答 A、B、C 时截住生成过程,不让模型继续输出,再直接读取每个选项的分数,并换算成概率。
Simple Jev 也沿用现成大模型,但继续减少重复计算。同一段材料只读取一次,后面的多个问题共享这部分结果,再分别判断答案。作者也明确表示,它复刻的是 Jev 的使用方式,准确率、速度和概率校准都没有做到等价。
专用决策模型路线
Laya 则不再使用会生成文字的大模型,而是换成更接近传统分类器的编码模型。优点是模型更小、速度更快,短板也很直接。一次在 77 个选项中做选择时,Laya 的准确率只有 42.5%,Jev 为 87.0%。
Von 走的也是专用决策模型路线。它只有约 4 亿参数,不生成文字,一次前向就直接完成 Choice、Noul 和 Score,更像是一个能读自然语言的新一代分类器。
Verdict 更小,参数量约 1.5 亿。作者重点处理了两个问题:模型答错时仍给出很高置信度,以及调换选项顺序后结果也跟着变化。它更关注如何让概率和判断稳定下来。
保留大模型并改造成决策结构
Kev 选择保留大模型。它以 Qwen 为底座,再加入专门的决策结构,让同一份输入只读取一次,多个问题分别计算概率。第三方此前逆向 Jev 时,也推测它可能采用了类似设计。
在 Kev 的自测中,使用训练时没见过的新题测试,8B 版本准确率约为 78%,Jev 约为 86%。更明显的差距出现在置信度上,Kev 仍有一些答错的题会给出 90% 以上把握。
Nimble 的重点放在训练阶段。它使用 Qwen3.5-9B,并准备了一批「只改一个事实,正确答案就翻转」的数据做后训练。在 324 个未参与训练的测试样本中,Nimble 有 90.1% 选中了参考答案,Jev 为 93.2%。不过作者也提醒,目前还不能保证模型「报 90% 就真的有 90% 正确」。
扩散模型直接填答案
OpenJev 走得更远,直接换成 DiffusionGemma。它先把几个答案位置留空,再像扩散模型补图一样一次填出来。在 RTX PRO 6000 上,单请求中位延迟约为 94ms。
一周内已分成四路
几天下来,OpenJEV 已经分成四条路线:直接读取现成模型的答案分数、训练专用决策模型、把大模型改造成决策模型,以及用扩散模型直接填答案。
从目前这些复刻结果看,Jev 这条路线看起来并不难抄。真正拉开差距的,还是准确率、泛化能力和概率校准。模型敢报 90%,这个 90% 到底有多可信,仍是最难的部分。

