匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型

N
News Editor
2026-08-23 02:15:10
匿名大模型 Ox Alpha 近日在 OpenRouter 上线后迅速引发关注。公开信息显示,它支持 100 万 token 上下文、文本图片视频输入及工具调用,目前限时免费。开发者在 DeepSWE 任务中的两轮测试分别给出 80% 和约 63% 的结果,市场猜测其可能是智谱尚未发布的 GLM-5.3 Flash 或多模态版本;与此同时,Code Arena 上另一个匿名模型 korrine 的真实身份也仍未明朗。

大模型圈最近流行一种测试方式:先「挂马甲」,再把模型丢进真实环境里跑。

近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就有「牛」的意思,国内网友很快给它起了个更接地气的名字——「牛来」大模型。

根据 OpenRouter 披露的信息,Ox Alpha 支持 100 万 token 上下文,支持文本、图片和视频输入,也可以调用工具,目前完全免费。

模型上线后不久,就有开发者把它接入编码 Agent,直接放进真实代码仓库测试。最初引发关注的,并不是它的来历,而是代码能力。

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 3

Ox Alpha 的代码测试结果引发关注

开发者 Ben Davis 从 DeepSWE 中抽取了 10 项任务,对 Ox Alpha 进行测试。结果显示,它完成了其中 8 项,通过率达到 80%。在他公布的对比结果里,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。

DeepSWE 测试的是更贴近真实场景的软件工程能力。模型需要阅读代码仓库、定位问题、修改代码、运行测试,再根据报错继续修复。相比单轮编程题,这种任务形式更接近编码 Agent 的实际工作方式。

不过,这组结果的样本量只有 10 项,范围很小。随后,另一些开发者在另一组 DeepSWE 子集上继续测试,给出的结果约为 63%。由于两次测试的任务范围和运行配置并不完全相同,现阶段还不能据此确认 Ox Alpha 的准确排名。

即便如此,几轮公开测试还是释放出一个明确信号:这款匿名模型已经展现出较强的长程编码潜力,能力逼近当前头部代码模型。

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 4

关于模型身份,GLM 猜测流传最广

围绕 Ox Alpha 的真实身份,目前传播最广的说法,是它可能对应智谱尚未发布的 GLM-5.3 Flash,或者 GLM-5.3 的多模态版本。

有人专门写博客整理了相关线索,并给出几项主要依据。

  1. 视频编码器被认为是最强证据。分析者测试了 4 段帧率、时长和分辨率各不相同的视频,发现 Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致,而 MiMo、Qwen 和 GLM-4.6V 的结果都有明显差异。
  2. 文本 tokenizer 也被认为高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。
  3. 其他行为特征同样被指向智谱。Ox Alpha 拒绝处理音频,这一点与 GLM-5V 的路由方式一致;其回答风格、Agent 执行步数和推理接口,也被认为与 GLM 接近。博客还提到,智谱此前曾用 Pony Alpha 匿名测试 GLM-5,存在类似先例。

相关分析链接为:https://ox-alpha-evidence-production.up.railway.app/

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 5

除了技术特征外,也有网友试图从对话内容中寻找蛛丝马迹。Ben Davis 认为,99% 可以确定这就是 GLM-5.x。

不过,现有线索仍不足以完成身份确认。截至目前,OpenRouter 和智谱都没有公开回应。

Code Arena 上的 korrine 也在被猜测

在「牛来」大模型之外,Code Arena 上另一款名为 korrine 的匿名模型,也让讨论继续升温。

最初,不少人猜测它可能是 Kimi K3.1。原因在于,Kimi K3 发布前,外界曾认为它以 kivine 的代号接受测试,而 kivine 与 korrine 的命名结构相近,因此引发联想。

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 6

不过,最早传播相关消息的爆料者随后补充称,此前获知的 Moonshot 新模型,可能对应的是另一个代号 adamant-ananke。按这一说法,korrine 也可能来自 Qwen 等其他中国团队。

在评论区里,还有人把它指向 MiMo V3。到目前为止,korrine 的身份比 Ox Alpha 更难判断。

匿名测试为何越来越常见

模型厂商在正式发布前用匿名方式测试,正在变成一种更常见的流程。

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 7

在 Arena 这类环境里,隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能依据实际输出做选择,最终积累的对战结果,也会更接近真实用户体验。

OpenRouter 提供的则是另一类测试场景。开发者会把模型接入各种编码 Agent,让它进入真实代码仓库,连续调用工具,处理持续数小时的软件工程任务。这样一来,上下文能否稳定保持、工具调用是否可靠、模型会不会在长程任务里循环或跑偏,都更容易在高强度使用中暴露出来。

对模型厂商来说,这种测试接近一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。

与此同时,「猜模型」本身也越来越像一种营销手段。身份悬念会把讨论周期拉长,外界围绕代号、表现和归属持续追踪,本身就会形成传播效应。

匿名模型 Ox Alpha 走红,代码测试结果逼近头部模型 8

目前仍无官方确认

从公开测试表现看,Ox Alpha 已经拿到不少关注,尤其是在代码任务上的表现最为突出。如果它最终确实是一款 Flash 模型,那么它所呈现出的能力水平,已经足够让市场对完整版保持高度关注。

但在 OpenRouter 和智谱作出公开回应之前,关于 Ox Alpha 的真实身份仍停留在推测阶段。至于 korrine,目前线索更少,讨论也仍在继续。

参考链接

  • https://x.com/Adidotdev/status/2090833298713096241
  • https://x.com/davis7/status/2090669483740279155?s=20
  • https://x.com/davis7/status/2090655207831298095?s=20
  • https://x.com/MaxForAI/status/2090783750217162788

本文来自微信公众号「机器之心」(ID:almosthuman2014),作者署名为「关注AI的」。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。