大模型圈最近流行一种测试方式:先「挂马甲」,再把模型丢进真实环境里跑。
近日,一款名为 Ox Alpha 的匿名模型突然出现在 OpenRouter。Ox 本身就有「牛」的意思,国内网友很快给它起了个更接地气的名字——「牛来」大模型。
根据 OpenRouter 披露的信息,Ox Alpha 支持 100 万 token 上下文,支持文本、图片和视频输入,也可以调用工具,目前完全免费。
模型上线后不久,就有开发者把它接入编码 Agent,直接放进真实代码仓库测试。最初引发关注的,并不是它的来历,而是代码能力。

Ox Alpha 的代码测试结果引发关注
开发者 Ben Davis 从 DeepSWE 中抽取了 10 项任务,对 Ox Alpha 进行测试。结果显示,它完成了其中 8 项,通过率达到 80%。在他公布的对比结果里,Fable 5 Max 为 65%,GLM-5.3 Max 和 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。
DeepSWE 测试的是更贴近真实场景的软件工程能力。模型需要阅读代码仓库、定位问题、修改代码、运行测试,再根据报错继续修复。相比单轮编程题,这种任务形式更接近编码 Agent 的实际工作方式。
不过,这组结果的样本量只有 10 项,范围很小。随后,另一些开发者在另一组 DeepSWE 子集上继续测试,给出的结果约为 63%。由于两次测试的任务范围和运行配置并不完全相同,现阶段还不能据此确认 Ox Alpha 的准确排名。
即便如此,几轮公开测试还是释放出一个明确信号:这款匿名模型已经展现出较强的长程编码潜力,能力逼近当前头部代码模型。

关于模型身份,GLM 猜测流传最广
围绕 Ox Alpha 的真实身份,目前传播最广的说法,是它可能对应智谱尚未发布的 GLM-5.3 Flash,或者 GLM-5.3 的多模态版本。
有人专门写博客整理了相关线索,并给出几项主要依据。
- 视频编码器被认为是最强证据。分析者测试了 4 段帧率、时长和分辨率各不相同的视频,发现 Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 完全一致,而 MiMo、Qwen 和 GLM-4.6V 的结果都有明显差异。
- 文本 tokenizer 也被认为高度吻合。研究者测试了 25 组提示词,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。
- 其他行为特征同样被指向智谱。Ox Alpha 拒绝处理音频,这一点与 GLM-5V 的路由方式一致;其回答风格、Agent 执行步数和推理接口,也被认为与 GLM 接近。博客还提到,智谱此前曾用 Pony Alpha 匿名测试 GLM-5,存在类似先例。
相关分析链接为:https://ox-alpha-evidence-production.up.railway.app/

除了技术特征外,也有网友试图从对话内容中寻找蛛丝马迹。Ben Davis 认为,99% 可以确定这就是 GLM-5.x。
不过,现有线索仍不足以完成身份确认。截至目前,OpenRouter 和智谱都没有公开回应。
Code Arena 上的 korrine 也在被猜测
在「牛来」大模型之外,Code Arena 上另一款名为 korrine 的匿名模型,也让讨论继续升温。
最初,不少人猜测它可能是 Kimi K3.1。原因在于,Kimi K3 发布前,外界曾认为它以 kivine 的代号接受测试,而 kivine 与 korrine 的命名结构相近,因此引发联想。

不过,最早传播相关消息的爆料者随后补充称,此前获知的 Moonshot 新模型,可能对应的是另一个代号 adamant-ananke。按这一说法,korrine 也可能来自 Qwen 等其他中国团队。
在评论区里,还有人把它指向 MiMo V3。到目前为止,korrine 的身份比 Ox Alpha 更难判断。
匿名测试为何越来越常见
模型厂商在正式发布前用匿名方式测试,正在变成一种更常见的流程。

在 Arena 这类环境里,隐藏厂商和型号,可以尽量削弱品牌带来的先入为主。用户看不到模型身份,只能依据实际输出做选择,最终积累的对战结果,也会更接近真实用户体验。
OpenRouter 提供的则是另一类测试场景。开发者会把模型接入各种编码 Agent,让它进入真实代码仓库,连续调用工具,处理持续数小时的软件工程任务。这样一来,上下文能否稳定保持、工具调用是否可靠、模型会不会在长程任务里循环或跑偏,都更容易在高强度使用中暴露出来。
对模型厂商来说,这种测试接近一次公开压力测试。团队可以提前观察失败案例,验证推理服务的承载能力,也能在正式发布前积累真实口碑。
与此同时,「猜模型」本身也越来越像一种营销手段。身份悬念会把讨论周期拉长,外界围绕代号、表现和归属持续追踪,本身就会形成传播效应。

目前仍无官方确认
从公开测试表现看,Ox Alpha 已经拿到不少关注,尤其是在代码任务上的表现最为突出。如果它最终确实是一款 Flash 模型,那么它所呈现出的能力水平,已经足够让市场对完整版保持高度关注。
但在 OpenRouter 和智谱作出公开回应之前,关于 Ox Alpha 的真实身份仍停留在推测阶段。至于 korrine,目前线索更少,讨论也仍在继续。
参考链接
- https://x.com/Adidotdev/status/2090833298713096241
- https://x.com/davis7/status/2090669483740279155?s=20
- https://x.com/davis7/status/2090655207831298095?s=20
- https://x.com/MaxForAI/status/2090783750217162788
本文来自微信公众号「机器之心」(ID:almosthuman2014),作者署名为「关注AI的」。

