ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL 团队,已被指认为刚刚公开的 AI 创业公司 Mostik,目前成绩为 7.51%。
公开信息显示,这支团队共有 15 人,其中包括 12 名博士和 1 位菲尔兹奖得主。不过,比赛尚未结束:第二次 Milestone 将在 9 月 30 日截榜,最终提交截止时间为 11 月 2 日。
Mostik 的方案:让模型直接交换内部状态
Mostik 所做的方向,是让不同 AI 模型直接交换内部状态。与常见多 Agent 主要通过文本传递信息不同,Mostik 在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型可以理解的表示,两个模型本身都不需要微调。
其公开实验采用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5。按文中给出的描述,可以近似理解为由大模型负责 prefill,小模型负责 decode。具体来说,GLM-5.2 只负责读取题目,并不生成 Token,而是把内部状态直接交给 4B 小模型,由后者生成答案。
官方披露的实验结果与限制
Mostik 表示,这种方法可以把两者之间的性能差距缩小约一半;如果和达到相同准确率的中型单模型相比,计算量只有约 40%。不过,最终效果仍然低于 753B 大模型本身。
需要说明的是,Mostik 尚未公布 7.51% 这一竞赛成绩具体使用了什么模型和 Harness。文中提到的 753B+4B,只是另一组技术演示,不能直接视为当前夺榜配置。
ARC-AGI-3 比的不只是模型规模
报道提到,ARC-AGI-3 竞赛考察的是整套 Agent 系统,而不只是单一模型能力。此前阶段冠军只使用了 Qwen 3.6 27B,但依靠 Harness、工具和上下文管理拿到第一。
方案适用范围与业内质疑
另一方面,这套技术要求能够读取模型的 hidden states,因此 Claude、GPT 这类云端模型目前无法使用。
Google DeepMind 工程师 Susan Zhang 也提出质疑:既然已经能够控制模型内部状态,那么在冻结两个模型的前提下,再单独训练一座「桥」,是否真是最划算的工程方案,仍有讨论空间。

