ARC 竞赛暂列第一团队曝光:Mostik尝试让大小模型直接协作

ARC 竞赛暂列第一团队曝光:Mostik尝试让大小模型直接协作

N
News Editor
2026-09-03 07:23:44
ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL 团队,被指为刚公开的 AI 创业公司 Mostik,目前成绩为 7.51%。Mostik 的核心方案是让不同模型直接交换内部状态,由大模型负责读题、小模型负责生成答案,以降低生成成本。该公司称,这种方式可将大小模型性能差距缩小约一半,计算量约为同等准确率中型单模型的 40%,但当前效果仍低于 753B 大模型本身。

ARC-AGI-3 Kaggle 竞赛暂列第一的 CSTL 团队,已被指认为刚刚公开的 AI 创业公司 Mostik,目前成绩为 7.51%。

公开信息显示,这支团队共有 15 人,其中包括 12 名博士和 1 位菲尔兹奖得主。不过,比赛尚未结束:第二次 Milestone 将在 9 月 30 日截榜,最终提交截止时间为 11 月 2 日。

Mostik 的方案:让模型直接交换内部状态

Mostik 所做的方向,是让不同 AI 模型直接交换内部状态。与常见多 Agent 主要通过文本传递信息不同,Mostik 在两个模型之间训练一个 bridge,把一个模型的 hidden states 转成另一个模型可以理解的表示,两个模型本身都不需要微调。

其公开实验采用了 753B 的 GLM-5.2 和 4B 的 Qwen3.5。按文中给出的描述,可以近似理解为由大模型负责 prefill,小模型负责 decode。具体来说,GLM-5.2 只负责读取题目,并不生成 Token,而是把内部状态直接交给 4B 小模型,由后者生成答案。

官方披露的实验结果与限制

Mostik 表示,这种方法可以把两者之间的性能差距缩小约一半;如果和达到相同准确率的中型单模型相比,计算量只有约 40%。不过,最终效果仍然低于 753B 大模型本身。

需要说明的是,Mostik 尚未公布 7.51% 这一竞赛成绩具体使用了什么模型和 Harness。文中提到的 753B+4B,只是另一组技术演示,不能直接视为当前夺榜配置。

ARC-AGI-3 比的不只是模型规模

报道提到,ARC-AGI-3 竞赛考察的是整套 Agent 系统,而不只是单一模型能力。此前阶段冠军只使用了 Qwen 3.6 27B,但依靠 Harness、工具和上下文管理拿到第一。

方案适用范围与业内质疑

另一方面,这套技术要求能够读取模型的 hidden states,因此 Claude、GPT 这类云端模型目前无法使用。

Google DeepMind 工程师 Susan Zhang 也提出质疑:既然已经能够控制模型内部状态,那么在冻结两个模型的前提下,再单独训练一座「桥」,是否真是最划算的工程方案,仍有讨论空间。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。