斯坦福教授公开直播训练 Marin 535B 大模型

斯坦福教授公开直播训练 Marin 535B 大模型

N
News Editor
2026-08-24 13:07:10
斯坦福大学教授、Simile AI 创始人 Percy Liang 宣布,Marin 开放实验室已启动 Marin 535B-A23B 模型训练,并将训练过程全程公开。该模型拥有 5350 亿总参数、230 亿激活参数,训练数据总量为 18.75 万亿 token,部署 11 套 GB200 NVL72 系统,预计连续训练约 3 个月。团队还同步开放了实时训练曲线、数据构成页面和 GitHub 议题页,希望把原本较为封闭的大模型训练过程置于公开观察之下。

斯坦福大学教授、Simile AI 创始人 Percy Liang 宣布,Marin 开放实验室已经启动 Marin 535B-A23B 模型训练,并将整个训练过程全程公开。过去两天,这一消息在 X 上引发热议,网友 Max For AI 发文称:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的。」

斯坦福教授公开直播训练 Marin 535B 大模型 2

根据 Percy Liang 公布的信息,Marin 535B-A23B 拥有 5350 亿总参数和 230 亿激活参数。为完成这次训练,团队准备了总计 18.75 万亿 token 的训练数据,并部署了 11 套 GB200 NVL72 系统,约合 792 颗 GB200 GPU。

按计划,这次训练预计将连续运行约 3 个月,总训练计算量约为 2.7e24 FLOPs。主模型训练结束后,团队还会继续推进后训练(post-training)阶段。

训练前先完成四阶段 Scaling Ladder

Percy Liang 表示,在正式启动这次训练任务前,团队已经先训练了一套包含 4 个阶段的 Scaling Ladder(规模扩展阶梯),模型规模从 1.6B-A61M(48B tokens)一直到 27.7B-A1.2B(926B tokens)。

斯坦福教授公开直播训练 Marin 535B 大模型 3

他解释称,这样做有两个目的:一是通过这些小规模实验提前发现并调试潜在问题;二是根据不同规模模型的训练表现,对「主模型训练」进行预测。

不过,Percy Liang 也提到:「这是迄今为止我们进行过规模最大的一次训练,因此,我们也确实在期待过程中出现一些意料之外的情况。」

主模型已启动,训练曲线实时开放

目前,该主模型已经正式开始运行,外部用户可以直接查看实时训练曲线。按照 Percy Liang 的说法,后续公开的信息还将持续扩展到训练数据、实验日志和工程问题。

斯坦福教授公开直播训练 Marin 535B 大模型 4

公开内容包括:

  • 数据层面:训练数据混合比例、数据处理方式,以及不同领域数据如何进入模型;
  • 工程层面:训练配置、代码以及实验设计;
  • 训练过程:实时 loss 变化、模型状态以及不同阶段预测结果等。

团队同时给出了具体的查看渠道,包括数据构成页面、Weights & Biases(wandb)实时训练页面,以及 GitHub 上的详细信息页。

公开链接

查看数据构成:
https://storage.googleapis.com/marin-public/held/harrier-k40-cluster-overview/2026.08.18/index.html?revision=uniform-sampling

斯坦福教授公开直播训练 Marin 535B 大模型 5

在 Weights & Biases(wandb)上实时观看训练过程:
https://wandb.ai/marin-community/marin_moe/reports/535B-A23B-18T-Token-Hero-Run-Scaling-Ladder--VmlldzoxNzc2MDM5Ng

在 GitHub 上查看详细信息:
https://github.com/marin-community/marin/issues/8435

试图把大模型训练从“黑箱”变成可观察过程

这次公开训练之所以受到关注,一个直接原因是,外界过去很难知道 GPT-4、Claude、Gemini 这类模型在训练阶段到底发生了什么。外部通常只能看到最终模型能力、benchmark 分数和少量论文描述,而数据配比、训练失败记录、哪些超参数有效、loss 如何变化、Scaling law 预测是否准确等细节往往无法观察。

斯坦福教授公开直播训练 Marin 535B 大模型 6

按原文说法,Marin 正试图改变这一点,把模型训练过程做成一个可观察、可讨论、可协作的公开实验。

网友持续围观,讨论延伸到具体训练细节

消息公布后,围绕这次训练的讨论持续升温。有网友认为,这才是真正的开源精神,「即使训练过程出现问题、偏离预期,也毫不隐藏。」

也有网友表示,除了模型本身已经十分庞大,更令人震撼的是,外界现在可以通过 WandB 平台实时观看一个大模型训练过程如何一步步推进。还有观点形容,这像是顶级 AI 实验室内部原本紧闭的「暗室」被打开,外界第一次能够直接看到里面正在发生的事情。

斯坦福教授公开直播训练 Marin 535B 大模型 7

还有一些讨论开始进入更细的技术观察。网友 James Thewlis 一直在实时跟进训练过程,他曾提出,为什么在大约第 500 step 附近,norms(参数范数)会出现一个峰值。之后他又在评论区给出自己的解释:「这个峰值完全是由 router_bias(路由偏置)导致的。它并不是通过梯度训练得到的参数,而是 MoE(混合专家模型)中用于 token 平衡机制(token balancing heuristic)的一部分,因此它具有不同于普通模型参数的动态变化规律。」

原文提到,类似这样的技术讨论还有很多。这也让这次公开训练不只是一个观看窗口,也成为学习和交流的平台。

Percy Liang 还开设了从零构建语言模型课程

除这次公开训练外,Percy Liang 还有一门理论课程《CS336: Language Models From Scratch》,目标是让学生完整理解一个大型语言模型如何被构建。

斯坦福教授公开直播训练 Marin 535B 大模型 8

课程链接:
https://www.youtube.com/playlist?list=PLoROMvodv4rMqXOcazWaTUHhq-yembLCV

本文提到,这场持续约 3 个月的训练接下来最受关注的,不只是最终模型能力如何,也包括训练途中会出现哪些波动、崩溃或意外情况。

参考链接包括 Max For AI、Percy Liang 以及 CopyRebeldia 在 X 上发布的相关内容。本文来自微信公众号「机器之心」,作者署名为「关注AI的」。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
50

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。