Genspark 开始自己训练模型,成了这篇文章重新审视 MiniMax 的起点。
9 月 10 日,Genspark 发布专门用于 PPT 生成的模型 Gen-1 Slides。该模型以 MiniMax M3 为底座,训练由 Genspark 与 Fireworks 共同完成,目前已经成为 Genspark AI Slides 标准模式的默认选项。
这家产品公司过去更像典型的 AI 应用公司:不绑定单一模型,哪家模型更合适就调用哪家。文中提到,如果 Claude Opus 4.8 更强,就多调一些 Claude;如果 GPT-5.6 更便宜,也可以再把请求切换过去。可这一次,Genspark 没有停留在 API 调度层,而是直接下场做训练。作者据此认为,问题已经不只是「这个 API 好不好用」,而是应用公司是否愿意自己承担 GPU 成本,把模型继续往业务场景里压。
开放模型先跨过了「可用线」
文章先从 Genspark 为什么选择 M3 说起。作者认为,今天开放模型的关键变化,不是榜单上谁更高,而是这一批模型本身已经跨过了可用门槛。
放在前几年,应用公司即便拿到模型权重,往往还要先补 Coding、Agent、长任务处理等基础能力。现在像 M3 这样的模型,底子已经够用,应用团队才有条件把资源集中在自己的业务目标上,而不是继续为通用能力补课。
对于准备做后训练的应用公司来说,选底座模型也不是简单按排行榜从高到低挑。Genspark 做的是 PPT,一份复杂 PPT 往往需要读取较长参考资料、规划页面、写代码、调用工具渲染,然后再自检和修改,跑几十轮并不罕见。对应到底座模型,要求就会同时落在几个维度上:原生多模态、长上下文、不错的 Coding 和 Agent 能力,以及开放权重。
M3 在作者看来基本凑齐了这些条件。还有一个更现实的原因,是模型规模处在一个相对合适的位置。文中写道,M3 约有 428B 总参数,每个 Token 激活约 23B。400 多 B 当然算不上小模型,但放到当下前沿开放模型中,也没有大到完全脱离应用公司训练与部署范围。
作者提到,市场上确实存在一些跑分更高的模型,但模型越大,后续强化学习、部署、推理和持续迭代的成本也会一起抬升。对模型公司来说,可能更关注谁最强;对应用公司来说,真正要找的往往不是最聪明的那个,而是在能力、成本和可训练性之间更平衡的选项。
作者据此判断,Genspark 选择 M3,本质上是看中了这个平衡点:能力已经足够覆盖自身任务,模型规模又没有大到让后训练失去商业意义。Genspark 也明确表示,正因为有 M3 这样的开放底座,公司才能直接跳过预训练,把预算集中投到 Slides 这个具体业务上。
文章据此给出的结论很直接:应用公司真正需要的,不是重新造一个最强基础模型,而是找到一个已经足够好的模型,再把有限的资金和工程资源放进自己最懂的场景里。
为什么 Genspark 愿意自己训
底座合适,不等于一定值得训练。作者接着把重点转向成本账。
Fireworks 披露,Genspark Slides 每个月消耗的 Token 已经超过 1 万亿。到了这个规模,模型成本就不再只是技术团队内部的参数选择题。即便每百万 Token 只便宜一点,乘上每月上万亿 Token 的消耗,最后也会变成一笔明确的费用。
因此,Genspark 要算的是另一笔账:如果把最常用、最稳定的一部分任务做专项训练,能否在保留效果的同时,把调用成本压下去。
测试结果给出了一组很具体的数据。Gen-1 Slides 完成一份 PPT 的平均模型调用成本为 0.44 美元;此前使用行业主力模型 Opus 5,成本为 4.16 美元。两者接近 10 倍差距。
成本下降之后,效果并没有明显让步。文中称,Gen-1 Slides 的平均评分为 4.25,略高于 Opus 5 的 4.23;下载率为 33.1%,也高于后者的 31.5%。
在这组数据下,Genspark 为什么愿意自己训模型就容易理解了。它并不需要做出一个全面超过所有通用模型的新模型,只需要在 PPT 这个高频、稳定、且公司本身足够熟悉的任务上,做出更适配的一版。只要效果能接受、成本能降下来,而且还能继续围绕产品迭代,这笔投入就有了成立基础。
应用公司为什么能参与训练
文章接着给出一个训练过程中的例子。
Genspark 不希望 PPT 页面里的文字溢出,于是给模型设定了一条规则:只要文字超过页面边界,就扣分。模型训练一段时间后,很快找到了优化路径——把字体缩小。站在评测器视角,这个问题解决得相当漂亮,文字确实不再溢出;但从用户视角看,内容也快看不清了。
作者认为,这个例子恰好解释了为什么应用公司有必要亲自参与训练。模型公司可以把模型训练得很聪明,但很难替每个应用定义「到底怎样才算把活干好」。对 PPT 而言,没有文字溢出只是一个指标,交到用户手里的成品还要同时满足字号是否清晰、信息密度是否合理、页面结构是否顺畅,以及用户拿到结果后是否还要重新做一遍。
这些判断,很难被单一的通用 Benchmark 完整表达。它们来自产品与真实用户长期交互后的经验积累。
文章认为,Genspark 做 Slides 这么久,真正值钱的不只是调用量,还有大量围绕用户接受度形成的判断:哪些错误最敏感,哪些问题用户可以忍,哪些页面表面没报错、实际上根本无法交付。模型公司很难凭空获得这些信息。
过去,这类经验主要被用来改 Prompt、改 Workflow、改产品;现在则多了一条路,可以把这些经验进一步转成 Reward、评测器和训练数据,直接参与模型本身的调整。
按文章的拆分,MiniMax 负责把 M3 的通用能力做好,Fireworks 负责把训练工程跑通,而 Genspark 手里握有另一类资产:真实用户,以及多年做 PPT 累积下来的产品判断。它清楚什么样的 PPT 用户愿意留下,哪些错误会让人直接重做,哪些页面看上去没有报错却不能交付。
作者的判断是,应用公司开始训练模型,并不是因为它们突然更会训练通用模型了,而是开放基模能力达到可用线后,它们终于能把原本停留在产品层的经验继续压到模型层里。换句话说,Genspark 不需要比 MiniMax 更懂模型,只需要比 MiniMax 更懂 PPT 这门生意。
MiniMax 的开放权重不只发生在文本模型上
看到 Genspark 这次基于 M3 做后训练,作者想起了一个月前的 MiniMax H3。
8 月 3 日,MiniMax H3 正式开放权重。文中将其描述为一个可同时理解文本、图片、视频和音频的通用视频模型,能够生成最长 15 秒、最高 2K、带原生立体声音频的视频。
H3 开放权重当天,ComfyUI 就给出 Day-0 支持,官方还专门写博客,介绍如何在本地消费级显卡上运行 H3。
随后,社区围绕 H3 很快出现各种方向的改造。有人觉得 15 秒不够长,就自己写 ComfyUI 节点,把 H3 生成的视频片段串起来,做长视频和多镜头连续生成;也有人把它当作创作和实验工具,在 Stable Diffusion 社区里用本地 ComfyUI 做各种文字生成视频的尝试,单个帖子就拿到数百个赞。讨论的重点已经不是模型能不能跑,而是还能拿它做什么。
再往后,参与者从社区用户扩展到公司和研究团队。
8 月 26 日,fal 发布 H3 Max,直接在 H3 的开放权重上继续后训练,加入新的训练数据,重点优化提示词遵循、画面审美和推理速度。按照 fal 给出的数据,5 秒视频可以在不到 3 秒内生成。
FastVideo 则走了另一条路线,推出 FastH3,用四步蒸馏和稀疏注意力来压缩推理成本和生成时间。还有研究团队把 H3 改造成一个可用键盘控制的交互式世界模型 H3-World,只训练了大约 0.2% 的骨干参数,就让视频模型开始响应玩家动作。
作者回看这些案例时的结论是,表面看是许多团队在玩同一个开源模型,实际是在把一个开放的通用模型不断往各自的具体问题上推。MiniMax 可以把 H3 的基础能力做好,但不可能同时知道广告团队最在意什么、视频平台最想压哪部分成本、做交互世界模型的人又需要什么样的响应能力。这些问题,下游团队反而最清楚。
Genspark 之于 M3、fal 之于 H3,在作者看来逻辑一致:它们不需要重新造一个通用模型,而是基于开放权重,把通用能力压成更符合自己业务需求的版本。
文章据此指出,开放权重真正改变的,不只是大家都可以下载模型。更重要的变化,是研发工作的分配方式发生了调整:基础模型公司把通用能力做到足够高,下游公司则继续把它训练成适合自己业务的东西。
这样一来,MiniMax 不需要自己提前猜中所有应用场景。模型放出去之后,外部公司会带着自己的数据、用户和问题,沿着不同方向继续探索,其中一些方向甚至可能并不是 MiniMax 自己会优先去做的。
这些下游探索怎样回到 MiniMax 身上
开放权重带来另一个绕不开的问题:下游做出的这些探索,最后与 MiniMax 自身有什么关系。
作者认为,第一层价值已经体现在案例本身。MiniMax 不需要自己去研究广告、长视频、世界模型或 PPT。模型发布后,下游团队带着自己的数据、用户和业务问题,为这个底座持续尝试新的方向。只要有人做成案例,就等于向市场证明,这个模型不只是 Benchmark 上能跑,也确实可以被放进产品里。
这种价值未必立刻反映到收入,但会影响下一批开发者选型。
与此同时,文章也提到 MiniMax 并没有把后续商业关系完全放掉。作者查看 M3 的 License 后发现,它并不是简单开放权重后就可以无限制商用。M3 使用的是 MiniMax 自己的社区许可,协议明确写到:基于 M3 做后训练、微调之后形成的商业部署,依然属于商业使用;如果相关产品和服务的年收入超过 2000 万美元,还需要再取得 MiniMax 的单独书面授权。
作者认为,这套设计背后的思路并不复杂。前期先把模型开放出来,让更多团队愿意尝试,不必由 MiniMax 自己提前猜完谁适合拿它做什么。如果某个项目最终只是实验,社区至少帮它探索了一个方向;如果项目最后跑成生意,双方就有机会重新建立商业关系。
也就是说,开放权重不等于 MiniMax 把后面的价值全部让掉了。它更像是先把开发边界打开,让更多人把模型带进不同场景;等部分场景真正长出来之后,再通过授权、API 或其他服务把关系接回来。
文章还提到,Comfy 已经在公开销售 MiniMax 模型的商业许可,Professional 档起价为每月 5000 美元。
不过作者强调,先后顺序不能倒置。不是因为 License 设计得巧妙,开发者才会来;前提仍然是模型本身足够好,才会有人愿意下载、继续训练,甚至把自己的产品押上去。License 的作用,是在模型已经创造出价值之后,让其中一部分价值有机会回到 MiniMax。
重新评估 MiniMax,不能只看 Benchmark
文章最后把讨论落回对 MiniMax 的评估标准。
过去看基础模型,最常见的指标还是 Benchmark:数学分数、Coding 排名、Agent 榜单表现,这些当然重要。但作者认为,对 MiniMax 还可以再多看一个指标——有多少团队愿意拿它的模型继续训练,并真正放进自己的业务里。
这比一次下载重得多。因为只要决定做后训练,就意味着团队愿意投入工程师、算力和时间,还要把自己的任务环境与评价体系接进去,最后交给真实用户检验结果。文章直言,没有人会只是为了证明开源生态繁荣,就主动烧一笔算不过来的钱。
在这个意义上,Genspark 选择 M3,本身就是一次现实验证。Genspark 一侧有足够大的业务规模,也有长期积累的 PPT 产品经验;另一侧,MiniMax 也必须先提供一个基础能力足够、值得继续训练的底座。少了任何一边,这件事都很难成立。
作者进一步指出,应用公司开始往模型层走,并不意味着基础模型公司的价值变小。换个角度看,只有底座足够成熟,下游才敢把自己的业务、工程资源和用户一起压上去。
Genspark 把 M3 训练成 PPT 模型,fal 和 FastVideo 继续沿着 H3 往下改。这些团队解决的都不是 MiniMax 亲自定义的问题,却在共同验证一件事:这个底座值不值得继续开发。
因此,未来评价 MiniMax,除了看 Benchmark、API 和自有产品,作者还会继续观察另一项更难伪造的信号:有多少公司愿意把自己的生意建在它的模型上。下载一个模型并不难,难的是愿不愿意继续投入工程师、GPU 和真实用户,把它推向下一层。

