AI 编程公司 Magic 发布一项预训练研究,称一套新的训练方案只需约 50 万美元的 GB200 算力,就能达到接近 DeepSeek V4 Pro Base 的预训练效果,所需计算量约为 1/50。
Magic 表示,Base 指的是只完成预训练、尚未经过强化学习等后训练的底模。其测试方式是使用模型未见过的代码、数学题和研究论文,比较不同模型对后续内容的预测准确度。按照这一口径,对比的是底模的预训练效果,不代表聊天、Coding 或 Agent 能力已经追平 DeepSeek V4 Pro 成品版。
训练规模扩大 10 倍
Magic 随后将训练规模扩大 10 倍,对应约 400 万美元的 GB200 算力。该公司称,这一版本在同一套自测中,超过了其测试的 DeepSeek、Kimi 和 NVIDIA 最新公开 Base 模型。
Magic 同时估算,如果按 DeepSeek V4 Pro 的训练效率做到同等水平,算力成本将超过 1 亿美元。
完整配方与权重尚未公布
Magic 没有公布完整训练配方,仅透露效率提升来自模型架构、优化器、训练目标和数据处理等几十项改动。
目前,该模型权重也还没有发布,因此「50 倍效率」这一说法仍无法由外界独立复现。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

