Meta 把新一轮模型价格战又往前推了一步。

9 月才过去 3 天,文中提到已经有 5 个前沿模型发布:Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark 1.3。就在前一晚,谷歌 Gemini 3.8 Flash 刚刚发布,Meta 随即跟进。
马克·扎克伯格在 X 上宣布,Muse Spark 1.3 正式发布,并称这款模型以「前沿性能」带来「几乎便宜到无需计量」的体验,还表示这是 Meta 在编程和智能体工作方面迄今最大的飞跃。
Meta 超级智能实验室负责人 Alexandr Wang 也连续发布多条 X 帖文,介绍这次更新的核心变化。按他的说法,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少约 20%,token 消耗减少约 25%,在长周期任务中对需求的保持能力更强,「用户会明显感受到这次飞跃」。
Muse Spark 1.3 跑分进入第一梯队
文中称,Muse Spark 1.3 发布后,刚上线不久的 Gemini 3.8 Flash 迅速承压。从多项基准测试结果看,Muse Spark 1.3 的提升幅度更大。
在 Max 推理强度下,Muse Spark 1.3 在 Artificial Analysis 的智能指数达到 62 分,超过 GPT-5.6 Sol 和 Fable 5,并进入当前第一梯队。文章还提到,Meta 在 5 个月里已经迭代了 4 个 Muse Spark 版本。

在被用来衡量长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3 得分 75.4,超过 Claude Opus 5 的 74.0 和 GPT-5.6 Sol 的 73.0,也领先于 Gemini 3.8 Flash。
- Muse Spark 1.3:75.4 分
- Claude Opus 5:74.0 分
- GPT-5.6 Sol:73.0 分
在其他开发者常看的指标上,这一模型也拿出了较高分数:
- SWEAtlas CodeBase QnA:59.4 分,超过 GPT-5.6 Sol 和 Opus 5
- Terminal-Bench 2.1:88.8 分
- MRCR 512K-1M:98.1 分
作为对比,文中给出的 GPT-5.6 Sol 在 MRCR 512K-1M 上的分数为 73.8。Agent 能力方面,Muse Spark 1.3 在 JobBench、OSWorld 等测试中与 Opus 5 的差距只剩几个百分点。
Artificial Analysis 的对比结果也被反复提及。文中称,Muse Spark 1.3 的智能指数为 62 分,与 Claude Fable 5 持平;而在成本侧,Muse 的输入成本比 Fable 5 低 8 倍,输出成本低近 12 倍。
面对这组成绩,Alexandr Wang 直接在社交平台上点名谷歌,称 Gemini 在 Artificial Analysis 智能指数上的表现落后,只能「吃别家模型的汽车尾气」。

低价成为这次发布的另一核心卖点
这次 Muse Spark 1.3 被反复强调的,不只是跑分,还有价格。
按文中说法,Muse Spark 1.3 没有沿着单纯堆参数的路线走,而是针对长周期编程和更强的指令遵循能力进行了专门训练,以减少不必要的交互轮次,并让输出更加简洁。对应结果是模型在代码风格、回答长度和 token 使用效率上都更紧凑,成本明显下降。
文中举了一个开发者实测案例。开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与 Fable 5.1 xHigh 进行对比。测试 prompt 中设置了一条「自我改进规则」:如果独立评委评分低于 9.5/10,智能体必须继续改进代码并重新尝试。
两个模型都运行了约 2 个小时。按文中描述,Muse Spark 1.3 在这段时间内完成了 20 轮自我改进循环,每轮启动 3 个智能体,相当于在 2 小时内运行了 60 多次智能体任务,而总成本不到 1 美元。该开发者称:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」
在公开定价上,Meta 维持了每百万 token 输入 1.25 美元、输出 4.25 美元的价格。文章还称,贡献者版本 muse-spark-1.3-contributor 的价格处于海外模型中的地板水平,但相应代价是用户数据将被用于改进 Meta 的产品。

Codedamn 创始人、开发者 Mehul Mohan 评价称,Muse Spark 1.3 贡献者层的定价「离谱得不真实」,并把它称作美国 AI 实验室的「DeepSeek 定价时刻」。
按照 Artificial Analysis 的统计,在同等智力水平,即得分 59 以上的模型中,Muse Spark 1.3 的单任务成本为 0.55 美元。文中给出的其他对比包括:
- Grok 4.6:0.94 美元
- GPT-5.6 Sol:0.95 美元
- Claude Opus 5:1.23 美元
开发者 Kartik 还提到,Muse Spark 1.3 似乎具备类似 Sol 和 Fable 的「循环深度」推理能力,即不是一次性直接生成答案,而是在内部进行逻辑推演,这让它的 token 效率更高。
Meta 把目标指向 7×24 小时个人智能体
Muse Spark 1.3 的发布,也被放进 Meta 更大的产品路线中解读。
文中回顾,今年 7 月 Meta 发布 Muse Spark 1.1,主打 1M 超长上下文和计算机操作能力。不到两个月,1.3 版本已经把长程编码能力推到 GPT-5.6 的档次。文章将这种高频迭代归因于 Alexandr Wang 接手 Meta 超级智能实验室后的推进速度。

Meta 方面反复强调的两个关键词,是「智能体」和「便宜到忽略不计」。按文中说法,Meta 正将下一个风口押注在「智能体工程」上。
文章援引 Alexandr Wang 接受 Axios 采访时的说法称,所有可用性改进都在服务于扎克伯格多次提及的目标:打造 7×24 小时在线的个人智能体。
文中将这一目标拆成两个条件:
- 模型需要足够聪明且稳定,能够支撑极长对话线程,并行处理多个工作流,在指令模糊时主动提问,遇到阻碍时向人类求助,在关键操作前确认,并尽量避免幻觉。
- 模型运行成本必须足够低。如果个人智能体每天运行成本达到数十美元,就很难成为大众化产品。
按照文章的判断,Muse Spark 1.3 的定位,就是为这类 7×24 小时个人智能体铺路。文中还提到,北京大学校友、Meta 研究员孙之清透露,Meta 团队在此前的牛油果 avocado 模型基础上再次进行了后训练,实现了更好的测试 scaling。
高分之外,行业对刷榜的质疑仍在扩大
不过,围绕 Muse Spark 1.3 的讨论并不只有赞扬。

AI 机构 BridgeMind 在一段评论中写道,Gemini 3.8 Flash 和 Muse Spark 1.3 同一天发布,两者在基准测试上看起来都很强,Muse Spark 1.3 目前在智能指数上与 Fable 5 并列,「我想感到兴奋,但我没有」。
BridgeMind 进一步表示,这个月的 AI 发布几乎都呈现同样的模式:分数快速上升,但真实世界的体验没有同步改进。这让其对基准测试的信任持续下降,对那些玩弄基准的实验室也越来越缺乏信任。
文章还提到,有网友对 Muse Spark 1.3、Gemini Flash 3.8z 在后端级 3D 约束下进行了压力测试,并据此认为两个模型都暴露出问题:其中提到「Muse Spark 1.4 并没有那么好,而 Gemini Flash 3.5 纯纯在刷榜」。
文中据此指出,当前各家实验室已经陷入「为了跑分而训练」的怪圈,DeepSWE、Tau3-Bench、GPQA 等测试被当作重点攻克对象。
即便在 Artificial Analysis 的深度报告里,Muse Spark 1.3 也并非没有短板。文章提到,在 AA-Omniscience 测试中,xhigh 和 max 版本的成绩都有所下降,原因是模型的「弃权率」上升:当它不确定时,更倾向于不回答,而不是编造答案。这样做降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分表现那样同步大幅提升。

大模型竞争转向长程任务与成本效率
围绕 Muse Spark 1.3 和 Gemini 3.8 Flash 的同日发布,文章最后给出几项判断。
其一,基座模型依赖参数扩张带来的红利正在接近上限,单纯通过扩大参数规模来提升智力,边际收益越来越低。未来更重要的,可能是像 Muse Spark 1.3 这样,在系统架构里引入类似「循环深度」的推理机制,并在工具调用上做减法。
其二,竞争焦点正在从「谁更会说话」转向「谁更能干活」。在这一框架下,核心壁垒不再只是单点跑分,而是在极低成本下完成长程任务的真实落地能力。
文章认为,像 Muse Spark 1.3 这样能用不到 1 美元完成 60 次试错循环的模型,会直接改变商业模式。
参考资料包括 Meta 官方博客、Artificial Analysis 页面、Alexandr Wang 与孙之清等人在 X 上发布的内容,以及开发者 @SPAC89 的测试记录。

