Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini

N
News Editor
2026-09-03 13:23:19
Meta 发布新模型 Muse Spark 1.3 后,围绕前沿模型的性能与价格竞争迅速升温。文中披露,该模型在 DeepSWE v1.1、MRCR 512K-1M、Artificial Analysis 等指标上取得高分,并维持每百万 token 输入 1.25 美元、输出 4.25 美元的定价。与此同时,BridgeMind 等声音也对行业「刷榜」现象提出质疑,认为基准分数大涨并不等于真实体验同步提升。

Meta 把新一轮模型价格战又往前推了一步。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 2

9 月才过去 3 天,文中提到已经有 5 个前沿模型发布:Anthropic 的 Fable 5.1 和 Mythos 5.1、谷歌的 Gemini 3.8 Flash 和 Cyber,以及 Meta 的 Muse Spark 1.3。就在前一晚,谷歌 Gemini 3.8 Flash 刚刚发布,Meta 随即跟进。

马克·扎克伯格在 X 上宣布,Muse Spark 1.3 正式发布,并称这款模型以「前沿性能」带来「几乎便宜到无需计量」的体验,还表示这是 Meta 在编程和智能体工作方面迄今最大的飞跃。

Meta 超级智能实验室负责人 Alexandr Wang 也连续发布多条 X 帖文,介绍这次更新的核心变化。按他的说法,与 Muse Spark 1.2 相比,Muse Spark 1.3 减少了无效轮次,工具调用次数减少约 20%,token 消耗减少约 25%,在长周期任务中对需求的保持能力更强,「用户会明显感受到这次飞跃」。

Muse Spark 1.3 跑分进入第一梯队

文中称,Muse Spark 1.3 发布后,刚上线不久的 Gemini 3.8 Flash 迅速承压。从多项基准测试结果看,Muse Spark 1.3 的提升幅度更大。

在 Max 推理强度下,Muse Spark 1.3 在 Artificial Analysis 的智能指数达到 62 分,超过 GPT-5.6 Sol 和 Fable 5,并进入当前第一梯队。文章还提到,Meta 在 5 个月里已经迭代了 4 个 Muse Spark 版本。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 3

在被用来衡量长程编程能力的 DeepSWE v1.1 基准测试中,Muse Spark 1.3 得分 75.4,超过 Claude Opus 5 的 74.0 和 GPT-5.6 Sol 的 73.0,也领先于 Gemini 3.8 Flash。

  • Muse Spark 1.3:75.4 分
  • Claude Opus 5:74.0 分
  • GPT-5.6 Sol:73.0 分

在其他开发者常看的指标上,这一模型也拿出了较高分数:

  • SWEAtlas CodeBase QnA:59.4 分,超过 GPT-5.6 Sol 和 Opus 5
  • Terminal-Bench 2.1:88.8 分
  • MRCR 512K-1M:98.1 分

作为对比,文中给出的 GPT-5.6 Sol 在 MRCR 512K-1M 上的分数为 73.8。Agent 能力方面,Muse Spark 1.3 在 JobBench、OSWorld 等测试中与 Opus 5 的差距只剩几个百分点。

Artificial Analysis 的对比结果也被反复提及。文中称,Muse Spark 1.3 的智能指数为 62 分,与 Claude Fable 5 持平;而在成本侧,Muse 的输入成本比 Fable 5 低 8 倍,输出成本低近 12 倍。

面对这组成绩,Alexandr Wang 直接在社交平台上点名谷歌,称 Gemini 在 Artificial Analysis 智能指数上的表现落后,只能「吃别家模型的汽车尾气」。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 4

低价成为这次发布的另一核心卖点

这次 Muse Spark 1.3 被反复强调的,不只是跑分,还有价格。

按文中说法,Muse Spark 1.3 没有沿着单纯堆参数的路线走,而是针对长周期编程和更强的指令遵循能力进行了专门训练,以减少不必要的交互轮次,并让输出更加简洁。对应结果是模型在代码风格、回答长度和 token 使用效率上都更紧凑,成本明显下降。

文中举了一个开发者实测案例。开发者 @SPAC89 使用 Muse Spark 1.3 Ultra Contributor 模式,与 Fable 5.1 xHigh 进行对比。测试 prompt 中设置了一条「自我改进规则」:如果独立评委评分低于 9.5/10,智能体必须继续改进代码并重新尝试。

两个模型都运行了约 2 个小时。按文中描述,Muse Spark 1.3 在这段时间内完成了 20 轮自我改进循环,每轮启动 3 个智能体,相当于在 2 小时内运行了 60 多次智能体任务,而总成本不到 1 美元。该开发者称:「这完全超出了我的预期,这玩意儿简直是一件艺术品!」

在公开定价上,Meta 维持了每百万 token 输入 1.25 美元、输出 4.25 美元的价格。文章还称,贡献者版本 muse-spark-1.3-contributor 的价格处于海外模型中的地板水平,但相应代价是用户数据将被用于改进 Meta 的产品。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 5

Codedamn 创始人、开发者 Mehul Mohan 评价称,Muse Spark 1.3 贡献者层的定价「离谱得不真实」,并把它称作美国 AI 实验室的「DeepSeek 定价时刻」。

按照 Artificial Analysis 的统计,在同等智力水平,即得分 59 以上的模型中,Muse Spark 1.3 的单任务成本为 0.55 美元。文中给出的其他对比包括:

  • Grok 4.6:0.94 美元
  • GPT-5.6 Sol:0.95 美元
  • Claude Opus 5:1.23 美元

开发者 Kartik 还提到,Muse Spark 1.3 似乎具备类似 Sol 和 Fable 的「循环深度」推理能力,即不是一次性直接生成答案,而是在内部进行逻辑推演,这让它的 token 效率更高。

Meta 把目标指向 7×24 小时个人智能体

Muse Spark 1.3 的发布,也被放进 Meta 更大的产品路线中解读。

文中回顾,今年 7 月 Meta 发布 Muse Spark 1.1,主打 1M 超长上下文和计算机操作能力。不到两个月,1.3 版本已经把长程编码能力推到 GPT-5.6 的档次。文章将这种高频迭代归因于 Alexandr Wang 接手 Meta 超级智能实验室后的推进速度。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 6

Meta 方面反复强调的两个关键词,是「智能体」和「便宜到忽略不计」。按文中说法,Meta 正将下一个风口押注在「智能体工程」上。

文章援引 Alexandr Wang 接受 Axios 采访时的说法称,所有可用性改进都在服务于扎克伯格多次提及的目标:打造 7×24 小时在线的个人智能体。

文中将这一目标拆成两个条件:

  1. 模型需要足够聪明且稳定,能够支撑极长对话线程,并行处理多个工作流,在指令模糊时主动提问,遇到阻碍时向人类求助,在关键操作前确认,并尽量避免幻觉。
  2. 模型运行成本必须足够低。如果个人智能体每天运行成本达到数十美元,就很难成为大众化产品。

按照文章的判断,Muse Spark 1.3 的定位,就是为这类 7×24 小时个人智能体铺路。文中还提到,北京大学校友、Meta 研究员孙之清透露,Meta 团队在此前的牛油果 avocado 模型基础上再次进行了后训练,实现了更好的测试 scaling。

高分之外,行业对刷榜的质疑仍在扩大

不过,围绕 Muse Spark 1.3 的讨论并不只有赞扬。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 7

AI 机构 BridgeMind 在一段评论中写道,Gemini 3.8 Flash 和 Muse Spark 1.3 同一天发布,两者在基准测试上看起来都很强,Muse Spark 1.3 目前在智能指数上与 Fable 5 并列,「我想感到兴奋,但我没有」。

BridgeMind 进一步表示,这个月的 AI 发布几乎都呈现同样的模式:分数快速上升,但真实世界的体验没有同步改进。这让其对基准测试的信任持续下降,对那些玩弄基准的实验室也越来越缺乏信任。

文章还提到,有网友对 Muse Spark 1.3、Gemini Flash 3.8z 在后端级 3D 约束下进行了压力测试,并据此认为两个模型都暴露出问题:其中提到「Muse Spark 1.4 并没有那么好,而 Gemini Flash 3.5 纯纯在刷榜」。

文中据此指出,当前各家实验室已经陷入「为了跑分而训练」的怪圈,DeepSWE、Tau3-Bench、GPQA 等测试被当作重点攻克对象。

即便在 Artificial Analysis 的深度报告里,Muse Spark 1.3 也并非没有短板。文章提到,在 AA-Omniscience 测试中,xhigh 和 max 版本的成绩都有所下降,原因是模型的「弃权率」上升:当它不确定时,更倾向于不回答,而不是编造答案。这样做降低了幻觉率,但也侧面说明,它的绝对知识储备并没有像跑分表现那样同步大幅提升。

Meta发布 Muse Spark 1.3,跑分与低价同时冲击谷歌 Gemini 8

大模型竞争转向长程任务与成本效率

围绕 Muse Spark 1.3 和 Gemini 3.8 Flash 的同日发布,文章最后给出几项判断。

其一,基座模型依赖参数扩张带来的红利正在接近上限,单纯通过扩大参数规模来提升智力,边际收益越来越低。未来更重要的,可能是像 Muse Spark 1.3 这样,在系统架构里引入类似「循环深度」的推理机制,并在工具调用上做减法。

其二,竞争焦点正在从「谁更会说话」转向「谁更能干活」。在这一框架下,核心壁垒不再只是单点跑分,而是在极低成本下完成长程任务的真实落地能力。

文章认为,像 Muse Spark 1.3 这样能用不到 1 美元完成 60 次试错循环的模型,会直接改变商业模式。

参考资料包括 Meta 官方博客、Artificial Analysis 页面、Alexandr Wang 与孙之清等人在 X 上发布的内容,以及开发者 @SPAC89 的测试记录。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。