Moonshot 发布 Kimi K3,多个基准成绩超过 Claude Fable 5

Moonshot 发布 Kimi K3,多个基准成绩超过 Claude Fable 5

N
News Editor
2026-07-17 17:36:42
中国 AI 公司 Moonshot AI 发布开源模型 Kimi K3,参数规模达 2.8 万亿。按文中披露数据,K3 在 Towards AI 的 Writing Elo、Arena AI 前端代码榜和多项对比测试中超过 Claude Fable 5,但在 Artificial Analysis 综合指数上以 57 分落后于 Fable 5 的 60 分和 GPT-5.6 Sol 的 59 分。该模型支持 100 万 token 上下文,官方称权重将于 7 月 27 日开放。
Moonshot AIKimi K3开源模型大模型人工智能ClaudeGPT科技动态

中国 AI 公司 Moonshot AI 发布了其最新开源模型 Kimi K3。按 Decrypt 报道,这是一款目前已公开发布的中国最大开源模型,并且在多项关键基准测试中拿到了靠前成绩。

Moonshot 发布 Kimi K3,多个基准成绩超过 Claude Fable 5 2

在 Towards AI 的 Writing Elo 测试中,Kimi K3 得分 2,840,高于 Claude Fable 5 的 2,760。该基准以模型撰写真实脚本的结果进行盲评,并使用与国际象棋排名相同的 Elo 系统打分。报道援引相关帖文称,Anthropic 团队此前长期在这一排名中占据优势,而 Kimi K3 这次升至第 1。

同一帖文还提到,Kimi K3 相比前代 Kimi K2.6 从第 21 名升至第 1 名,单次脚本生成成本约为 0.25 美元。

前端代码榜与多项测试排名靠前

在 Arena AI 的 Frontend Code Leaderboard 上,Kimi K3 也排在首位。该榜单基于数千次代码生成任务的人类两两投票,同样采用 Elo 评分。Kimi K3 得分 1,679,超过 Claude Fable 5 的 1,631,并在 7 个前端领域中的 6 个领域排名第 1。

据 Arena.ai 于 2026 年 7 月 16 日发布的帖文,Kimi K3 相较 Kimi K2.6 的排名从第 18 名升至第 1 名。帖文列出的前端领域包括 Brand & Marketing、Reference-Based Design、Data & Analytics 等。

Artificial Analysis Intelligence Index 这项综合指数汇总了 9 个独立评测,覆盖编码、推理、代理式工作和知识能力,分值范围为 0 到 100。该指数给 Kimi K3 的评分为 57,Claude Fable 5 为 60,GPT-5.6 Sol 为 59,Claude Opus 4.8 为 56。按这一综合榜单,K3 排在第 3,较 Fable 5 低 3%。

在 BridgeBench 的对比中,报道称 Kimi K3 与 Fable 5 正面交锋时获胜。相关帖文显示,在相同任务和盲审评判下,K3 赢下 8 个竞技场中的 7 个,其中 Refactoring 为 9 比 0,Debugging 为 6 比 1;Fable 5 唯一获胜的项目是速度。

另一则由 Guillermo Rauch 于 2026 年 7 月 16 日发布的帖文称,Kimi K3 在一个综合网页工程基准上表现最佳,领先于 Fable,并在更短时间内达到可比的成功率。帖文称,这是开源模型首次在这一综合网页工程基准上领先所有闭源模型。

报道还给出一个零样本示例:提示模型构建一个 iOS 克隆界面,Kimi K3 的结果被拿来与社交媒体上使用 GPT-5.6 Sol、且采用更复杂提示词的结果进行对比。

2.8 万亿参数,100 万 token 上下文

Kimi K3 采用混合专家架构,总参数量为 2.8 万亿。报道解释称,这类架构会把参数拆分为 896 个“专家”子网络,每次任务只激活其中一部分,以便在不大幅增加资源消耗的情况下获得更高能力。

Moonshot 发布 Kimi K3,多个基准成绩超过 Claude Fable 5 3

Moonshot AI 表示:“它是全球首个进入 3 万亿参数级别的开源模型,面向前沿智能场景设计,包括长周期编码、知识工作和推理。”报道同时写道,DeepSeek 的 V4-Pro 参数规模为 1.6 万亿,Moonshot 自家的 K2 为 1 万亿,因此 K3 在规模上大致达到最接近开源竞争对手的约两倍。

该模型支持 100 万 token 上下文窗口,具备原生图像和视频理解能力,并带有持续推理能力。

效率提升来自两项架构设计

报道提到,Kimi K3 的效率提升主要来自两项架构技术。

  • Kimi Delta Attention:用于提升长序列的解码速度,在 100 万 token 上下文下,速度最高可提升 6.3 倍。
  • Attention Residuals:在模型层之间选择性传递信息,而不是统一累积。Moonshot 表示,这项设计可带来约 25% 的训练效率提升,而额外计算成本低于 2%。

按文中说法,这两项设计合计带来相较 K2 约 2.5 倍的更好扩展效率。

定价接近中档模型,单任务成本低于 GPT-5.6 Sol 和 Opus 4.8

Kimi K3 的价格为每 100 万输入 token 3 美元、每 100 万输出 token 15 美元。报道称,这与 Anthropic 中档模型 Claude Sonnet 5 的定价相同。

不过,从 Artificial Analysis 的综合指数看,K3 只比 Fable 5 低 3 分。按 9 项基准汇总的单任务成本计算,K3 约为 0.94 美元,GPT-5.6 Sol 为 1.04 美元,Opus 4.8 为 1.80 美元。

Decrypt 还提到,其在 5 月曾报道,中国与美国前沿 AI 模型之间的定价差距在今年早些时候达到 15 至 30 倍。报道认为,K3 并没有按 DeepSeek 那样的低价出售,而是按西方中档模型水平定价,但提供了接近前沿模型的性能。对于通过 API 构建产品的团队,这意味着成本改善。

报道还写道,如果 Anthropic 最终只通过 API 提供 Fable 5,那么 K3 将成为最接近该档位模型的开源替代方案;按单任务成本计算,K3 约为 Opus 4.8 的一半。

芯片限制背景下发布,文中提到 H200 与替代供应商 GPGPU

报道称,K3 的发布触及美国芯片出口限制背景下的一个敏感问题。美国在 2023 年底限制英伟达 H800 GPU 向中国出口,Moonshot 此前确认,其早期模型曾使用这些芯片训练。

K3 的基准文档提到了 H200,以及公司所称“来自替代供应商的一种 GPGPU”。报道写道,外界普遍将其解读为华为 Ascend 硬件,但文档并未说明这些硬件位于何处。

Moonshot 发布 Kimi K3,多个基准成绩超过 Claude Fable 5 4

据 Silicon Republic 报道,Moonshot AI 总裁张宇桐今年在达沃斯论坛上表示:“我们知道自己没有奢侈条件去简单地扩大算力……这迫使我们把重点放在基础研究和效率上。”

美国银行分析师在 K3 发布后的报告中写道,K3 证明了“预训练扩展,配合架构创新,即使在这些限制条件下,仍可为中国旗舰模型带来跨越式提升”。

报道把 Moonshot 列入所谓的“AI Tiger”初创公司之中,并指出这些公司在无法获得华盛顿认为其所需芯片的情况下,仍改变了全球模型格局。至于这是否说明出口管制需要更严格,或说明其效果有限,报道称这仍是华盛顿尚未解决的政策问题。

幻觉率上升,官方也提示模型可能“过度主动”

尽管基准成绩突出,Kimi K3 也有需要留意的地方。

在 AA-Omniscience 这项衡量模型在不知道答案时仍自信编造内容频率的基准上,K3 的幻觉率从前代 K2.6 的 39% 升至 51%。报道的表述是:正确答案更多,但编造出来的答案也更多。

模型文档还承认,在长时间自治任务中,K3 可能会“过度主动”,代表用户做出意外决定。

对于已经基于 Kimi K2.6 工具链运行产品的团队,报道认为,K3 在大多数方面都是明显升级;但在需要高准确性的场景中,这一幻觉率变化值得先做压力测试。

可免费试用,权重将于 7 月 27 日开放

报道最后提到,用户可以在 Kimi 官方网站免费试用 K3,但由于访问量过大,服务器经常因流量限制导致任务中断,使用体验受到影响。文中给出的替代方案是付费订阅,或通过 API 调用。

Moonshot 计划于 7 月 27 日发布模型权重,面向大型企业和商业用户开放。报道还称,目前没有任何国产 GPU 能够承载这一体量的模型。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。