中国 AI 创业公司月之暗面(Moonshot AI)发布新一代旗舰大语言模型 Kimi K3。根据文中信息,Kimi K3 于 2026 年 7 月 16 日发布,拥有 2.8 兆参数,原生支持 100 万 token 长上下文,并具备原生多模态理解能力,可在单一架构内处理文本、图像与视频。
Kimi 官方 X 账号还宣布,模型完整权重将于 7 月 27 日开放,并同步上线 Kimi.com、Kimi Work、Kimi Code 三条产品线和 Kimi API 平台。文中称,Kimi K3 是当前全球规模最大的开源权重前沿模型之一。
月之暗面的融资与 IPO 规划
月之暗面由前清华大学教授杨植麟于 2023 年初创立。资料显示,他曾在 Meta 和 Google 任职,是卡内基梅隆大学校友,并在自然语言处理领域发表过多篇高引用论文。
文中提到,在风险资本支持下,月之暗面估值快速升至 200 亿美元,旗下 Kimi 也成为中国市场 ChatGPT 替代方案的代表产品之一。
据彭博社报道,截至 2026 年 4 月,月之暗面年度经常性营收(ARR)已突破 2 亿美元。目前,公司正寻求以 300 亿美元估值募集 20 亿美元新资金,并规划重组架构赴香港 IPO。
链新闻今年 2 月曾报道,Anthropic 指控月之暗面、DeepSeek 和 MiniMax 三家中国 AI 公司通过知识蒸馏利用 Claude 输出训练自身模型,月之暗面对这一指控未予置评。
Kimi K3 的技术架构
Kimi K3 采用大规模混合专家(Mixture of Experts,MoE)架构,总参数规模为 2.8 兆,内置 896 个专家,每次推理仅激活 16 个,分配方式为 Stable LatentMoE。文中称,这一设计可以显著降低实际推理成本。
在权重与量化方面,K3 使用 MXFP4,即 4-bit 浮点权重并为每个 block 配置独立 scale,在启动阶段则使用 MXFP8。按照文中给出的数据,整个 2.8T 模型的权重存储需求约为 1.4 TB,整体效率较上一代 Kimi K2 提升约 2.5 倍。
Kimi Delta Attention 与 Attention Residuals
K3 的两项核心架构创新分别是 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),这也是 Kimi 团队首次公开命名的自有机制。
KDA 是一种混合线性注意力机制,在部分层替代标准的二次方注意力计算,同时保留关键层的表达能力,以降低长上下文场景下的整体计算成本。根据官方数据,在 100 万 token 上下文条件下,KDA 可将解码速度提升至最高 6.3 倍。文中称,这一能力对代理型任务和长时序代码任务尤其关键,因为这类任务往往需要在同一轮会话中处理大规模上下文。
AttnRes 则替代了传统残差连接方式。与传统的逐层均匀累加不同,AttnRes 允许每一层按需从更早层提取表征。文章指出,这种机制对 MoE 架构尤其重要,因为不同专家往往会在不同深度被激活,均匀累加可能削弱专家之间的差异。官方数据称,AttnRes 将训练效率提升约 25%,额外计算成本低于 2%。
此外,K3 还引入了 Quantile Balancing 和 Per-Head Muon 等优化方法。前者直接从 router-score 分位数推导专家分配,免除启发式更新;后者则对每个注意力头分别进行优化。
四条产品线同步上线
随着 Kimi K3 发布,月之暗面同步推出四个使用入口:
- Kimi.com:网页端聊天界面,可直接调用 K3,面向通用聊天、写作和资料整理场景。
- Kimi Work:桌面应用,支持 Windows 与 Apple Silicon,定位为工作场景 AI 助手。
- Kimi Code:终端和 IDE 集成的代码代理,主打长时序自主编码。
- Kimi API:开发者接口平台,地址为 platform.kimi.ai。
Kimi 的订阅方案以古典音乐速度术语命名,包括 Adagio、Andante 和 Moderato,覆盖个人版到企业版。API 定价方面,cache-hit 为每百万 token 0.30 美元,cache-miss 为 3.00 美元,输出价格为 15.00 美元。官方表示,在代码工作负载场景下,快取命中率超过 90%,实际使用成本可以进一步压低。
基准测试中的位置
根据链新闻 7 月 17 日报道以及独立评测平台 Artificial Analysis 的数据,Kimi K3 在多项基准测试中的表现位于美国旗舰模型之间。
- 参数规模:Kimi K3 为 2.8T MoE,每次激活 16 个专家;Claude Fable 5 与 GPT-5.6 Sol 参数未公开;DeepSeek V4 为 MoE。
- 上下文窗口:Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 都为原生 100 万 token,DeepSeek V4 为 128K 至 256K。
- 多模态:Kimi K3、Claude Fable 5、GPT-5.6 Sol 原生支持;DeepSeek V4 为部分支持。
- Frontend Code Arena:Kimi K3 排名第 1,胜率 76%;Claude Fable 5 排名第 2,GPT-5.6 Sol 排名第 3。
- SWE Marathon 与 Program Bench:文中称 Kimi K3 领先所有比较模型,Claude Fable 5 与 GPT-5.6 Sol 次之。
- 一般任务质量:Kimi K3 略低于 Claude Fable 5 和 GPT-5.6 Sol,高于 DeepSeek V4。
- 标准智能任务推估成本:Kimi K3 为 0.95 美元,Claude Fable 5 为 2.75 美元,DeepSeek V4 Flash 为 0.02 美元到 0.33 美元,GPT-5.6 Sol 未列出。
文章给出的结论是,Kimi K3 在编码与代理任务上表现最强,一般对话质量略弱于 Claude Fable 5 与 GPT-5.6 Sol,但整体性价比明显高于美国旗舰模型。Moonshot 也表示,K3 在用户体验上与 Claude Fable 5、GPT-5.6 Sol 之间仍有客观差距。
7 月 27 日开放权重后的影响
文中称,Kimi K3 的完整权重将于 2026 年 7 月 27 日开放。这也是继 GLM-5.2 之后,又一款兆级参数规模的开源前沿模型。
不过,实际部署门槛并不低。SemiAnalysis 的分析指出,企业若要自建 K3,至少需要由 64 颗加速器组成的超级节点,且高端 GPU、NVLink 互连与 HBM 内存都属于必要基础设施。
文章据此指出,这也是为什么 K3 的开源被视为 Nvidia 生态的长期利多之一:随着中国模型能力提升,全球算力竞争也会更激烈。
对于开发者而言,开放权重意味着社区可以对 K3 进行 fine-tune、量化和自建部署,使其成为与 Llama、Qwen、DeepSeek 并列的开源选项。对于只需通过 API 使用模型的个人用户,Kimi.com 和 Kimi Work 是最直接的入口,而订阅层级和 API 定价也明显低于 Claude 或 GPT。

