月之暗面本周发布 Kimi K3。这款模型总参数达到 2.8 兆,被介绍为史上最大的开源权重模型,完整权重预计将在 7 月 27 日前上架。
按官方披露的数据,仅把 2.8 兆参数以原生 4 bit 格式(MXFP4)存入硬盘,就需要约 1.4TB 到 1.5TB 空间,这还不包括实际推理所需资源。对普通用户而言,本地运行门槛已经很高。
Kimi K3 权重预计 7 月 27 日前开放
月之暗面表示,Kimi K3 的完整开源权重将于 7 月 27 日前上架,采用 Modified-MIT 授权,允许用户自行部署。截稿时,完整权重和社区量化版本,例如 GGUF,仍未出现。
采用 MoE 架构,激活参数约 500 亿到 600 亿
Kimi K3 采用 MoE(混合专家)架构。模型内部包含 896 个“专家”子网络,在每次处理一个 token 时,系统只会从中选择 16 个路由专家,再加上共享专家参与计算,而不是让全部专家同时运行。因此,模型实际处于激活状态的参数约为 500 亿到 600 亿。
这款模型还采用 Kimi Delta Attention(KDA)架构,并配合 Attention Residuals。按照官方说法,在百万 token 长上下文条件下,解码速度最高可提升 6.3 倍,上下文窗口达到 100 万 token,同时原生支持视觉输入。
官方部署指引:至少 64 张加速器
月之暗面的官方部署指引写明,自行部署 K3 至少需要 64 张以上加速器。原生 MXFP4 权重体积约为 1.5TB,是 DeepSeek-R1 671B 在 Q4 量化下约 407GB 的 3.7 倍。
如果只按存放权重所需显存简单换算,对应硬件数量大致为:
- H100(80GB):约 19 张
- H200(141GB):约 11 张
- B200(192GB):约 8 张
不过,这个计算还没有把 KV cache 计入。KV cache 用于保存对话上下文记忆,100 万 token 长上下文对应的 KV cache 需求,官方尚未公布。
采购成本超 240 万美元,用电达到机房级别
价格方面,H100 80GB PCIe 单卡约为 2.5 万至 3.3 万美元,SXM 版本在 3.5 万至 4 万美元以上。8 卡 H100 服务器单台价格超过 30 万美元。
按官方给出的 64 张门槛计算,相当于需要 8 台 8 卡服务器,仅硬件采购成本就超过 240 万美元,约合新台币 7,000 万以上。
功耗方面,H100 单张约 700W,64 张 GPU 的总功耗约为 45kW,已经远超一般家庭供电能力,属于机房级别的用电需求。
上一代 K2 家族仍有个人部署空间
与 K3 相比,上一代 K2 家族的本地部署难度明显低得多。K2 家族总参数约 1 兆,激活参数约 320 亿。社区为 K2 做出的 1.8 bit 极限量化版本,大约 247GB 即可勉强运行,一张 24GB 消费级显卡配合系统内存卸载也能启动。
此外,K2.5 需要超过 380GB 统一内存,K2.6 的 Q2 版本约需 350GB。按照文中对比,上一代模型还可以在一台 512GB 的 Mac Studio 上勉强运行,而 K3 的部署门槛已经回到数据中心级别。
对于普通用户,如果希望使用 Kimi K3,现阶段可选路径主要还是降级使用 K2 家族,或直接调用官方 API。

