Kimi K3 本地部署门槛升至 64 张 GPU,功耗约 45kW

Kimi K3 本地部署门槛升至 64 张 GPU,功耗约 45kW

N
News Editor
2026-07-19 04:56:59
月之暗面本周发布开源权重模型 Kimi K3,总参数达 2.8 兆,完整权重预计于 7 月 27 日前上线。官方部署指引显示,自行部署至少需要 64 张加速器,原生 4 bit 权重约 1.4TB 至 1.5TB。仅按权重存放计算,H100 80GB 约需 19 张、H200 约 11 张、B200 约 8 张,若按官方门槛配置,硬件采购成本已超过 240 万美元。
Kimi K3月之暗面Moonshot AI开源模型GPU本地部署人工智能

月之暗面本周发布 Kimi K3。这款模型总参数达到 2.8 兆,被介绍为史上最大的开源权重模型,完整权重预计将在 7 月 27 日前上架。

按官方披露的数据,仅把 2.8 兆参数以原生 4 bit 格式(MXFP4)存入硬盘,就需要约 1.4TB 到 1.5TB 空间,这还不包括实际推理所需资源。对普通用户而言,本地运行门槛已经很高。

Kimi K3 权重预计 7 月 27 日前开放

月之暗面表示,Kimi K3 的完整开源权重将于 7 月 27 日前上架,采用 Modified-MIT 授权,允许用户自行部署。截稿时,完整权重和社区量化版本,例如 GGUF,仍未出现。

采用 MoE 架构,激活参数约 500 亿到 600 亿

Kimi K3 采用 MoE(混合专家)架构。模型内部包含 896 个“专家”子网络,在每次处理一个 token 时,系统只会从中选择 16 个路由专家,再加上共享专家参与计算,而不是让全部专家同时运行。因此,模型实际处于激活状态的参数约为 500 亿到 600 亿。

这款模型还采用 Kimi Delta Attention(KDA)架构,并配合 Attention Residuals。按照官方说法,在百万 token 长上下文条件下,解码速度最高可提升 6.3 倍,上下文窗口达到 100 万 token,同时原生支持视觉输入。

官方部署指引:至少 64 张加速器

月之暗面的官方部署指引写明,自行部署 K3 至少需要 64 张以上加速器。原生 MXFP4 权重体积约为 1.5TB,是 DeepSeek-R1 671B 在 Q4 量化下约 407GB 的 3.7 倍。

如果只按存放权重所需显存简单换算,对应硬件数量大致为:

  • H100(80GB):约 19 张
  • H200(141GB):约 11 张
  • B200(192GB):约 8 张

不过,这个计算还没有把 KV cache 计入。KV cache 用于保存对话上下文记忆,100 万 token 长上下文对应的 KV cache 需求,官方尚未公布。

采购成本超 240 万美元,用电达到机房级别

价格方面,H100 80GB PCIe 单卡约为 2.5 万至 3.3 万美元,SXM 版本在 3.5 万至 4 万美元以上。8 卡 H100 服务器单台价格超过 30 万美元。

按官方给出的 64 张门槛计算,相当于需要 8 台 8 卡服务器,仅硬件采购成本就超过 240 万美元,约合新台币 7,000 万以上。

功耗方面,H100 单张约 700W,64 张 GPU 的总功耗约为 45kW,已经远超一般家庭供电能力,属于机房级别的用电需求。

上一代 K2 家族仍有个人部署空间

与 K3 相比,上一代 K2 家族的本地部署难度明显低得多。K2 家族总参数约 1 兆,激活参数约 320 亿。社区为 K2 做出的 1.8 bit 极限量化版本,大约 247GB 即可勉强运行,一张 24GB 消费级显卡配合系统内存卸载也能启动。

此外,K2.5 需要超过 380GB 统一内存,K2.6 的 Q2 版本约需 350GB。按照文中对比,上一代模型还可以在一台 512GB 的 Mac Studio 上勉强运行,而 K3 的部署门槛已经回到数据中心级别。

对于普通用户,如果希望使用 Kimi K3,现阶段可选路径主要还是降级使用 K2 家族,或直接调用官方 API。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。