2.78 万亿参数 Kimi K3 压进 8GB 内存:开发者开源纯 CPU 推理方案

2.78 万亿参数 Kimi K3 压进 8GB 内存:开发者开源纯 CPU 推理方案

N
News Editor
2026-08-08 06:24:42
开发者开源 kimi-k3-in-c,让 2.78 万亿参数的 Kimi K3 在 8GB 内存设备上仅靠 CPU 完成推理。项目仅 176KB,纯 C99 编写,不依赖 GPU 与 CUDA,利用 MoE 每层仅激活 16 个专家的特性,将大部分权重放在 NVMe 硬盘按需读取。当前生成一个 token 约需 32.7 秒,开发者称仅为实验探索,暂无生产价值。

8 月 8 日,开发者开源了项目 kimi-k3-in-c,目标是让拥有 2.78 万亿参数的 Kimi K3 模型在 8GB 内存的设备上完成模型推理。整个工程只有 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,仅靠 CPU 就能跑。

这个方案能成立,靠的是 Kimi K3 的 MoE(混合专家)架构特性。模型总参数规模达到 2.78T,但每一层的 896 个专家中,推理时只会激活 16 个——大部分权重其实用不上。因此,开发者没有把完整的约 1.56TB 模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,根据模型当前的推理需求实时读取;部分密集层(dense trunk)也采用了逐层流式加载的方式。

性能上的限制同样明显。在 8GB 内存模式下,模型生成一个 token 大约需要 32.7 秒,同时对存储的要求也不低——需要接近 1.7TB 的高速存储空间支持。

开发者表示,这一方案目前更像是对大模型推理基础设施优化方向的一次实验探索,并不具备实际生产使用价值。但通过"硬盘流式加载 + MoE 稀疏激活"的方式,它为未来低成本运行超大规模模型提供了一种新思路。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
860

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。