8 月 8 日,开发者开源了项目 kimi-k3-in-c,目标是让拥有 2.78 万亿参数的 Kimi K3 模型在 8GB 内存的设备上完成模型推理。整个工程只有 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,仅靠 CPU 就能跑。
这个方案能成立,靠的是 Kimi K3 的 MoE(混合专家)架构特性。模型总参数规模达到 2.78T,但每一层的 896 个专家中,推理时只会激活 16 个——大部分权重其实用不上。因此,开发者没有把完整的约 1.56TB 模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,根据模型当前的推理需求实时读取;部分密集层(dense trunk)也采用了逐层流式加载的方式。
性能上的限制同样明显。在 8GB 内存模式下,模型生成一个 token 大约需要 32.7 秒,同时对存储的要求也不低——需要接近 1.7TB 的高速存储空间支持。
开发者表示,这一方案目前更像是对大模型推理基础设施优化方向的一次实验探索,并不具备实际生产使用价值。但通过"硬盘流式加载 + MoE 稀疏激活"的方式,它为未来低成本运行超大规模模型提供了一种新思路。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

