2.78 万亿参数 Kimi K3 压进 8GB 内存:开发者开源纯 CPU 推理方案
开发者开源 kimi-k3-in-c,让 2.78 万亿参数的 Kimi K3 在 8GB 内存设备上仅靠 CPU 完成推理。项目仅 176KB,纯 C99 编写,不依赖 GPU 与 CUDA,利用 MoE 每层仅激活 16 个专家的特性,将大部分权重放在 NVMe 硬盘按需读取。当前生成一个 token 约需 32.7 秒,开发者称仅为实验探索,暂无生产价值。

开发者开源 kimi-k3-in-c,让 2.78 万亿参数的 Kimi K3 在 8GB 内存设备上仅靠 CPU 完成推理。项目仅 176KB,纯 C99 编写,不依赖 GPU 与 CUDA,利用 MoE 每层仅激活 16 个专家的特性,将大部分权重放在 NVMe 硬盘按需读取。当前生成一个 token 约需 32.7 秒,开发者称仅为实验探索,暂无生产价值。

Anthropic证实正在组建自研芯片团队,并在官方招聘页面发布 silicon engineer 与 technical program manager, silicon 两个岗位。其中,silicon engineer 年薪区间为 32 万至 48.5 万美元,明确要求候选人具备实际流片和量产经验。公司表示仍将维持多芯片策略,在继续使用 Google TPU、Amazon Trainium 和 Nvidia GPU 的同时推进自研设计。

SK 海力士与闪迪通过 OCP 发布首份 HBF 技术规范,明确了容量、带宽和接口标准。HBF 的定位不是替代 HBM,而是在 HBM 与 SSD 之间增加一层更靠近 xPU 的存储。文章认为,MoE 模型可能成为首批应用场景,但 HBF 相关产品仍处在送样前阶段,短期更应关注闪迪财报、NAND 价格、数据中心业务、利润率和企业级 SSD 进展。

阿里巴巴旗下 Qwen 团队发布新旗舰模型 Qwen3.8-Max,官方称其在 OSWorld-Verified 测试中拿下 86.1 分,高于 GPT-5.6 Sol Max 和 Fable 5。公司同时披露多项评测分数、2.4 兆参数 MoE 架构、100 万 token 上下文窗口,并预告下周开放 Qwen3.8-Max 与 Qwen3.8-27B 权重。不过,这些成绩与演示目前均来自官方自评,尚未经过第三方独立验证,开源授权条款也还未公布。

PANews 日报汇总多项加密与市场动态。美国参议院暂时搁置 Clarity 法案,优先处理官员提名与俄罗斯制裁议程,参议院最早或在下周推进表决程序;贝莱德、富兰克林邓普顿等机构公开表态支持。X Money 已开始向美国 Premium 与 Premium+ 订阅者推出。另有韩国拟将个人单股杠杆投资比重限制在 20% 以内,Hyperliquid 则就 SK 海力士永续合约异常波动称,合约部署和运营方 Trade.xyz 正在调查。

7 月 27 日,市场消息集中在科技与加密交叉领域。碧桂园此前以原价清仓长鑫股权,若持有至今回报可达 23 倍;长鑫上市首日收涨 465.8%,总市值达 3.28 万亿元。Circle 宣布收购 IBM 区块链专利组合,涉及 680 余个专利族和近 1000 项已授权专利。与此同时,Kimi K3 开放权重多模态模型发布,美国《数字资产市场清晰法案》进入关键窗口期,Hyperliquid 上 HYPE 解质押与头部巨鲸浮亏数据也受到关注。

Kimi.ai 团队在开放 Kimi K3 模型权重和技术报告的同时,继续开源多项底层基础设施,包括分布式 MoE 训练通信库 MoonEP、与 kvcache-ai 合作开发的 AgentENV,以及基于 CUTLASS 的高性能内核 FlashKDA。官方表示,这些组件可降低大规模 MoE 与智能体强化学习训练中的通信和推理开销,并可作为 flash-linear-attention 的即插即用后端使用。

Mira Murati 离开 OpenAI 两年后,旗下 Thinking Machines Lab 上周公开首个模型 Inkling。该模型采用 MoE 架构,总参数 9750 亿、推理激活参数 410 亿,支持文本、图像和音频输入,上下文窗口达 100 万 token,并以 Apache 2.0 许可证在 Hugging Face 提供完整权重。Decrypt 评测认为,它是西方实验室从零训练后发布的最强开源模型之一,但在编码、逻辑、创意写作和内容审查等多项实测里表现并不均衡。
