缓存

腾讯混元
2026-08-28 07:32:42

腾讯混元Hy4重做底层:DeepSeek稀疏注意力配智谱IndexCache

腾讯混元 Hy4 preview 将底层架构从 Hy3 的全注意力改为 Gated DSA(DeepSeek 稀疏注意力的门控版),并叠加智谱 IndexCache,减少超长文本下的重复计算。腾讯称设计受 DeepSeek 和 GLM 启发。残差结构用 iHC 扩成 4 条信息主干,MoE 专家从 192 个增至 256 个路由专家+1 个共享专家,每 Token 选 8 个路由专家。

190
腾讯混元Hy4重做底层:DeepSeek稀疏注意力配智谱IndexCache
英伟达
2026-08-27 00:43:29

英伟达发布 NVHBM,AWS 将在 Trainium4 上率先采用

英伟达发布新一代定制高带宽内存技术 NVHBM,并将其纳入 NVLink Fusion 生态。AWS 旗下 Annapurna Labs 成为首个合作方,计划从下一代 Trainium4 开始全面支持相关技术。双方同时敲定一份涵盖 2027 至 2028 年、规模最高达 200 万颗顶级 GPU 的采购安排,涉及 Blackwell Ultra、Rubin 和 Rubin Ultra。

270
英伟达发布 NVHBM,AWS 将在 Trainium4 上率先采用
智谱
2026-08-27 00:47:05

智谱发布 GLM-5.3 Flash,称推理集群调用超 10 万张国产芯片

智谱发布轻量级旗舰模型 GLM-5.3 Flash,称其对标 DeepSeek V4 Flash,并由超过 10 万张国产芯片集群提供推理服务。该模型参数规模约 300B,采用 MoE 架构,实际激活参数约 18B,支持图像与视频输入。智谱表示,其综合评测分数超过上一代旗舰 GLM-5.2,与 Claude Opus 4.8 持平,并高于 DeepSeek V4 Pro 正式版相关分数。

240
智谱发布 GLM-5.3 Flash,称推理集群调用超 10 万张国产芯片
MiniMax
2026-08-27 00:22:08

MiniMax半年收入过亿美元,企业服务占比反超 AI 原生产品

MiniMax上市后首份半年财报显示,公司上半年收入为1.17亿美元,已超过2025年全年水平,但研发投入达到2.97亿美元,经调整净亏损为2.93亿美元。收入结构也在变化:开放平台及其他 AI 企业服务收入为7393万美元,占比升至63.4%;AI 原生产品收入为4264万美元,占比降至36.6%。在收入增长快于销售成本增长的情况下,MiniMax毛利率由12.1%升至17.9%。

260
MiniMax半年收入过亿美元,企业服务占比反超 AI 原生产品
英伟达
2026-08-26 17:14:34

英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72

英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得 GB300 NVL72 平台支持。该模型总参数规模为 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可借助 YaRN 扩展至 100 万 Token。英伟达披露,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒,同时支持 SGLang、vLLM 和 TensorRT-LLM。

220
英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72
OpenAI
2026-08-26 04:52:38

OpenAI称Jalapeño实测胜过英伟达GB300,但量产与对比条件仍有限制

OpenAI芯片负责人 Richard Ho 在斯坦福 Hot Chips 大会上表示,与 Broadcom 合作开发的推理芯片 Jalapeño 在实测中于功耗效率和响应速度上超过英伟达 GB300。该芯片今年 6 月发布,128 芯片系统提供 1.7 exaFLOPS 的 4 位算力,并配备 27.5 TB HBM4。彭博指出,这组成绩未与新一代 Vera Rubin 对比,且测试排除了推测解码,Jalapeño 目前也未披露实际功耗,2026 年仅有限量供应。

390
OpenAI称Jalapeño实测胜过英伟达GB300,但量产与对比条件仍有限制
OpenRouter
2026-08-25 07:17:08

OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍

OpenRouter 数据显示,截至 8 月 10 日,Agent 类 token 用量已从约 0.51 万亿升至 7.3 万亿,同期人类用量升至 1.4 万亿,智能体达到人类的 5.2 倍。平台依据 API key 的 7 项行为信号区分 Agentic、Mixed 和 Human 流量。文中还提到,智能体请求中近 70% 的 token 来自缓存提示,单价下降未能抵消总用量飙升带来的成本压力。

300
OpenRouter:AI 智能体 token 用量半年增至人类 5.2 倍