腾讯混元Hy4重做底层:DeepSeek稀疏注意力配智谱IndexCache
腾讯混元 Hy4 preview 将底层架构从 Hy3 的全注意力改为 Gated DSA(DeepSeek 稀疏注意力的门控版),并叠加智谱 IndexCache,减少超长文本下的重复计算。腾讯称设计受 DeepSeek 和 GLM 启发。残差结构用 iHC 扩成 4 条信息主干,MoE 专家从 192 个增至 256 个路由专家+1 个共享专家,每 Token 选 8 个路由专家。

腾讯混元 Hy4 preview 将底层架构从 Hy3 的全注意力改为 Gated DSA(DeepSeek 稀疏注意力的门控版),并叠加智谱 IndexCache,减少超长文本下的重复计算。腾讯称设计受 DeepSeek 和 GLM 启发。残差结构用 iHC 扩成 4 条信息主干,MoE 专家从 192 个增至 256 个路由专家+1 个共享专家,每 Token 选 8 个路由专家。

腾讯公布Hy4 preview真实工程盲测:163名内部专家在203个任务中给出2.99/4均分,高于GLM-5.3的2.92/4与Kimi K3的2.94/4。价格方面,每百万Token输出18元,比GLM-5.3便宜约36%、比Kimi K3便宜82%,缓存命中价也低85%。

英伟达发布新一代定制高带宽内存技术 NVHBM,并将其纳入 NVLink Fusion 生态。AWS 旗下 Annapurna Labs 成为首个合作方,计划从下一代 Trainium4 开始全面支持相关技术。双方同时敲定一份涵盖 2027 至 2028 年、规模最高达 200 万颗顶级 GPU 的采购安排,涉及 Blackwell Ultra、Rubin 和 Rubin Ultra。

智谱发布轻量级旗舰模型 GLM-5.3 Flash,称其对标 DeepSeek V4 Flash,并由超过 10 万张国产芯片集群提供推理服务。该模型参数规模约 300B,采用 MoE 架构,实际激活参数约 18B,支持图像与视频输入。智谱表示,其综合评测分数超过上一代旗舰 GLM-5.2,与 Claude Opus 4.8 持平,并高于 DeepSeek V4 Pro 正式版相关分数。

MiniMax上市后首份半年财报显示,公司上半年收入为1.17亿美元,已超过2025年全年水平,但研发投入达到2.97亿美元,经调整净亏损为2.93亿美元。收入结构也在变化:开放平台及其他 AI 企业服务收入为7393万美元,占比升至63.4%;AI 原生产品收入为4264万美元,占比降至36.6%。在收入增长快于销售成本增长的情况下,MiniMax毛利率由12.1%升至17.9%。

英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得 GB300 NVL72 平台支持。该模型总参数规模为 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可借助 YaRN 扩展至 100 万 Token。英伟达披露,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒,同时支持 SGLang、vLLM 和 TensorRT-LLM。

OpenAI芯片负责人 Richard Ho 在斯坦福 Hot Chips 大会上表示,与 Broadcom 合作开发的推理芯片 Jalapeño 在实测中于功耗效率和响应速度上超过英伟达 GB300。该芯片今年 6 月发布,128 芯片系统提供 1.7 exaFLOPS 的 4 位算力,并配备 27.5 TB HBM4。彭博指出,这组成绩未与新一代 Vera Rubin 对比,且测试排除了推测解码,Jalapeño 目前也未披露实际功耗,2026 年仅有限量供应。

OpenRouter 数据显示,截至 8 月 10 日,Agent 类 token 用量已从约 0.51 万亿升至 7.3 万亿,同期人类用量升至 1.4 万亿,智能体达到人类的 5.2 倍。平台依据 API key 的 7 项行为信号区分 Agentic、Mixed 和 Human 流量。文中还提到,智能体请求中近 70% 的 token 来自缓存提示,单价下降未能抵消总用量飙升带来的成本压力。
