返回混合架构

混合架构

英伟达
2026-08-26 17:14:34

英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72

英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得 GB300 NVL72 平台支持。该模型总参数规模为 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可借助 YaRN 扩展至 100 万 Token。英伟达披露,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒,同时支持 SGLang、vLLM 和 TensorRT-LLM。

250
英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72
智谱
2026-08-26 14:35:00

智谱发布 GLM-5.3-Flash,称以十分之一成本实现接近 Opus 能力

据 Z.ai 官网,智谱推出原生多模态大模型 GLM-5.3-Flash,总参数 3200 亿、激活参数 180 亿。官方称,该模型在编码与智能体基准上明显优于 GLM-5.2,能力接近 Claude Opus 4.8,价格约为后者的十分之一;同时通过新架构与 30 万亿多模态语料,将长上下文推理成本降至约 GLM-5.3 的三分之一。

170
智谱发布 GLM-5.3-Flash,称以十分之一成本实现接近 Opus 能力
台积电
2026-08-19 04:53:59

台积电 A16 背面供电平台完成验证,NVIDIA Feynman 确认采用

韩媒 Etnews 报道称,台积电已完成搭载超级电源轨(SPR)背面供电网络的 A16 制程平台开发与验证,并保留既有设计生态兼容性。报道指出,A16 相比 N2P 可在相同功耗下提升 8% 至 10% 运算速度,或在相同速度下降低 15% 至 20% 功耗,芯片密度提升 8% 至 10%。NVIDIA 次世代 AI 加速器平台 Feynman 已确认采用该制程,目标在 2028 年下半年量产。

690
台积电 A16 背面供电平台完成验证,NVIDIA Feynman 确认采用
TRON
2026-08-11 05:42:00

TRON 周报:BTC 关注 65400 美元阻力,Sealcoin 与 STRATO 成本周观察重点

TRON 发布 2026 年 8 月 3 日至 8 月 9 日行业周报,称加密市场本周震荡修复,BTC 自约 62500 美元反弹至 64900 至 65100 美元区间,市场继续围绕美联储政策预期与宏观数据定价。周报还梳理了美国、印度和欧盟监管进展,并重点分析机器经济基础设施 Sealcoin 与面向机构及 RWA 场景的区块链操作系统 STRATO。

1470
TRON 周报:BTC 关注 65400 美元阻力,Sealcoin 与 STRATO 成本周观察重点
摩根士丹利
2026-08-10 08:49:58

摩根士丹利推演开放权重模型冲击:AI 算力需求未必见顶

摩根士丹利在 8 月 3 日报告中提出,开放权重模型降低的是单次调用成本和部署门槛,不一定压低整体算力需求。报告认为,随着 AI 进入更多企业工作流、私有云、机房和边缘设备,调用量增长可能超过效率提升。其同时推演闭源主导、混合共存和开放主导三种情景,并指出 NVIDIA、现场电力与安全软件在不同情景下都属于相对明确的受益方向。

1410
摩根士丹利推演开放权重模型冲击:AI 算力需求未必见顶
吴说区块链
2026-08-02 23:47:17

白线:Kimi 开源权重后,AI 产业的利润将流向哪里

《白线 WhiteLine》在最新一期节目中围绕 Kimi K3 开放模型权重展开讨论。节目指出,API 标价下降不等于任务总成本下降,免费开放权重也不意味着运行模型没有成本。内容还提到,Moonshot 对规模化分发仍保留商业谈判空间,未来开放与闭源模型或将分层共存,而开源模型带来的 Token 增长是否足以覆盖价格下行,将决定半导体需求能否持续扩张。

1080
白线:Kimi 开源权重后,AI 产业的利润将流向哪里