英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72

英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72

N
News Editor
2026-08-26 17:14:34
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得 GB300 NVL72 平台支持。该模型总参数规模为 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可借助 YaRN 扩展至 100 万 Token。英伟达披露,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒,同时支持 SGLang、vLLM 和 TensorRT-LLM。

英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得英伟达 GB300 NVL72 平台支持。

据英伟达披露,Qwen3.8-Flash-Next 总参数规模达 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可通过 YaRN 扩展至 100 万 Token,主要面向智能编程、文档处理及工具调用等长上下文 Agent 应用。

英伟达表示,该模型采用 Gated DeltaNet(GDN)与 Qwen Sparse Attention(QSA)混合架构,用于降低长上下文场景下的计算和 KV 缓存开销。测试显示,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒;同时支持 SGLang、vLLM 及 TensorRT-LLM 等推理框架。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
10

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。