英伟达称 Qwen3.8-Flash-Next 已支持 GB300 NVL72
英伟达发布文章称,阿里巴巴最新预览模型 Qwen3.8-Flash-Next 已获得 GB300 NVL72 平台支持。该模型总参数规模为 1760 亿,每 Token 激活约 60 亿参数,原生支持 26.2 万 Token 上下文,并可借助 YaRN 扩展至 100 万 Token。英伟达披露,在 GB300 NVL72 上,该模型单 GPU 吞吐量超过 1.6 万 Token/秒,单用户吞吐超过 200 Token/秒,同时支持 SGLang、vLLM 和 TensorRT-LLM。








