英伟达(NVIDIA)今日宣布推出全新开源多模态大模型Nemotron 3 Nano Omni。这款模型打破以往依赖多个独立模型串联处理不同模态的瓶颈,能在单一模型内高效统一处理视频、音频、图像与文本,直指代理式AI(Agentic AI)的底层基础设施。
单模型统一处理:终结碎片化
过去开发一个能看懂文档、听懂语音、理解视频的AI代理,往往需要把独立的视觉模型、音频模型和语言模型硬凑在一起。这种碎片化链式结构协调复杂、推理成本高昂,更致命的是跨模态的上下文容易丢失或产生幻觉。Nemotron 3 Nano Omni将多模态感知和动作收敛到单一高效模型中,作为系统的多模态感知子代理,在单条感知-动作回路内无缝��理输入,大幅降低企业部署成本。
30B混合专家架构:激活仅3B,兼顾性能与效率
模型采用混合专家架构(Hybrid MoE),总参数量300亿(30B),但实际推理时激活参数仅约30亿(3B)。底层巧妙结合Mamba(专攻序列记忆与效率)与Transformer(专攻精准推理)两种架构。在MMLongbench-Doc、WorldSense等多项基准测试中,Nano Omni相比其他开源多模态模型,在相同交互阈值下视频推理系统容量提升9.2倍,多文档推理能力提升7.4倍。模型完美支持英伟达最新Blackwell GPU及NVFP4量化技术,并支持高达262K token的超长上下文窗口,专为企业级长时序视频处理和复杂文档推理量身定制。
彻底开源:权重、数据集、微调配方全公开
英伟达这次打出“Open by Design”旗号,不只提供模型权重,还在Hugging Face上同步公开了训练数据集(含经由NeMo Data Designer生成的合成数据)以及高价值的微调配方——涵盖SFT、强化学习RL、LoRA、GRPO等方法。模型已可于Hugging Face下载,并上线NVIDIA NIM微服务。英伟达强调,这一突破并非只为刷基准分数,而是针对真实代理工作负载的��质升级。金融、医疗分析、媒体娱乐等领域的开发者均可利用Nemotron 3 Nano Omni,搭配大型超级模型(如Nemotron 3 Ultra),组建模块化、强感知的企业AI代理系统。

