英特尔公司最新宣布,已在Hugging Face平台上发布三款基于阿里巴巴Wan2.2视频生成模型的INT4量化版本。据英特尔AI首席工程师Haihao Shen透露,这些模型包括T2V-A14B(文生视频)、I2V-A14B(图生视频)以及TI2V-5B(图文混合生视频),均采用AutoRound量化工具进行压缩。
量化技术细节
此次量化将模型权重从原来的BF16格式(每权重2字节)压缩至INT4格式(每权重0.5字节),使得权重尺寸缩减至原始的四分之一。以A14B系列为例,其原始模型采用MoE(混合专家)架构,总参数量达270亿,但每个步骤仅激活140亿参数。在720p分辨率下,原始模型至少需要每GPU 80GB显存。而INT4量化后,显存需求理论上可降至约20GB,极大降低了硬件门槛。
模型架构与性能
TI2V-5B作为密集模型,原本已可在单张RTX 4090 GPU上以24fps运行720p视频生成。量化后,其显存占用进一步下降,并可能支持更快的推理速度。不过,英特尔目前尚未公布具体的显存占用基准数据或视觉质量对比,因此第三方独立验证显得尤为关键。
部署与兼容性
英特尔建议用户使用其专有的vllm-omni分支进行模型部署,因为这些量化模型并不兼容主流的vLLM推理主线。这意味着开发者需要切换到英特尔维护的推理框架才能充分利用优化效果。这一限制可能影响社区的广泛采用,但同时也体现了英特尔在AI推理生态上的战略投入。
行业意义
视频生成模型正成为AI应用的热点,但庞大的显存需求阻碍了其在消费级硬件上的普及。英特尔此次推出的INT4量化版本,为降低部署成本提供了可行路径。如果第三方验证确认其画质损失可控,将有望推动视频生成模型走向边缘设备和中小企业场景。不过,投资者需注意,目前缺乏独立评测,且部署需专用框架,实际落地效果尚待观察。

