英特尔公司近日宣布,已在其人工智能工程师Haohao Shen的带领下,于Hugging Face平台正式发布了阿里巴巴旗下视频生成模型Wan2.2的三个INT4量化版本。这一举措旨在大幅降低模型推理时的显存占用,使更大规模的视频AI模型能够在消费级硬件上运行。
本次发布的量化模型包括T2V-A14B(文本到视频)、I2V-A14B(图像到视频)以及TI2V-5B(文本-图像-视频混合模型)。所有模型均采用英特尔的AutoRound量化工具集进行处理,将每个权重的精度从BF16格式的2字节压缩至INT4格式的0.5字节,从而使模型权重大小缩减至原来的约四分之一。
模型背景与显存需求
Wan2.2系列是阿里巴巴在视频生成领域的重要成果。其中A14B型号采用混合专家(MoE)架构,总参数量达270亿,每步激活参数为140亿。在未量化前,运行720p分辨率的推理至少需要80GB的GPU显存。而量化后的版本虽然具体显存占用数据尚未公布,但理论上可将需求压缩至20GB左右,使得搭载RTX 4090等高端消费级显卡的设备有望直接运行。
另一款模型TI2V-5B属于密集模型,原始版本即可在RTX 4090上以720p分辨率、24帧/秒的速度运行。经INT4量化后,其显存需求将进一步降低,为更多用户提供流畅的视频生成体验。
量化效果与部署建议
尽管英特尔官方宣称量化后模型在显存效率上取得突破,但截至发稿时,英特尔尚未公布任何关于显存占用或量化后图像质量的基准测试数据。因此,第三方独立验证对于评估模型实际表现至关重要。用户在使用前应充分了解潜在的风险与质量变化。
在部署方面,英特尔建议用户使用其维护的专属分支vllm-omni进行模型加载与推理,因为当前版本并未集成于vLLM主项目的通用推理管线中。这一分支针对INT4量化模型进行了优化,能够更好地发挥硬件潜力。
此次发布标志着英特尔在AI模型量化与部署领域的重要进展,也为视频生成技术的普及提供了新的可能性。随着更多硬件厂商和社区对量化技术的关注,未来消费级设备运行大规模AI模型的门槛有望进一步降低。

