英特尔发布阿里Wan2.2视频模型INT4量化版,显存需求骤降75%

英特尔发布阿里Wan2.2视频模型INT4量化版,显存需求骤降75%

N
News Editor 01
2026-07-10 10:39:13
英特尔在Hugging Face推出三款阿里Wan2.2视频模型INT4量化版本(T2V-A14B、I2V-A14B、TI2V-5B),通过AutoRound工具将权重从BF16压缩至INT4,显存占用降至原四分之一,有望降低视频生成部署门槛,但尚需第三方验证性能。
英特尔阿里Wan2.2INT4量化视频生成

英特尔公司最新宣布,已在Hugging Face平台上发布三款基于阿里巴巴Wan2.2视频生成模型的INT4量化版本。据英特尔AI首席工程师Haihao Shen透露,这些模型包括T2V-A14B(文生视频)、I2V-A14B(图生视频)以及TI2V-5B(图文混合生视频),均采用AutoRound量化工具进行压缩。

量化技术细节

此次量化将模型权重从原来的BF16格式(每权重2字节)压缩至INT4格式(每权重0.5字节),使得权重尺寸缩减至原始的四分之一。以A14B系列为例,其原始模型采用MoE(混合专家)架构,总参数量达270亿,但每个步骤仅激活140亿参数。在720p分辨率下,原始模型至少需要每GPU 80GB显存。而INT4量化后,显存需求理论上可降至约20GB,极大降低了硬件门槛。

模型架构与性能

TI2V-5B作为密集模型,原本已可在单张RTX 4090 GPU上以24fps运行720p视频生成。量化后,其显存占用进一步下降,并可能支持更快的推理速度。不过,英特尔目前尚未公布具体的显存占用基准数据或视觉质量对比,因此第三方独立验证显得尤为关键。

部署与兼容性

英特尔建议用户使用其专有的vllm-omni分支进行模型部署,因为这些量化模型并不兼容主流的vLLM推理主线。这意味着开发者需要切换到英特尔维护的推理框架才能充分利用优化效果。这一限制可能影响社区的广泛采用,但同时也体现了英特尔在AI推理生态上的战略投入。

行业意义

视频生成模型正成为AI应用的热点,但庞大的显存需求阻碍了其在消费级硬件上的普及。英特尔此次推出的INT4量化版本,为降低部署成本提供了可行路径。如果第三方验证确认其画质损失可控,将有望推动视频生成模型走向边缘设备和中小企业场景。不过,投资者需注意,目前缺乏独立评测,且部署需专用框架,实际落地效果尚待观察。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。