MiniMax 发布全模态模型 H3,称 2K 视频生成成本降至同级三分之一

MiniMax 发布全模态模型 H3,称 2K 视频生成成本降至同级三分之一

N
News Editor
2026-07-31 03:52:34
MiniMax 于 7 月 31 日发布新一代全模态生成模型 H3,并表示将于近日开源模型权重。该模型支持文字、图片、音频、视频混合输入,可一次生成音画同步的 2K 视频。官方称其 2K 视频生成价格为每秒 0.8 元人民币,15 秒内容约 12 元,并主打 Omni-Reference 多模态参考、视频编辑、多镜头叙事与动作迁移等能力。

MiniMax 在 7 月 31 日发布全模态生成模型 H3(海螺 Hailuo 3.0),并表示将在近日开源模型权重。这是该公司继 6 月开源文字模型 M3 之后,又一次对外公布新模型进展。

按照 MiniMax 的说法,H3 的定位已经从专用任务模型,转向通用多模态智能。与将生图、生成视频、生成音频、编辑和参考能力拆分不同,H3 试图在文字、图片、视频、声音混合的语境中,统一理解用户输入,再完成生成。

官方称 2K 视频生成成本为每秒 0.8 元

MiniMax 公布的价格数据显示,H3 在 2K 分辨率下的视频生成成本为每秒 0.8 元人民币,生成一段 15 秒视频约需 12 元人民币。官方称,这一价格约为同级旗舰模型的三分之一。

MiniMax 官方账号当天还发文称,H3 已登陆 Runway,并写道开源权重“coming soon”。

支持图像、视频、音频混合输入

在输入端,H3 支持文字、图片、音频、视频,并允许混合输入。输出端则支持原生 2K 分辨率、24 帧、时长 5 到 15 秒的音画同步内容。按照官方介绍,图像和声音由同一次生成完成,而不是先生成画面、再单独补配声音。

H3 的一项核心功能是 Omni-Reference 全模态参考。单次生成最多可加入 9 张参考图、3 段参考视频和 3 段参考音频,用于指定风格、角色、动作或音色。MiniMax 表示,这些参考内容不会被模型当作必须照搬的关键帧,模型仍保留自身的生成和解释空间。

覆盖视频生成、编辑和动作迁移

功能方面,H3 支持文生视频、图生视频、多镜头叙事、指令式编辑,以及 V2V Motion Transfer。后者指的是把一段视频中的动作迁移到另一个角色身上。

MiniMax 在应用场景中列出的方向包括广告、品牌营销、电商、产品设计、UI/UX 和游戏。其表述中使用了“商业级生产”这一说法,而非仅强调生成视频。

榜单表现与开源进度仍待验证

就生成效果而言,MiniMax 自称排名第一的项目是“视频编辑”这一子项,而不是综合视频生成。

同一份 Artificial Analysis 榜单截至 7 月的数据显示,字节跳动于今年 2 月发布的 Seedance 2.0 仍以 1,213 Elo 领先含声音视频榜,在图生视频盲测中则以 1,344 Elo 位列第一。Google Veo 3.1 被视为综合表现最强;快手可灵 Kling 3.0 则在 llm-stats 视频竞技场中以 2,023 分居冠。

至于开源,MiniMax 目前给出的表述仍是“近日”,模型权重尚未出现在 Hugging Face 上。H3 的实际表现是否能支撑其定位,还要等权重上线以及第三方跑分结果公布后,才会更清楚。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
680

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。