HeyGen推Avatar V:15秒建数字分身,可生成无限AI视频

HeyGen推Avatar V:15秒建数字分身,可生成无限AI视频

N
News Editor 01
2026-07-23 20:45:16
HeyGen发布Avatar V,用户只需15秒自拍视频即可生成高拟真数字分身,并在175种语言中输出口型同步视频,已接入其付费订阅体系。
HeyGenAI视频数字分身Avatar V语音克隆

HeyGen 于 4 月 8 日发布 AI 视频工具 Avatar V。这款产品主打用一段 15 秒 的摄像头录像,生成用户面部、声音与动作风格的高拟真数字分身,并可据此持续生成“无限量”的棚拍质感视频,无需专业设备。

按官方披露,Avatar V 在 X 上的发布内容获得了 472,000 次浏览。产品的核心卖点不是单帧效果,而是身份一致性:系统会从一段短视频中提取用户的微表情、嘴唇几何、面部轮廓和自然动作,在后续生成的视频里保持同一人物特征,覆盖不同时长、镜头角度、服装和场景,试图解决早期 AI 虚拟人常见的“身份漂移”问题。

15 秒录像定义动作,照片定义外观

HeyGen 将 Avatar V 的设计拆成两层。第一层是身份建模,基于 15 秒视频建立所谓具备时间维度的身份嵌入,用来捕捉一个人的动作习惯、表情切换和整体存在感;第二层是外观参考,用户再选择一张基础照片作为后续所有视频场景的形象基准。这样一来,动作特征保持稳定,外观则可按提示词自由切换。

官方页面称,广角、中景和特写镜头都能从同一次录制中保持一致。录制过程也没有棚灯或团队门槛,手机或普通网络摄像头即可完成。

支持175种语言口型同步,语音克隆为可选项

实际使用流程分为三步:先录制 15 秒 视频,再按需单独录制语音克隆,最后选定一张基础照片作为身份参考。完成这些步骤后,用户可以通过文本提示词生成新的服装、场景和风格,也可以直接调用 HeyGen 的素材库。

视频输出支持 175 种语言,并带有对应目标语言的口型同步。语音克隆并非强制,但 HeyGen 建议用户启用这一选项,以获得更强的真实感。公司还提醒,录制时表情和动作越有表现力,最终生成结果越贴近预期。

已成平台底层模型,并接入 Seedance 2.0

HeyGen 表示,Avatar V 已成为其平台其他功能运行的基础模型,并已与 Seedance 2.0 集成,用于生成更具电影感的视频内容。该功能目前已在 HeyGen 的付费订阅层级中提供,用户可同时调用模板、翻译和工作室工具。

官方对这款产品的表述很直接:输出结果必须达到用户愿意署上自己名字的水平,而不是“对 AI 来说已经不错”。从产品定位看,HeyGen 想把 Avatar V 做成其 AI 视频工作流的底座,重点放在长视频中的人物稳定性,而不是短演示片段里的瞬时观感。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。