AI 视频生成平台 Higgsfield 已将 95 分钟 AI 电影《Hell Grind》整包开源,公开内容包括完整提示词、角色模型、场景素材、迭代版本,以及一支 19 分钟的幕后拆解视频。官方还同步提供了一套打包为 Claude Skill 的提示词工具。
这次公开的重点之一,是把片中最大的一场打斗戏从零重建一遍。提示词如何修改、修改了多少次、哪些版本失败,官方都一并展示。对想用 AI 制作视频的人来说,团队在生成流程中的踩坑、写坏的提示词,以及后续修正方式,都被完整摊开。
14 天完成,成本接近 50 万美元
《Hell Grind》由一个 15 人团队在哈萨克斯坦阿拉木图制作,耗时 14 天,总成本接近 50 万美元。其中将近 8 成、约 40 万美元用于 GPU 云端算力,其余约 2 成为人力成本。
Higgsfield 首席执行官 Alex Mashrabov 将整个生成过程形容为“有种吃角子老虎机的感觉”。最终片中 253 个可用镜头,是从 16,181 次生成结果中筛选出来,比例约为 64 比 1。
官方还提到,这次开源也与 Higgsfield 自行举办的 Higgsfield Global Film Festival 有关。该活动总奖金额为 100 万美元,首奖为 50 万美元。
开源包公开了哪些内容
根据官方开源项目页,整套资料覆盖每一句提示词、每一份素材以及每一次迭代版本。官方表示,理论上任何人都可以依照这些内容重建整部作品,前提是愿意承担相应成本。
所有角色、场景和素材被整理在同一工作区中,使用时无需在多个文件夹之间来回查找。官方同时打包了一支 Claude Skill,用户点击加号并上传文件后,大约 30 秒即可调用。
这套 Skill 生成的提示词采用固定的四段式结构:
- 先用简单锚点标记素材,例如 @Roco、@Monster,并为每个标记绑定简短外观描述和参考图,减少模型猜测。
- 再把空间坐标锁定到以米为单位的尺度。
- 接着把动作拆成以秒计的时间码。
- 最后加入一条严格规则,限制模型自行补写未定义内容。
正式生成前,先把角色和场景定装
在正式生成镜头之前,团队先处理会反复出场的角色和场景,先把它们“定装”。
这一步会写清角色的发型、脸部特征、穿着等基础造型。怪物设定也被固定为 4 米高、骷髅脸、红水晶刀刃、没有右手,骨头从手肘直接长成刀刃。官方认为,细节越明确,模型越容易在多次生成中识别并维持同一个角色。
提示词怎么写,模型才不会一路跑偏
团队给出的第一条原则,是描述镜头运动时不要依赖形容词,而要使用比较级和明确数字。比如不写“镜头快一点”,而是写“比典型电影推轨快 3 倍”;环绕轨道则直接写成从 8 米推进到 4 米,高度从 3 米降到 2 米;怪物变身时长也直接给出 0.4 秒。
按官方说法,视频模型并不擅长理解“戏剧性”这类抽象词,数字比修饰词更有效。
群体规模的处理方式也类似。团队不会直接堆出一个总人数,而是采用三层结构:前景放一名清晰战士,中间放密集人群,后方再加入雾中的剪影。实际清晰可见的人数大约只有 40 人,其余由观众自行补全。浓雾还被当作一种除错手段,把能见度压到 20 米后,背景中生成失稳的部分也会被遮住。官方补充称,现在模型在 4K 背景生成上的稳定性已经提高,这一做法的重要性有所下降,但在画面元素很多时仍然有效。
动作设计也被拆成半秒级步骤。以前景武士起身为例,团队把动作写成手部 0.5 秒、头盔 1.5 秒、站直 3 秒,让时间点固定下来,避免模型抢拍或跳过中间阶段。
另一个操作纪律很直接:每次至少跑 4 段生成。这样才能区分是随机失误,还是提示词本身有问题。官方认为,分清“坏提示词”和“坏手气”,是节省算力额度的关键。
这场戏的生成设置也一并公开:模型固定为 CS 2.0,单段长度 15 秒,每次输出 4 段,没有隐藏设置。
最贵的一课:不要指望模型理解“不要”
官方称,这次项目里代价最高的一课,不是怎么写提示词,而是哪些写法不该用。
片中怪物右手的一个镜头,提示词明写“没有手持物、没有刀柄”,但模型依旧生成了一只手握着剑。团队后来改成正向描述,要求手臂抬高,并让画面清楚显示那个位置什么都没有,问题才被解决。
还有一次更昂贵的试错,是整场打斗戏看起来像“电子游戏过场动画”。团队连续十几次写下“不是游戏”“不要 CGI”,但模型并不能正确理解否定表达,只捕捉到句子中的“游戏”等关键词,结果继续生成带有游戏感的画面。
团队后来的修正有两步。第一步是把禁令改为正向描述,不再写“不要廉价特效”,而是明确说明希望出现什么样的光线和材质。第二步是把单镜头长镜改成多镜剪接,因为一镜到底本来就是电子游戏常见表现形式,而电影会剪切镜头。团队最后让模型“切四刀”,分别配置 50mm 环绕、24mm 低角度、85mm 特写和 35mm 广角四组镜位。
跨镜衔接也被写入硬规则:第一镜结尾的姿势,必须等于第二镜开头的姿势。否则 AI 会把剪接点当成全新场景,人物姿势会直接归零重来。
打击感的设计同样被写成物理描述。团队不写“时间变慢”,而是把两把刀的距离按秒精确到厘米,同时写清碰撞角度,再加入一条规则:水晶永远赢钢铁。这样模型就会让钢刀碎裂并喷出火花。
官方总结:重点不是神级提示词,而是局部修正
官方最后总结称,这套工作流真正的技术点,不在于一次写出一句“天才提示词”,而在于看懂问题出在哪里,然后只修那一部分。片中不少镜头,实际就是从同一批生成结果中选出两个不同片段,再剪到一起完成。

