Higgsfield 使用真人演员形象 用 AI 拍摄了一部 110 分钟的完整故事影片 并公开了整本制作说明书和提示词方法
- 一部 1 小时 54 分的 AI 长片,把整套制作方法连同自用的三个 Claude 技能一起公开了。
- 整本手册只对付一件事:视频模型没有记忆,所以「让同一个人还是同一个人」就是全部工作。
- 最值钱的是那些反直觉的禁忌,设定表不许写 studio、全身图要去掉头、提示词不许写「不要」。
一部 AI 长片,把整本制作说明书公开了
过去两年,AI 视频基本停在几秒到几十秒,大家比的是画质、运镜和单个镜头够不够惊艳。Higgsfield(做 AI 视频生成平台的那家)这次拿出来的是另一种东西:一部 110 分钟的剧情长片,四位真人演员授权了肖像和声音,制作周期 4 周,成本 200 万美元。
他们同时还做了第二件事,对外宣布整部片子 100% 开源、所有提示词和资产现已公开。本站逐项点开核对下来,可直接下载的是三个 Claude 技能文件,其余材料分散在项目页正文和那张画布里,具体差在哪,文末那节写清楚了。
片子叫《The Cully Hill Boys》,动作喜剧,讲伦敦三个不得志的说唱歌手为了出名,误打误撞卷进一场毒品火并,8 月 5 日在纽约首映。
下面拆的是随片放出来的那份东西:一份完整的制作说明书。资产怎么建、提示词怎么写、表演怎么调、说唱段落怎么对口型、后期怎么盯梢,一路写到底,连他们自己用的三个 Claude 技能文件都给下载。
每一帧都是生成的,没有布景也没有摄制组,四位演员本人没有参与任何一次实拍,他们贡献的是被授权数字化的肖像和声音。全片只有一处例外,后面会讲到。
用什么做的:五个工具各管一段
全片的镜头、视频和人声,都在 Seedance 里生成。人脸和角色设定表交给 Soul Cinema。剪辑、反打镜头、视点变化用 Seedream 和 Nano Banana。
提示词全部由 Claude 写,而且刻意开两个聊天,一个只写图片提示词,一个只写视频提示词。理由是:一边的规矩会污染另一边。写图片那边需要平光、需要专门躲开 CG 味的措辞;写视频那边需要用度数写视场角、需要每一处光都有来源。混在一个聊天里,两套规矩会互相串味。
三个技能,按用到的顺序排
他们把常用规则打包成了 Claude 的技能,一份规则手册,Claude 自己加载,然后照着它干活。三个技能的 SKILL 文件都放出来了,文件名点开就能下(本文末尾也再列了一遍)。
另外四条,是从上一部片子里带过来的
这个团队之前做过一部叫 HELL GRIND 的片子,那次是一边做一边摸索出来的,这次开工第一天就已经在手上:
- 场景上下文:每个镜头开头先写清楚这一段戏剧上在发生什么、谁在场、多长。
- 首帧空间锁:第一帧就已经占好位,所有人各就各位,不要那种空荡荡的定场拍子。
- 每句台词后留一秒静音:片段内部留一条干净的尾巴,剪辑师得到一个接缝,而模型也没有空档去编造声音。
- 表情和表演逐拍写:脸和身体一拍一拍地写,不用形容词打发。
但所有规则都在对付一件事:模型没有记忆
这本手册厚成这样,起点却只有一句话:一致性就是全部工作。
视频模型没有记忆。你把人物描述得不全,下一个镜头他的长相、行为、声音就都变了。再加上空间会在镜头移动时散架、声音在片段之间漂移、场面丢掉方位关系,这些加起来,就是 AI 拍长片一路要对付的东西。
他们的基本盘是一句话:每个镜头由「参考 + 文字」生出来。资产负责画面,文字负责其余一切,包括几何关系,谁站在哪、机位在哪一侧、光往哪个方向打。
还有一条更硬的约束贯穿全片:只用文字生成视频,不给首帧,也不做图生视频。这条更难,但正因为如此,镜头之间才剪得到一起。
全片唯一一次破这条规矩,是凯迪拉克车里那场争枪的打斗:两个人一直在接触、抢同一把枪,生成出来的结果是四肢缠在一起、枪在这只手上消失又出现在另一只手上。最后他们请了特技演员编排动作,在真车里用手机拍了一天,把这段素材当运动参考喂进去,模型再把角色、内景和灯光叠上来。一天的手机素材,省掉了一周的反复重试。
一对东西:一段逐字进每条提示词的文字描述,加一张给模型锚定的参考图。角色、场地、道具各自都是资产。
像剧组的定妆照加人物小传,照片管长相,小传管性格和穿着,两样一起交给每个新来的摄影师。
而开拍前先把剧本拆成卡片
他们的拆本是把剧本变成一份已经把导演阐述装在里面的预备分镜表,而不只是列出要做哪些东西。每个镜头一张卡,卡上分四组。
| 卡上分组 | 写什么 |
|---|---|
| 素材 | 场地和内外景,以及覆盖它的那个资产;一天中的时间(因为它决定用哪个资产变体);画面里每个人,带标签和状态;道具车辆带标签;动作用一到三句话;台词逐字;时长多少秒;复杂度是简单、中等还是复杂 |
| 导演 | 本镜的目标,一句话;角色的任务用动词写,盘问、揭穿、羞辱;起止之间什么变了;相对摄影机的走位;表演上脸和身体做什么、角色在藏什么 |
| 摄影 | 景别、运动、镜头、角度 |
| 剪辑 | 用什么方式切、节奏多快、怎么接上下一个镜头 |
每张卡带着场次号加一个镜头字母,比如 50B、50C;同一个编号从卡片一路跟到版本日志和提示词文件,相邻两个镜头就永远不会被搞混。
这份版本日志最后记了 137 条,里面能看出哪些镜头反复重来过,最难的几个改到了 v15、v10、v9。没有这份记录,一个好镜头没法复现,也不知道某个修法自己是不是已经试过。
卡片填完,提示词几乎是机械地抄出来的。更要命的是窟窿会在花掉一次生成之前就露出来,一个没有目标的镜头、一个没有任务的角色、一场没有对应资产的戏,在卡片上一眼就看得见。
所以资产没锁死之前,一个镜头都不许拍
600 个审定资产的分项是这样的:主角和反派 74 张卡,配角与动物 52,只出现一两场的群众角色 90,道具 159,场地底图 200 多张。
