工具教程 · 小互解读

Higgsfield 使用真人演员形象 用 AI 拍摄了一部 110 分钟的完整故事影片 并公开了整本制作说明书和提示词方法

Higgsfield Studio 把《The Cully Hill Boys》的资产、提示词、表演、对口型全套方法摊开,连自用的三个 Claude 技能都给下载
一分钟速览
  • 一部 1 小时 54 分的 AI 长片,把整套制作方法连同自用的三个 Claude 技能一起公开了。
  • 整本手册只对付一件事:视频模型没有记忆,所以「让同一个人还是同一个人」就是全部工作。
  • 最值钱的是那些反直觉的禁忌,设定表不许写 studio、全身图要去掉头、提示词不许写「不要」。
⚑ 素材是制作方自己写的项目说明,片长、资产数、效果全为自述,没有第三方复核。文中标注的核对结果与缺口由本站补出。原页面为动态页,抓取工具取不到正文,完整文本由读者提供。
开篇

一部 AI 长片,把整本制作说明书公开了

过去两年,AI 视频基本停在几秒到几十秒,大家比的是画质、运镜和单个镜头够不够惊艳。Higgsfield(做 AI 视频生成平台的那家)这次拿出来的是另一种东西:一部 110 分钟的剧情长片,四位真人演员授权了肖像和声音,制作周期 4 周,成本 200 万美元

他们同时还做了第二件事,对外宣布整部片子 100% 开源、所有提示词和资产现已公开。本站逐项点开核对下来,可直接下载的是三个 Claude 技能文件,其余材料分散在项目页正文和那张画布里,具体差在哪,文末那节写清楚了。

片子叫《The Cully Hill Boys》,动作喜剧,讲伦敦三个不得志的说唱歌手为了出名,误打误撞卷进一场毒品火并,8 月 5 日在纽约首映。

下面拆的是随片放出来的那份东西:一份完整的制作说明书。资产怎么建、提示词怎么写、表演怎么调、说唱段落怎么对口型、后期怎么盯梢,一路写到底,连他们自己用的三个 Claude 技能文件都给下载。

《The Cully Hill Boys》电影海报
官方海报。顶上那行小字写着「全 AI 生成的长片,名人出演」,下面署的是四位出演者的名字。
137 场戏
片长 1 小时 54 分,8 月 5 日纽约首映
600 个
画布上通过审定的资产,角色、场地、道具都算
约 150 条
提示词库里的命名锁,其中约 80 句以「= 废镜头」结尾

每一帧都是生成的,没有布景也没有摄制组,四位演员本人没有参与任何一次实拍,他们贡献的是被授权数字化的肖像和声音。全片只有一处例外,后面会讲到。

完整影片就挂在官方那条发布推文,可以直接看完;所有提示词和资产在项目页上。本站核对过那段视频文件:时长 1 小时 54 分 53 秒,2.08 GB,「110 分钟」是对外取整的说法。

工具

用什么做的:五个工具各管一段

全片的镜头、视频和人声,都在 Seedance 里生成。人脸和角色设定表交给 Soul Cinema。剪辑、反打镜头、视点变化用 SeedreamNano Banana

提示词全部由 Claude 写,而且刻意开两个聊天,一个只写图片提示词,一个只写视频提示词。理由是:一边的规矩会污染另一边。写图片那边需要平光、需要专门躲开 CG 味的措辞;写视频那边需要用度数写视场角、需要每一处光都有来源。混在一个聊天里,两套规矩会互相串味。

三个技能,按用到的顺序排

他们把常用规则打包成了 Claude 的技能,一份规则手册,Claude 自己加载,然后照着它干活。三个技能的 SKILL 文件都放出来了,文件名点开就能下(本文末尾也再列了一遍)。

1
LIRA — 写图片提示词。你告诉它要什么(这个角色处在什么状态、这个场地在一天中的哪个时候),它把设定表或场地底图的提示词写出来。它内置了各家图像模型的弱点清单,发出去之前先拿提示词对着这些弱点自查一遍:哪些词会招来摄影棚、哪种光会被烤死在画面里、某个模型总会漏掉的细节。LIRA SKILL.md ↓
2
CINEDANCE — 写视频提示词,里面分三层。「写手」负责拆场面、定走位、光学、物理和时间;「审校」在发出前把每条提示词再过一遍,专挑首帧是空的、标签过期、方位关系写得弱、两行自相矛盾这些毛病;「工作台」把提示词存成文件,只补失败的那一段,绝不整篇重写,重写会把本来就对的部分一起丢掉。CINEDANCE HIGGSFIELD SKILL.md ↓
3
ACTING — 表演系统提示词。用行为代替情绪、脸和身体的具体写法、角色行为档案的格式,都在这一份里。ACTING SKILL.md ↓

另外四条,是从上一部片子里带过来的

这个团队之前做过一部叫 HELL GRIND 的片子,那次是一边做一边摸索出来的,这次开工第一天就已经在手上:

  • 场景上下文:每个镜头开头先写清楚这一段戏剧上在发生什么、谁在场、多长。
  • 首帧空间锁:第一帧就已经占好位,所有人各就各位,不要那种空荡荡的定场拍子。
  • 每句台词后留一秒静音:片段内部留一条干净的尾巴,剪辑师得到一个接缝,而模型也没有空档去编造声音。
  • 表情和表演逐拍写:脸和身体一拍一拍地写,不用形容词打发。
题眼

但所有规则都在对付一件事:模型没有记忆

这本手册厚成这样,起点却只有一句话:一致性就是全部工作。

视频模型没有记忆。你把人物描述得不全,下一个镜头他的长相、行为、声音就都变了。再加上空间会在镜头移动时散架、声音在片段之间漂移、场面丢掉方位关系,这些加起来,就是 AI 拍长片一路要对付的东西。

他们的基本盘是一句话:每个镜头由「参考 + 文字」生出来。资产负责画面,文字负责其余一切,包括几何关系,谁站在哪、机位在哪一侧、光往哪个方向打。

资产 这个人长什么样 文字 谁站哪、机位在哪侧 光怎么打、怎么演 一个镜头 两股输入合起来才成立 没有任何镜头 是从一张静止画面 长出来的
本站示意图:画面归资产管,其余一切归文字管,包括读者最容易忽略的空间关系。

还有一条更硬的约束贯穿全片:只用文字生成视频,不给首帧,也不做图生视频。这条更难,但正因为如此,镜头之间才剪得到一起。

官方放出的一段对照演示,9 秒。(来自 Higgsfield 官方账号,本站转码后自托管)

全片唯一一次破这条规矩,是凯迪拉克车里那场争枪的打斗:两个人一直在接触、抢同一把枪,生成出来的结果是四肢缠在一起、枪在这只手上消失又出现在另一只手上。最后他们请了特技演员编排动作,在真车里用手机拍了一天,把这段素材当运动参考喂进去,模型再把角色、内景和灯光叠上来。一天的手机素材,省掉了一周的反复重试。

资产(asset)是什么

一对东西:一段逐字进每条提示词的文字描述,加一张给模型锚定的参考图。角色、场地、道具各自都是资产。

像剧组的定妆照加人物小传,照片管长相,小传管性格和穿着,两样一起交给每个新来的摄影师。

拆本

而开拍前先把剧本拆成卡片

他们的拆本是把剧本变成一份已经把导演阐述装在里面的预备分镜表,而不只是列出要做哪些东西。每个镜头一张卡,卡上分四组。

卡上分组写什么
素材场地和内外景,以及覆盖它的那个资产;一天中的时间(因为它决定用哪个资产变体);画面里每个人,带标签和状态;道具车辆带标签;动作用一到三句话;台词逐字;时长多少秒;复杂度是简单、中等还是复杂
导演本镜的目标,一句话;角色的任务用动词写,盘问、揭穿、羞辱;起止之间什么变了;相对摄影机的走位;表演上脸和身体做什么、角色在藏什么
摄影景别、运动、镜头、角度
剪辑用什么方式切、节奏多快、怎么接上下一个镜头

每张卡带着场次号加一个镜头字母,比如 50B、50C;同一个编号从卡片一路跟到版本日志和提示词文件,相邻两个镜头就永远不会被搞混。

这份版本日志最后记了 137 条,里面能看出哪些镜头反复重来过,最难的几个改到了 v15、v10、v9。没有这份记录,一个好镜头没法复现,也不知道某个修法自己是不是已经试过。

卡片填完,提示词几乎是机械地抄出来的。更要命的是窟窿会在花掉一次生成之前就露出来,一个没有目标的镜头、一个没有任务的角色、一场没有对应资产的戏,在卡片上一眼就看得见。

法则一

所以资产没锁死之前,一个镜头都不许拍

600 个审定资产的分项是这样的:主角和反派 74 张卡,配角与动物 52,只出现一两场的群众角色 90,道具 159,场地底图 200 多张。