数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 40|回复: 0

[业界] 价值350万的“提示词”开源了,揭秘全球首部全AI生成的电影长片

[复制链接]
发表于 昨天 18:14 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
本帖最后由 刘绪刚 于 2026-8-8 18:15 编辑

爱范儿





电影发明以后,人类的生命,比以前至少延长了三倍。
AI 电影发明以后,人类的生命又能延长多少倍。
350 万元,115451 个资产文件,95 分钟,15 人团队,14 天的 AI 生成周期,一部完全由 AI 生成的电影来了。
没有摄影机,没有演员,也没有实体场景,电影中的每一帧都是由 AI 生成。视频和对白主要由 Seedance 2.0 生成,角色与场景使用 Soul Cinema,图像修改则调用 Nano Banana Pro、Seedream 4.5 和 GPT Image 2。
今年五月,这部 AI 电影在戛纳电影节同期的第三方行业活动中放映,是一部包含博物馆盗窃、恶魔、地狱和超能力的动作奇幻片。
ROKO、JAXX、LULU 和 REIN——四个一无所有、无所畏惧的街头孩子。某一天,一座博物馆,一个计划——直到一切在他们于展厅中发现一件没有名字、没有历史的文物时彻底崩塌。
一次触碰——他们每个人都获得了一种从未请求过的力量,唤醒了某种本不该被唤醒的存在。现在,他们必须正面迎战远古邪恶——即使这条路将他们直通地狱。
四个从出生起就被世界抛弃的孩子,如今却成为了世界最后一道防线。
最近,电影的制作团队 Higgsfield 公开了这部名为《Hell Grind》地狱磨砺的完整制作资料。每一幕每一场,累积十万多个资产,生成的视频不计其数,我们都能在 Higgfield 公开的项目地址查看。
https://higgsfield.ai/@higgsfield.studio/projects/hell-grind
每一个资产里面,都有完整的提示词和使用的参考图片,如果你有足够的 Seedance 积分,甚至可以 1:1 复刻一个同款电影。
里面还有不少中文提示词
官方透露,团队在完成前期资产后,用 14 天生成了整部电影需要的素材,随后再进入剪辑、修复、调色和声音制作。项目预算虽然「高达」50 万美元,但其中大部分都是花在了视频生成消耗的算力上。
我们花了一个半小时看完了这部 AI 电影,说实话,一部电影该有的元素它全部都有,跌宕起伏的故事与主题、鲜明的人物形象、区别于普通视频的视听语言、以及表演和导演。
在某一瞬间,甚至让我想到了小时候看的「铠甲勇士」。
故事情节就不如范大娘的「混世人魔」有趣了
但社交媒体上还是不少网友表示,如果以后的电影都是这样的话,那电影可以宣告死亡了。
毕竟一旦提到是 AI 生成的内容,无论文字还是视频,就自动贴上「廉价」、「毫不费力」、「敷衍了事」,甚至是「垃圾」等标签。
Higgsfield 这次公开的电影制作流程,似乎和「简单」二字完全没有关系,50 万美元的成本也并不廉价,在这份内部手册记录的内容里,更是只让人看到了永无止境的尝试和成篇大段的复杂提示词。
例如一个最简单的问题,如何要让一个没有记忆的模型,连续 95 分钟记住同一张脸、同一个房间和同一种表演?
答案可能会有一些反常识,为了让角色在不同镜头中保持一致,团队会故意砍掉角色设定图里的脑袋;为了避免人物换位,每个场景开头都要浪费一秒钟,让 AI 重新认识房间;为了生成一段十几秒的镜头,一份提示词甚至能写到三四千字。
这份指南像一把手术刀,把如何用 AI 制作一部电影的具体方法、可能踩到的坑,以及各种干货资讯全部公开出来。它让我们看到一个普通观众几秒钟看完的镜头,到了 AI 面前究竟要被拆成多少部分?等于多少个提示词?
我们也把这套复杂流程拆成五个普通创作者也能复用的方法:先做资产、给空间画地图、把情绪写成动作、用提示词充当场记、在十几次失败后主动简化镜头。
Higgsfiled 也有提供 AI 电影学院课程,以及此次 AI 电影的三份 Skill
https://higgsfield.ai/@higgsfield.studio/projects/hell-grind
用提示词解构电影
解构一部电影,首先要区分两类信息;一类会随着剧情变化:角色走进房间、拿起武器、说出一句话。另一类需要在整部电影里保持稳定:角色长什么样、怎样走路、使用哪种口音、紧张时会做什么。
《Hell Grind》把后一类信息做成了角色资产。每名主要角色都有一段固定的外貌描述,以及三张参考图:面部特写、正面全身和背面全身。正面全身图甚至会被故意去掉头部,避免模型在生成远景时读取那张过小、模糊的脸。
这些参考图也被刻意做得很朴素:灰色背景、平光、清晰毛孔,没有胶片颗粒和戏剧化灯光。角色图的存在,只负责回答一个问题:这个人究竟是谁;而后续的电影感应该留给具体的场景再做决定。
外貌之外,声音和行为也要被固定。比如,一个角色的声音可以被写成:低沉、沙哑的男中低音;语速缓慢,带伦敦街头口音;始终保持具有威胁感的平静,从不提高音量。
他的行为则会被总结成另一段文字:走路的节奏、手部习惯、眼神如何移动、受到压力时怎样掩饰、情绪崩溃前会出现什么动作。
角色坐下后,原本来回踱步的焦虑也不会消失,而会转移到摇晃身体、敲击手指和突然加快的手势上。
一部电影中的「角色」,由此被拆成了四组可以反复调用的数据:一张脸、一套身体和服装、一种不会漂移的声音,以及一组贯穿全片的行为习惯。
电影中的人物还会受伤、淋雨、换衣服。传统拍摄可以让演员换一套服装继续表演,AI 模型却容易把角色的多个状态混在一起。
电影中的男主角获得超能力后会变身,变身的每一种状态都需要一个资产文件
因此,《Hell Grind》里的每种状态都被拆成独立资产:@roco 是普通状态,@roco_wet 是淋雨后的状态,@roco_blood 是受伤后的状态。白天、夜晚和雨天的同一个地点,也会被当作三个不同场景管理。
一件关键道具甚至有三个版本:正常展示的完整版本、放在手掌里的染血版本,以及藏在拳头里的隐藏版本。
这套方法背后的逻辑就是:与其期待模型理解一个资产的所有变化,不如把每种变化都变成确定答案。
把电影场景写成一张平面图
角色之外,AI 电影最容易崩坏的是空间。
人类看到一个房间的正面,通常可以推测房间背后和侧面有什么。
但视频模型换一个机位,门窗、家具和灯光都有可能重新排列。上一镜头中,角色站在桌子左边。切到近景后,他可能瞬间出现在另一侧;两个人的站位也可能互换,摄影机甚至会突然越过轴线。
《Hell Grind》的解决方法,是给每场戏编写一份固定的空间地图,例如
圆形训练垫位于房间中央;
房门在画面左侧的远墙上,距离训练垫八米;
五个损坏的人偶散落在画面右侧;
长椅距离训练垫两米;
摄影机始终停留在房门一侧,不越过这条轴线。
这段地图里不存在人物和剧情,只记录空间里永远不变的东西。同一场戏的每个镜头,都要逐字复制这份地图。
团队还会在场景里寻找一个视觉锚点,像是如果用「角色站在房间里」给了模型太多选择,但「角色站在灯旁,面向房门」则把人物、空间和视线固定在了一起。
人物位置也统一使用「画面左侧」「画面右侧」和具体距离。因为「站在角色左边」会随着人物转身改变,「画面左侧」却始终只有一个答案。
传统片场里,这些信息存在于布景、地面标记、演员走位和场记照片中。到了 AI 电影里,物理空间消失了,整个片场又被人用文字重新搭了一遍。
还有一个小建议是场景参考图则尽量选择 3/4 视角。正面构图看起来像一张漂亮壁纸,提供的空间信息却很少。3/4 视角能让模型读到墙面、纵深和转角,换机位时更容易推测房间的其他方向。
把十二秒切成可以执行的动作
接下来,镜头需要被拆成时间。
以一场训练室的戏为例,12 秒的动作大致会被写成:
0—1 秒:整个房间保持当前状态,一个损坏的人偶仍在摇晃。
1—4 秒:房门打开,两个人走进训练室,在训练垫边缘停下。
4—8 秒:主角先用眼睛发现他们,随后转头;胸口急促起伏,下巴绷紧一次。
8—12 秒:主角说出台词,三个人脸上的笑容同时出现裂痕,没有人继续向前。
每场戏的开头,一定是先花一秒让 AI 认路。通过在每场戏开头安排一个约一秒钟的全景镜头,人物不说重要台词,也不执行复杂动作,只负责站在正确的位置上;让模型确认现场的情况。
完成这次确认后,后面的动作和对白才正式开始。
为了让不同生成片段衔接得更自然,团队还会把上一段对白的结尾放进新镜头的第一秒。演员先接住上一句话的尾音,再说自己的台词,嘴型、语气和反应就更容易连在一起。
《Hell Grind》的一条视频提示词可以达到三四千字。长度来源于一套固定结构:
场景里有几个人,禁止复制;
每个角色和场景分别参考哪项资产;
房间的固定空间地图;
第一帧里每个人站在哪里;
镜头时长、焦段和摄影机运动;
每几秒发生一个动作;
道具的重量、接触和惯性;
唯一的光源与阴影方向;
对白、声音和环境音;
每个角色的行为状态;
画面中必须成立的数量与关系。
虽然提示词很长,单个动作段落却要尽量短。
团队发现,一个时间节点最好只容纳两三句话。模型可以阅读三千字的整体规则,却很难在同一秒完成开门、转身、说话、挥拳和改变表情。动作塞得越多,人物越容易在画面里犹豫、瞬移或者直接停住。
复杂动作还要从生成的第一帧直接开始。
如果角色需要撞破一扇门,提示词会写成「他已经处于挥拳中段,门板已经开始裂开」。如果用「走到门前、抬起手臂等准备动作」会被拆成另一个镜头。
AI 视频的镜头设计因此也越来越接近漫画分镜:每一格只解决一个最重要的动作。谁又说这不算是另一种「古法」呢?
删掉「愤怒」,写下他的下巴
角色表演是整套流程里最反直觉的部分。直接告诉模型「他很悲伤」「他非常愤怒」,通常只能得到夸张、浅层的表情。团队更愿意描述身体正在发生什么:
他的下巴绷紧后松开两次;
鼻血流到嘴唇,但没有抬手擦掉;
一次缓慢眨眼,紧接两次快速眨眼,再用力闭眼;
目光先落在地上的碎片上,随后才转向门口。
角色的内心 OS 也会写进提示词:他想在别人进门前再完成一次攻击;他想隐藏手臂正在失控;门被推开的瞬间,他重新挂上一点勉强的笑。
这些内容不会直接出现在台词里,却会改变角色的呼吸、眼神和动作节奏。
指南里还提到静态镜头最好每一两秒出现一个微小事件:胸口随着呼吸起伏,鼻翼轻轻移动,手指敲击桌面,眉毛收紧后放松。
而「所有人保持不动」之类的提示词,很容易让模型真的冻结画面。更有效的表达是「人物用力维持静止,呼吸仍然没有恢复」。
对白也被严格限制在声音模块中。每个角色只能说引号里的句子,没有台词的人必须保持安静。声音描述、口音、语速和说话习惯会像角色外貌一样,逐字复制到每一个镜头。
在这套系统里,表演变成一连串可以被摄像机看见的生理变化。
《Hell Grind》采用逐场景生成的方式。每一次修改只改变一行,其余提示词完全保留。团队同时记录提示词版本、修改内容和生成结果,确保偶然出现的好镜头能够被复现。
他们还设定了一条「十到十五次规则」:同一个镜头连续生成十到十五次仍然无法成立,问题大概率已经超出措辞范围。
此时继续往提示词里添加限制,往往只会让模型更混乱。有效的方法是把镜头拆成两段、删掉一个动作、缩小人物活动范围,或者更换机位。
或者直接把资产从一个人变成一群人,二十名背景人物可以直接做成一个整体资产
怎样把任意一场电影翻译成提示词
沿着这套方法,我们也可以尝试反向解构任何一场电影。
选择一段 30 秒到两分钟的片段,先暂停剧情,只记录画面里能够被验证的事实。
建立资产表:谁出现在画面中?哪些外貌、服装、声音和行为特征需要贯穿每个镜头?角色在这场戏里是否受伤、淋雨或者换过衣服?
画出空间地图:门、窗、桌子、光源和主要道具分别位于哪里?人物距离地标多远?摄影机位于轴线哪一侧?
逐镜头记录摄影信息:景别、机位、焦段、景深、构图、运镜和光线分别是什么?摄影机在跟随人物,还是等待人物进入画面?
把动作放进时间轴:第 0—2 秒发生什么,第 2—5 秒又发生什么?每个时间段只留下一个主要动作。
把情绪翻译成身体动作:角色的目光落在哪里?呼吸是否改变?哪块肌肉先绷紧?手里原本正在做的事,是否因为一句话突然停止?
列出连续性约束:人物数量、站位、衣服、道具、光源方向和伤口位置,哪些内容在下一个镜头里绝对不能变化?
最终得到的提示词,大概会呈现这样的结构:
场景背景:发生了什么,画面中有几个人
角色资产:外貌、服装、声音、行为习惯
空间地图:门窗、地标、人物和摄影机位置
第一帧:画面开始时每个人正在做什么
摄影:景别、焦段、构图、景深和运镜
动作时间线:每几秒发生一个可见动作
物理关系:重量、接触、惯性和受力
                                                                                                                               


                        

光线:唯一主光源及阴影方向
声音:对白、环境声和空间混响
角色表演:目标、隐藏信息、身体节奏和变化
连续性:人数、方向、数量和不可改变的关系
看完这份指南,我只觉得好难。所谓的 AI 电影,也不是大多数人口中仅凭一句提示词,就能做出来的东西。
尤其是看到复杂的镜头设计时,优秀的画家可以用手画出自己脑海中想象的镜头,但 AI 电影创作者则必须要用文字把它们描述出来。

在社交媒体上发酵了两天,《Hell Grind》最容易被传播的内容,还是开头那几个数字,95 分钟、15 个人和 14 天。
但每一份三四千字的提示词,确实给我们提供了另一种理解 AI 电影的角度。
我们也很难因为一部 AI 电影的公开就说未来都会是 AI 电影的天下,更乐观的情况,大概是希望 AI 电影和动画片、纪录片、剧情片等是作为同一个分类,它们有机会做到各美其美,美美与共。
而这份指南也就有了它存在的价值,让我们入门一个新的电影类别,AI 电影。





您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-9 06:19 , Processed in 0.124800 second(s), 9 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表