AI 短剧的上限,在按下生成按钮之前就决定了:把 8 步前期工程拆透
做了半年 AI 视频,作者把最大的教训压成一句话:视频差,不是模型差,是输入差。
大多数人做 AI 短剧走的是一条死循环——「随便一句提示词 → 生成 → 卡住 → 骂模型」。人脸会变、转场不顺、做不长、看不下去,第一反应都是”模型不行”。但真正的生产线是反过来的:你按下生成按钮那一刻,这条片子的上限其实早就定死了。
刷到一条把这件事讲透的 23 分钟教程,作者用即梦(Seedance / C 档 2.0)实拍了一集 AI 短剧《人类》,全程演示了一套前期工程:剧本 → 节拍 → 人物/道具/地点 → 分镜/场次/资产,最后才进生成引擎。这篇把这套流程吃透,连同每一步”为什么存在、偷懒会在哪翻车”一起拆给你。它和模型无关,换可灵、Runway 一样成立。
配套阅读:上一篇拆的是下游——视频生成出来后怎么把 15 秒短段接成长片(《长视频=短段拼接,4 种接龙法》)。这篇拆的是上游:还没生成之前,怎么把输入做扎实。两篇合起来才是完整的一条生产线。
一句话定性
AI 短剧不是”生成”出来的,是”编排”出来的。 视频是最后一公里,质量在前期就被锁死了。好剧本 → 好节拍 → 好分镜 → 好资产 → 才有稳定的输入 → AI 视频才会好。顺序不能乱,前面偷懒后面翻车。
把这句话想通,整件事就从”求模型给我一段好的”,变成”我怎么把输入做到足够稳,让模型没有发挥空间去乱猜”。后者你完全可控。
先看这条生产线长什么样
作者把一集 AI 短剧的制作拆成 8 步,前 6 步全在生成之前:
- 剧本 —— 写清故事、动作、对白、场景
- 节拍 —— 把剧情拆成几次”转向”
- 人物 / 道具 / 地点 —— 把反复出现的东西实体化、建卡
- 分镜 / 场次 / 资产 —— 把内容变成可生产、可验证的制作材料
- → 再写提示词(不是一句话,是按镜头/角色/场景/道具逐项写)
- → 交给即梦 Seedance 生成
- → 进剪映剪辑
工具(Seedance)只是最后一步。真正的功底全在前面。 下面逐步拆。
① 剧本:整部短剧的源代码
剧本不是给 AI 看的装饰文字,它是整部片子的源代码。剧本没写清,后面全部变虚:节拍不知道怎么拆、人物不知道怎么建、分镜不知道怎么拍,模型只能猜——猜出来的就是会变脸、会崩。
记住一个反直觉的顺序:你不是先做视频再补故事,而是先把故事写成剧本,再让 AI 把它拍出来。
一句”人类降临在兽人的世界里”是概念,不是剧本。真正可生产的剧本,要把六个要素逐项写满:
- 场次:内景/外景、时间、地点——先锁死”这场戏发生在哪”。
- 动作:人物做什么、看什么、碰什么——给画面生成依据。
- 角色:谁在说话、谁出现、谁的反应——避免人物关系混乱。
- 括号(表演提示):语气、停顿、表情、小动作——“压低声音说”还是”强忍着说”,直接影响表演。
- 对话:角色真正说出口的话,负责推动信息和情绪。
- 转场 / 注释 / 字幕等。
剧本不是文学作品,是生产文件。你写得越清楚,AI 拿到的输入就越稳定。
作者强调剧本解决三件事:时长(很多人只能做 15 秒,是因为只有 15 秒的故事;想做长就得有长剧本、有下一场下一集)、输入(动作/对白/视线/声音/空间关系全从剧本里提取,剧本越具体提示词越具体)、连续性(人物状态、道具位置、场景关系都有源头,剧本没写后面 AI 只能瞎猜)。
② 节拍:一集不是 5 场戏,是 5 次转向
这是最容易被误解的一步。很多人把”节拍”理解成”场次编号”——第一场=第一个节拍——这是错的。
节拍不按场次走,节拍看的是剧情在哪个点发生了变化。一个节拍可以跨好几场,一场戏里也可能藏好几个节拍。作者的比喻很到位:
剧本是一场拳击赛的逐帧录像(每一拳每一步都记下来);节拍是同一场比赛的回合分析(第一回合试探、第二回合重击、第三回合被反杀)。
以《人类》第 1 集为例,5 个节拍是 5 次转向,不是 5 段画面:
- 坠落 —— 人类作为异物坠入兽人世界,正常秩序被打破。
- 被指派 —— 女主阿晨本可只看新闻,长官逼她去现场,被迫卷入、不能再当旁观者。
- 面对面 —— 阿晨隔着隔离墙第一次见到人类,厌恶和好奇第一次同框。
- 文字之谜 —— 人类拿笔写出有结构的符号,证明它有智慧、有文明痕迹。
- 目光黏上 —— 阿晨嘴上否认,尾巴和眼神却暴露了好奇。
每一次转向都把故事往前推一步。给新手的关键建议:先写节拍,再写剧本——先搭骨架,再填血肉。 光有节拍没剧本,你没法拍(“外来人降临了”——怎么降临、什么声音、谁看到、谁后退全没有);光有剧本没节拍,你会写一堆画面却不知道每场为什么存在,写着写着就迷路、强行加戏接不上。
③④⑤ 人物 / 道具 / 地点:把世界”实体化”
AI 视频的连贯性不是靠”抽卡抽到好的”,是靠实体管理。所有会反复出现的东西都不能每次临时生成,必须建卡、锁死。
- 人物 ≠ 名字。 只写”阿晨""博士”远远不够。要让角色变成可复用的资产:职业是什么、外形是什么、性格里有哪些矛盾。作者连群演路人甲都生成图片管理。有了角色卡,后面的肖像、分镜、视频里人物才不会变形。
- 道具 = 叙事的延伸。 关键道具不是随便一支笔,而是推动剧情的认知物:金属舱是”人类降临”的证据,隔离墙制造距离感,笔和纸让兽人意识到”人类也有智慧”。判断标准:镜头会停留的、人物会触碰的、剧情会反复提到的东西,都该入库。 模型不知道哪个东西重要,除非你先告诉它。
- 地点 = 锁住世界。 每个地点有自己的视觉规则:湖边是开阔自然光+水柱,办公室是权力空间+新闻屏,观察室是冷白色+隔离墙。地点不设定,AI 每次生成就换个空间——上一秒科幻实验室、下一秒普通医院,连续性直接崩。
这三步的产出是一堆参考图(人物三视图、道具示意图、地点主视觉),后面全部喂给 Seedance 当参考,保证一致性。
⑥ 分镜:把动作翻译成”机位语言”
到这一步不再想”故事好不好”,而是想”这段戏怎么被看见”。AI 尤其需要这一步——模型不是导演,它不会自动知道哪个镜头该远景、什么时候该推进、什么时候切反应。
而且分镜不能停在”镜头规划”,要继续往下走,变成 Seedance 能听懂的提示词。比如”阿晨被笔尖吸引”,直接写动作 AI 会拍得很平;拆成镜头就活了:指尖特写 → 阿晨眼睛反光 → 尾尖跟着节奏摆动 → 意识到失态、压下尾巴。 作者用一套”运境技能”来写镜头提示词,核心是判断三件事:水平角度、垂直角度、运动轨迹——哪个镜头用特写、哪个用别的,都是为了强调特定内容。
⑦ 场次:从文字进入制作的”管理门”
场次是生产单位。把剧本拆成一张张卡片:每个场次有什么地点、出现哪些人物、有哪些台词、能不能生成视频,都在这里管理。
为什么重要?因为 AI 短剧不是一口气生成一集,而是一段一段拆开生产、逐段可检查、可重做。 第一集有湖泊、办公室、管控区、观察室,每个场景都先生成静态帧、检查人物/地点/道具气质对不对,再生成视频。场次就是从”文字”进入”制作”的那道管理门。
⑧ 资产:交给模型前的最后一道连续性保险
资产是把前期工程交给 AI 之前最后一次连续性锁定:人物资产、地点资产、道具资产、场景资产、参考图资产,全部固定下来存成文件夹。没有资产,提示词在场里引用就会飘;有了资产,模型至少知道这个人长什么样、这个地方长什么样、这个道具变不变。
对 AI 来说最关键的三类资产:
- 人物资产 —— 肖像、三视图、服装、不同表情。
- 地点资产 —— 每个场地的主视觉图、光线材质、空间结构。
- 道具资产 —— 金属舱、笔纸、隔离墙等。
这些资产进入生产流程后,同时充当三个角色:参考图、约束条件、验收标准。
最后一公里:Seedance 的输入逻辑
到这里才进即梦(C 档 2.0)。Seedance 不是导演也不是编剧,它是生成引擎,只吃输入。所以写提示词不是”一只猫看到了人类”,而是按每 15 秒一个 beat,逐项喂:
- 画面规格 —— 比例、时间、地点、光线写清楚。
- 人物资产 —— 谁出现、绑定哪张参考图。
- 时间轴 —— 0–5 秒发生什么、5–10 秒、10–15 秒。
- 镜头语言 —— 景别、机位、运镜、焦点。
- 约束词 —— 脸不要飘、道具不要丢、空间不要乱。
把前面所有内容做完、抽象出来,再喂进模型,才能生成稳定的好视频。
生成前先问自己这八个问题
作者给了一张按生成按钮前的自检清单,本质是检查”输入到底够不够稳”:
- 剧本够长吗?有没有下一段、上一场、下一集?
- 节拍清楚吗?每一段是否都承担一个转折?
- 实体完整吗?道具、地点、人物是否都入库?
- 分镜可拍吗?镜头有顺序、有景别、有运动规则吗?
很多时候不是 AI 做得不好,是你没把”要做什么”讲清楚。AI 短剧的上限,在生成按钮之前就决定了。
能直接抄的几点
- 顺序固化成 SOP:剧本 → 节拍 → 实体化(人物/道具/地点)→ 分镜 → 场次 → 资产 → 生成。每一步有明确产出物,缺一步后面就翻车。
- 节拍先于剧本:新手最该练的是”用 5 次转向搭骨架”,而不是上来堆画面。
- 一切复用元素建卡 + 配参考图:人物、道具、地点都生成图固定下来,喂模型当参考——这是一致性的根,比任何”约束词”都管用。
- 分镜翻译成三轴机位(水平角度/垂直角度/运动轨迹),把”平”的动作拆成有特写、有反应的镜头序列。
- 生成前过八问清单:把”骂模型”的精力,前移到”检查输入”。
说到底,这条视频真正的价值不是某个工具,而是一句判断:当你想用 AI 拍片,第一个问题不该是”用哪个模型”,而是”我的剧本写完整了吗、节拍清楚了吗、资产备齐了吗”。 工具年年换,这套”前期决定上限”的工程思维不会过时。