AI 生视频卡在 15 秒,是大多数人玩不出长片的第一道坎。一条提示词喂进去,模型最多吐 15 秒,再长就崩。于是很多人以为”AI 拍长片”得等模型升级——其实不用等,思路换一下就能做。

刷到一条把这件事讲透的教程,作者用即梦(Seedance)把一个完整长片拆着做,总结了四种接龙法 + 一套最容易被忽略的”文戏台词切分法则”。这篇把它吃透,连同背后的底层逻辑、每种方法的适用边界、能直接抄的操作骨架一并拆给你。方法本身和模型无关,换可灵、Runway 思路一样成立。

一句话定性

长视频 ≠ 一次性生成 120 秒,而是把它拆成”可控的短段落 + 短镜头 + 可拼接的视觉连续性”,再一段段接起来。 长视频的本质简单到一句话:短段落的不断拼接。难的不是”生成长”,是”接得不露馅”。

想通这一点,整件事就从”求模型给我一段长的”,变成了”我怎么把短的拼成长的、还看不出接缝”。后者你完全可控。

先把三个数字记死

所有方法都建立在这套时长约束上(基于即梦的视频档位,别的模型同理换算):

单位时长为什么
单镜头4–5 秒最优(不低于 4,不高于 5)短镜头更容易控制动作、口型、情绪和连续性
单段落≤ 15 秒即梦单次生成最长 15 秒,超了必须放到下一段
一”集”9–12 秒一集短视频的体感节奏,约 6–8 个画面拼成

两条实操红线:① 写提示词别写”0 到 2 秒发生什么”——最短就是 4 秒,细到 2 秒模型不认;② 别在一个提示词里硬塞 20 秒的内容,超 15 秒就拆到下一段重新生成。把长片当成”6–8 个画面、每段≤15 秒”的拼装活,心态就对了。

四种接龙法:从最简单到最高级

① 视频延长法——从尾巴接,最简单

最直接的接龙:拿上一段视频当输入,让模型”继续延长 X 秒”。

  • 操作:生成第 1 段 15 秒 → 下载 → 重新导入即梦,提示词写”将上一段视频延长 15 秒,保持人物完全一致” → 出第 2 段;第 2 段再延长出第 3 段……理论上可以无限接。
  • 拼接:所有段下载丢进剪映,自然首尾相接。
  • 致命缺陷——人脸会越接越崩。 视频生视频每延长一次,画面里的人脸就多一层”褶皱感、融化感”,接得越长脸越塌。所以这条路最多撑到 1 分钟左右,再长人物就废了。

适用:没有人物近景、或只要 30–60 秒的最快出片。有人脸特写的长片,别单靠它。

② 混合延长法——图片锚定,角色一致性最强

针对①脸崩的解法:不全程视频接视频,而是用”一张帧图”当身份锚点去生成下一段。

  • 操作:从上一段视频里截一帧 → 把这帧当图片导入 → “以这张图为开头继续生成 15 秒”。这样一段是视频生视频、一段是图生视频,交替来。
  • 关键不在技术在镜头语言:截哪一帧有讲究。作者的做法是回到”全景三人 → 局部对话 → 再回到全景”的自然逻辑——先全身、再局部、再切回第一个镜头当锚点,符合人眼看一场戏的顺序,接起来才顺。
  • 收益:视频段+图片段混搭,把”会让脸崩”的纯视频接龙打断,人脸不再无限累积崩坏。这是四种里角色一致性最强的。

适用:有人物、有对话、要拍长一点的”文戏”,这是主力方法。

③ 九宫格法——批量出图,快速试镜头

先出图、再转视频的批量打法。

  • 操作:生成两张九宫格图(每张 9 格是一个连续小故事的分镜,比如”小猫进面包店→看到面包→叼走→店主追→逃跑”,第二张接着上一张最后一格继续”遇到小狗→分食”)→ 把两张九宫格直接喂给即梦按格生成视频 → 拼接。
  • 必踩的坑——别让它自动配音乐。 两段各自生成的背景音乐不一样,拼接处声音会突变、极其出戏。正确做法:生成时关掉音频,自己统一配乐,用一致的声音把两段缝起来。画面要连、声音更要连。

适用:剧情/卡通向、需要快速试不同镜头和分镜的内容。出图比出视频快、便宜,适合先用九宫格”试镜”。

④ 故事板法——按剧本顺序,严肃长片首选

九宫格的高级变种,也是最近最火的玩法。

  • 市面上教的故事板都只做 15 秒;要做长片,就生成多张故事板顺次接
  • 核心衔接规则:上一张故事板的结尾画面,必须等于下一张的开头画面。 例:第一张结尾是”主角把卡片送进变身器” → 第二张开头就要切”主角拿变身器对镜头” → 再下一张接”蓝色漩涡真人变身”的具体过程。每张单独生成视频,按剧本节奏拼。
  • 这是四种里最”按剧本走”的,适合有完整世界观、要严肃叙事的长片。

适用:有剧本、要叙事完整度的严肃长片首选。

一张表选方法

方法一致性难度最适合死穴
视频延长中(会衰减)最低30–60 秒快速出片人脸越接越崩,最多 1 分钟
混合延长最强有对话的文戏长片要懂截哪一帧(镜头语言)
九宫格剧情/卡通、快速试镜别自动配乐,会破音
故事板较高严肃叙事长片前后两张画面必须严丝合缝

实战往往是混着用:一条片子里视频延长、图片锚定、故事板各管一段,哪段脸容易崩就用图片锚一下。

真正的隐藏考点:文戏台词怎么切

这是全片最值钱、也最容易被跳过的一段。文戏(说话)比武戏(打斗)更难,难在台词和镜头时长的硬约束打架:

人正常语速 ≈ 每秒 4–5 个字;而镜头被锁死在 4–5 秒。也就是说,单个镜头里最多只能说 10–25 个字。

字塞多了会怎样?作者翻车的真实案例:一个科幻舰队对话镜头他写了一大段台词,结果模型为了把字读完,语速越来越快、越来越赶,观感极差。这是新手最容易犯的错——以为提示词里多写台词就能多说话,其实是把语速逼疯。

两条破解法则:

  1. 长台词必须拆多镜头。 别把一长段台词怼进一个镜头,按说话人的语气和气口切成两个甚至更多镜头。
  2. 切台词时换机位,别一直怼人脸。 标准调度:A 镜头说话人中景说 3 秒 → B 镜头反打给听者的反应 → C 镜头切回说话人特写。中景→反打→特写来回切,既消化了长台词,又有镜头语言。一个机位从头怼到尾把整段台词说完,是最糟的做法。

记死这条:台词长度 = 镜头数量的约束条件,先按”每镜头 ≤25 字”倒推要切几个镜头,再写提示词。

拼接卡顿:一个剪映小动作

四种方法拼接时都会遇到同一个问题——接缝处卡一下。 原因是 AI 为了让画面连续,会让前一段的最后一帧和后一段的第一帧”冗余重复”,剪映里就表现为一顿。

解法极简:把前一段尾部那点冗余向左裁掉一点点(或把后一段往后拉一点),重复帧一去,过渡就自然了。这是每次拼接的固定收尾动作,记住就行。

结构化提示词:到底该怎么写

把全片的提示词规律收口成一套可套用的写法:

  • 锁人物/场景/动作/风格:一句话讲清”谁、在哪、做什么、什么风格(真人/动画/漫画)“,模型才好保持一致。
  • 时长锚在 4–15 秒:别写超 15 秒的内容,别细到 2 秒的镜头。
  • 延长指令固定句式:“将上一段视频延长 X 秒,保持人物完全一致。”
  • 图片锚定句式:“以这张图为开头继续生成,延续动作与剧情。”
  • 台词按机位拆:每个镜头的台词控制在 25 字内,长台词分镜头写。

这套方法论值不值得抄

值得,但要看清它的边界。

它的真正价值,不是某个”神级提示词”,而是把”AI 拍长片”从一个等模型升级的玄学问题,降维成一个可拆解、可控制、可批量的工程问题——长=短的拼接、脸崩=用图锚断、卡顿=裁冗余帧、台词=按机位切。每个看似玄的难点,都被拆成了一个具体的、能复刻的动作。这是这条视频最高级的地方:它教的不是技巧,是把不确定性逐个收口成确定动作的思路。

边界也得说清:作者自己强调,这些全是实践摸索出来的、没有玄理论;想再上一个台阶,得补视听语言——镜头的推拉摇移、景别、焦距,这是编导/编剧的功夫,AI 给不了。工具把”生成”这一关磨平了,下一关的门槛会回到”你会不会讲故事、懂不懂镜头”。 这恰恰是 AI 时代内容创作的真相:技术拉平起点,叙事能力重新成为分水岭。


本文为公开教程的方法论拆解与二次梳理,工具操作以即梦实际界面为准;版权归原作者,方法可学,IP 形象与素材请自查版权后再商用。