一个人用 AI 做漫剧的完整流程:从一句大纲到成片,40 分钟教程拆给你看
刷到一条没什么标题党、却实打实的长视频:抖音 @源漫创想 花了快 40 分钟,把自己做「漫剧」的全流程从头演示了一遍——一句话大纲怎么变成完整故事、故事怎么切成分镜、人物图怎么生、视频怎么生、最后怎么剪成片。作者反复强调「个人非专业、自己摸索的,不一定对」,但恰恰是这种不端着的实操,把一条龙的每个坑都摊在了明面上。
所谓「漫剧」,就是用 AI 把一个短故事做成几分钟的二次元动画短剧。这两年它在抖音是个闷声起量的赛道:成本几乎为零、单人就能干、题材又踩在短剧的爽点上。但凡你想过「我能不能也用 AI 做个动画短片」,这条视频就是一份能照着抄的施工图。
这篇就把这 40 分钟拆成一张能复用的流程图,重点不在「他用了哪个 App」,而在一个人做连续动画,最难的那道坎——一致性——到底是怎么绕过去的。
一句话定性
这条视频教的不是「某个 AI 工具」,而是一套把长故事拆成可控小块、再用一致性手段把小块重新缝成连续片子的工程方法。AI 生视频天生「每段都重抽、人物会变脸、声音会换人」,单人做漫剧的全部功夫,都花在用三视图锁长相、用参考音频锁声音、用尾帧截图锁衔接这三件事上。工具(DeepSeek / 即梦 / 剪映 / Nano Banana)都可替换,这套「拆—锁—缝」的思路才是护城河。
漫剧真正难在哪:不是「生成」,是「连得起来」
先把问题说清楚,你才看得懂后面每一步的用意。
用 AI 生成单张图、单段视频,今天已经没什么门槛。难的是连续:一部三分钟的漫剧有二三十个镜头,观众要的是「从头到尾是同一个女主、同一个嗓音、场景接得上」。而所有图生视频工具的默认行为恰恰相反——
- 每段都是独立抽卡:这一段女主是鹅蛋脸长发,下一段可能就方脸短发;
- 声音逐段重配:每个 15 秒片段单独生成,音色、语速都飘;
- 段与段是硬切:上一镜结尾人站在门口,下一镜开头人凭空到了台上。
工具越「智能」,这种漂移越明显。所以这条教程真正的信息量,不在「怎么生成」,而在「怎么不让它乱」。记住这个主线,下面六步就都有了逻辑。
六步流水线全貌
作者把流程拆成固定的六步,前三步在「文字」里折腾,后三步才动「画面」:
| 步骤 | 干什么 | 用什么 | 关键动作 |
|---|---|---|---|
| ① 大纲 | 一句话讲清故事梗概 | 手写 | 女主是主持专业,被拉去临时顶替宣讲会主持,上台发现主讲正是自己认识的男主——突出那一刻的「震惊」 |
| ② 故事 | 把大纲扩写成完整故事 | DeepSeek | 让 AI 扩写,限定字数(500/1000 字,对应想做几分钟);复制进 Word 手动改:删 AI 腔、删多余形容词、删废话、改人名 |
| ③ 分镜脚本 | 故事切成一段段镜头 | DeepSeek | 让 AI 按固定格式生成:时长 + 镜头 + 动作 + 台词;按「10–15 秒一段」切(即梦单段上限 15 秒),逐段编号、能精简就精简 |
| ④ 生图 | 造出人物、场景、道具的「素材库」 | 即梦 / 豆包 / Nano Banana | 人物三视图 + 表情特写、场景图、反复出现的道具(如滑板)也做三视图→特写 |
| ⑤ 生视频 | 把分镜逐段图生视频 | 即梦「全能参考」 | 锁人物、锁声音、锁衔接(本片精华,下一节细讲) |
| ⑥ 剪辑 | 把镜头缝成成片 | 剪映 | 调速、转场、字幕、配乐、超清导出 |
一句话串起来:大纲是种子,故事是血肉,分镜是把血肉切成 AI 能消化的小段,生图是备齐演员和布景,生视频是逐段开拍,剪辑是把所有镜头连成片。 作者点破了一句关键的因果——「大纲和故事是为提示词服务的,生图是为视频服务的」,也就是说前面所有文字活,最终都是为了喂好「生视频」这一步。
真正值钱的部分:一致性的三把锁
如果只记一件事,就记这一节。单人做漫剧能不能成立,全看这三处。
锁长相:先做「三视图」,再拿它当参考
人物不能每段重抽,否则就成了「换脸怪」。作者的办法是先把人物定下来,做成一套素材:
- 用 DeepSeek 生成人物形象描述词(发型、气质、穿着……);
- 拿描述词去即梦文生图,要求纯白背景、双手自然垂下、二次元风格——背景留白是为了后面好抠、好复用;
- 抽到满意的形象后,以它为参考图再生成「三视图」(正面/侧面/背面)+ 一到两张表情特写;
- 同一个人物,可以换衣服、换发型应对不同场景(如「生病时」「短发版」),但脸保持是同一个人。
这套三视图就是这个角色的「身份证」。后面生视频时反复拿它做参考,长相就不会飘。男主、配角、甚至反复出现的道具(视频里的滑板)都同样处理——先做三视图,再推 45 度特写图备用。
可复用的判断:做任何「需要同一形象反复出现」的 AI 内容(动画、连续漫画、IP 形象、数字人),第一步不是急着出片,是先沉淀一套带参考图的人物档案。长相一致性是「先定后用」攒出来的,不是每次靠运气抽出来的。
锁声音:把生成好的语音「回收」成参考音频
这是全片被问得最多、也最反直觉的一招。即梦逐段生视频,声音默认每段都重配,音色会变。作者的解法是利用即梦「全能参考」可以喂音频这个点,把声音也「锁」住:
- 先正常生成第一段视频,里面女主有了一个声音;
- 把这段视频下载,导入剪映,选女主说话最密集的一小段(三五秒即可)裁切出来;
- 分离音频 → 导出成 MP3,命名「女主声音参考」,归档到角色音频文件夹;
- 之后每一段生视频,在「全能参考」里把这段 MP3 加进去,并 @ 指定「女主声音」——后续所有镜头里女主就都用这一个嗓子。
多角色就各做一份:林小小一份、男主一份,分别指定形象 + 声音 + 场景。「先用 AI 生出一个声音,再把它回收成所有后续片段的声音锚」——这个「自产自锚」的循环,是这条视频里最值得抄的工程巧思。
锁衔接:把上一镜的「尾帧截图」喂给下一镜
段与段的硬切,靠尾帧承接来软化:在生成下一段时,把上一段视频结尾的那一帧截图加进参考,让 AI 知道「上文画面长这样」,新镜头就能接得更连贯。作者也提醒,这招对「需要上下文连贯」的镜头有用,开篇这种独立镜头则不必。
几个能直接抄走的省钱 / 避坑细节
教程类视频,最值钱的常是那几个「不说就会踩」的小动作。这条里至少有六个:
- 生视频提示词的固定收尾:每段末尾固定加「表情生动,动作富有张力,中文台词,无背景音乐,无字幕」。为什么不要字幕和 BGM?——字幕 AI 容易出错(后期在剪映加更稳);BGM 因为是 15 秒分段生成,每段配乐不一样,拼起来会割裂,所以统一留到剪辑阶段铺。
- 分段长度的取舍:连贯的动作尽量凑满 15 秒一段(接得顺),开篇、过场这类可以 5–10 秒。即梦单段上限就是 15 秒,这是硬约束。
- 模式选便宜的:即梦视频模式选「C2.0 faest」这类省积分但慢的档;横屏选 16:9。积分是真金白银,能省则省。
- 编号管理是剪辑的命:文件夹按「镜头号 / 第几次生成」分级归档(01 镜头第 1 次、第 2 次……),哪条满意一眼可见,剪辑时不用大海捞针。这也是为什么分镜阶段就要逐段编号。
- 速度后期救:生成的语速偏慢就在剪映里调 1.1–1.2 倍,偏快「吞字」的镜头直接弃用或调 0.8 倍。一段不满意就重抽,但满意了就别多抽——省积分。
- 成片提清晰度:剪映会员「一键超清」可导 4K,帧率作者维持 24 帧(强行拉高反而别扭)。转场用剪映自带的「叠化 / 闪黑」,叠化能造出「时间流逝感」。
工具清单与可替换性
| 环节 | 视频里用的 | 能换成什么 |
|---|---|---|
| 故事 / 分镜(文字) | DeepSeek | 任意能扩写+按格式输出的大模型 |
| 生图 | 即梦、豆包、Nano Banana | 任意文生图;作者补充 Nano Banana 出图清晰度/抽卡率更优但操作稍麻烦,他的场景图多由它生成 |
| 生视频 | 即梦「全能参考」 | 任意支持「图+音频参考」的图生视频工具,关键是要有「锁形象+锁声音」的参考位 |
| 剪辑 | 剪映 | 任意非线性剪辑器,要能分离音频、加字幕、转场 |
也就是说,整套方法不绑定任何一个 App。只要你的工具链里有「会扩写的文字模型 + 能定形象/声音的图生视频 + 一个剪辑器」,就能复刻。值钱的是「拆—锁—缝」的流程,不是某个产品的按钮。
该清醒的地方
- 这是手工流水线,不是一键成片。40 分钟教程的体感是:大量重复的「抽卡—筛选—编号—再抽」。AI 负责生成,但故事打磨、分镜切分、筛图、对轨、剪辑全靠人。「AI 做漫剧零成本」是对的,但「零成本 ≠ 零功夫」,时间成本相当实在。
- 积分就是钱。即梦生图生视频按积分扣费,一条三分钟片子背后是几十上百次抽卡。教程里反复出现的「省积分」动作(选慢档、能短则短、满意就不多抽),本质是在控成本。真要量产,得先算清单位成本。
- 质量天花板取决于「审」而非「生成」。作者自己也说「靠抽卡」「剪辑不是我的强项」。成片好不好,差距其实在筛选眼力和剪辑手感——这部分 AI 替不了。
- 风格一致性仍是概率事件。三视图、参考图能大幅降低漂移,但作者也坦言「人物和场景风格至少要相似,完全一致有点困难」。别期待像素级稳定,能做到「明显是同一个人、风格不打架」已经是合格线。
- 文中工具的具体形态以视频演示时点为准,AI 产品迭代快,按钮位置、模式名称、积分政策随时会变,复刻前以工具当前界面为准。
橙子的判断
把这条 40 分钟教程榨干,留三条能反复调用的判断:
- 做连续性内容,先建「资产」再开拍。 漫剧的核心资产是人物三视图 + 参考音频。任何「同一形象/同一声音要反复出现」的活(动画、IP、数字人、连载漫画),都该先沉淀这套档案,再批量生产——一致性是攒出来的,不是抽出来的。
- AI 生成的产物可以「回收」成下一轮的锚。 「先生一个声音,再把它导出成所有后续片段的参考音频」这个自产自锚的循环,是个能迁移的元技巧:当工具不支持「锁定」某个属性时,看看能不能把已生成的结果反过来当输入喂回去。
- 把长任务拆成工具能消化的小块,是 AI 工程的通用功。 即梦只能 15 秒一段,于是整个故事被切成 10–15 秒的分镜逐段攻克。面对任何有硬上限的 AI 工具(上下文长度、单次时长、单图尺寸),先想「怎么切块 + 怎么缝合」,往往比硬刚限制更有效。
一句话收尾:漫剧不是「AI 自动生成动画」,是「人用一套一致性手段,把 AI 的零散生成缝成连续片子」。门槛低到一个人就能干,但能不能做好,看的是你拆故事、锁形象、缝镜头的工程素养——工具人人能拿到,方法才是分水岭。