AI 视频最大的坑,不是不会写 prompt

很多人做 AI 视频,卡在一个很朴素的问题:同一句提示词,今天出来像广告片,明天出来像廉价特效;上一秒人物还像本人,下一秒脸和衣服全换了。于是大家开始疯狂改词、换模型、赌运气。

我的判断是:AI 视频不能只靠“描述”,要先做“控制件”。文字负责说意图,参考图负责锁边界。特别是角色设定板和故事板这两张图,本质上不是素材,而是把随机性关进笼子的生产工具。

先把变量拆开

一条视频通常有三类变量:风格、角色、动作。

风格决定它像什么:真实拍摄、教学短片、动画感、纪录片感、口播感。角色决定谁在画面里:脸、年龄、衣服、气质、身份符号。动作决定怎么演:走进教室、抬手指屏幕、翻资料、镜头推进、转身看向观众。

很多人把这三件事全部塞进一句 prompt,AI 当然容易乱。更稳的做法是:用原图或风格参考锁住画面质感,用角色设定板锁住“这个人是谁”,用故事板锁住“每个镜头发生什么”。

两张图怎么做

第一张是角色设定板。它不用复杂,重点是统一。可以放正面、侧面、半身、全身,再加几个固定信息:发型、服装、颜色、年龄感、表情区间、不能改变的特征。对教育、知识类内容来说,角色不一定是真人,也可以是讲师形象、虚拟助教、案例人物、学员代表。

第二张是故事板。不要一上来就追求电影级分镜,先做 4 到 6 格就够了。每格只写三件事:画面主体、动作、镜头。比如“人物站在白板左侧,右手指向关键词,中景固定镜头”;“桌面出现资料和笔记,手写圈出重点,俯拍”。故事板越具体,AI 越少自由发挥。

这里的关键不是画得好,而是让 AI 明白“哪些地方不能自己编”。

一套可复用流程

可以按这个顺序做:

  1. 先写一句视频目标:给谁看、讲什么、时长大概多久、情绪是轻松还是严肃。
  2. 再定风格参考:找一张最接近你想要质感的图,别混太多风格。
  3. 做角色设定板:统一脸、衣服、身份感和色彩,不要每条视频重新发明角色。
  4. 做故事板:拆成 4 到 6 个镜头,每个镜头只保留一个主要动作。
  5. 再生成视频:每次只测试一个镜头,别一次性生成整条。
  6. 最后复盘:记录哪些描述有效,哪些动作容易崩,下一次直接复用。

这样做的好处是,失败也有地方可改。脸变了,回到角色板;镜头乱了,改故事板;质感跑偏了,换风格参考。你不再是在和 AI 玄学对话,而是在调一个生产流程。

对内容和教育从业者的启发

知识内容最怕“形式很炫,信息不稳”。AI 视频如果每次都重做风格、重做人设、重写镜头,效率不会真的提升,只是把剪辑焦虑换成生成焦虑。

更值得做的是资产化:把常用讲师形象、课程场景、板书动作、案例演示镜头沉淀成一组模板。以后每次做新主题,只替换知识点和镜头顺序,不重建整套视觉系统。

AI 提效的核心,不是找到一句神奇指令,而是把不确定的环节变成可复用的控制件。角色板和故事板的价值就在这里:它们让内容生产从“抽卡”变成“排产”。