AI 不听话,先管场景
先别怪 AI,不听话通常是流程问题
很多人做 AI 漫剧、课程短片、口播分镜,卡住的不是“不会生成”,而是每一集都像重新开盲盒:人物忽远忽近,站位乱跳,场景今天像教室明天像酒店,改 8 次还不稳定。我的判断是:AI 视频生产的核心能力,不是写一句神 prompt,而是把“场景、站位、约束、复盘”做成工作流。
场景先定边界
场景不是一句“办公室”就够了。你要给 AI 一个可复用的片场说明:空间类型、时间、光线、主要物件、不可变元素、镜头能看到什么。
比如做教育内容,可以把“讲台、白板、两排桌椅、左侧窗户、冷白光”写成场景卡。每一镜只改动作和台词,不反复改环境。这样做的好处是,后续换剧情时,观众还能认出这是同一个世界。
实操上,先做 3 张基础场景卡:主场景、过渡场景、特写场景。每张卡只保留 5 到 8 个稳定元素,别贪多。元素越多,AI 越容易抓错重点。
站位决定叙事清楚不清楚
站位听起来像导演课,其实是 AI 可控性的低成本杠杆。两个人对话时,谁在画面左边,谁在右边;谁坐着,谁站着;谁离镜头近,谁是被解释对象,这些都要固定。否则一条教育短片很容易变成“人物在说话,但观众不知道关系”。
建议用“左中右 + 前中后”描述站位。比如:老师在画面右前方,学生在左中景,白板在后方居中。每次生成前先检查站位,不要把它埋在长段剧情里。站位越稳定,后期剪辑越省力。
AI 不听话时,别只加字
很多人的补救方式是把 prompt 越写越长:不要这样、不要那样、必须这样。结果 AI 更混乱。更有效的办法是拆任务。
第一步,只让它生成场景或首帧,不要同时要剧情、表情、镜头运动。第二步,锁定角色和站位,再要动作。第三步,最后加字幕、台词或转场。把一次大请求拆成三次小请求,成功率通常会高很多。
如果连续失败 3 次,就不要继续赌。要么删掉最不重要的限制,要么换成参考图、分镜图、固定模板。AI 不是员工,它更像一台概率机器;你要减少它猜的空间。
给内容团队的一套小流程
- 先写一句本集目的:观众看完要懂什么。
- 再写 3 到 5 个镜头,不要一上来写长剧本。
- 给每个镜头配场景卡、角色卡、站位卡。
- 先出关键帧,再出动态视频。
- 把失败原因记录成“下次禁用词”和“稳定表达”。
- 每周沉淀一套可复用模板,而不是每天从零开始。
真正的效率来自复用
AI 内容不是靠灵感堆出来的,而是靠复用越做越快。今天你解决“场景不稳定”,明天就少返工;今天你固定“老师站右前、学员坐左中”,以后所有教学短片都能套。普通人用 AI 提效,最该学的不是更多工具,而是把不稳定的创作动作变成可复用的生产规则。