刷到 @师斯 的一条视频,拆 AI 电影《万物生》(@命比梦长 作)里的一个镜头。这个镜头我也反复看了几遍——15 秒,固定机位,一刀没剪,却同时把三件事讲完了:悬念、剧情、人物身份。

更值钱的是,视频结尾甩出了这个镜头的完整提示词。我把它扒了下来,发现真正的门道不在”镜头语言”这四个字,而在提示词是怎么把”导演的活”写成一份 AI 能执行的双轨脚本的。这篇拆透它。

一句话定性

这不是”AI 能生成多炫的画面”,是用一个最省的镜头(固定机位、零剪辑)扛住三层信息。靠的是「三个焦段分工 + 声音做衔接 + 焦点延迟揭晓」三个老电影手法;落到 AI 上,就变成一份逐秒视觉时间轴 + 强制音效层的双轨提示词。AI 负责渲染,导演判断负责写提示词——后者才是稀缺的那一半。

镜头拆解:三个焦段,三层信息

整个镜头怼着同一个机位不动,但它把画面纵深切成了三段,每一段干一件事:

焦段画面承载的叙事层手法
前景(虚焦)一个布袋子怼近镜头、占画面 1/3,但是虚的,看得到、看不清悬念——袋子里到底是什么等人物走后焦点由虚转实揭晓:里面是符纸 + 红绳
中景(人物活动)女孩两次入画:起床穿衣、拿钥匙、出门 → 又折返来拿布袋剧情——她要出门,忘带东西折返几乎全靠声音引导,人物动作只做自然表演
后景(墙面陈设)贴满照片、便签、八卦镜、罗盘的一面墙身份——暗示她是个”算命/女巫”角色背景物件交代职业;其中闺蜜照是给后续剧情埋的伏笔

一个机位,三个焦段,三层信息。博主把这种设计叫”物品悬念”。

真正的手法:别急着让观众看清

这个镜头最值得学的不是”用了虚焦”,而是揭晓的节奏

  • 先吊胃口:关键物品先虚焦,你知道它在那儿、但就是看不清,心里痒;
  • 让演员自然做动作:不靠旁白解释,观众通过”她忘带东西、特地折返来拿”这个行为,自己得出”这袋子很重要”;
  • 关键时刻焦点划过去:虚 → 实,揭晓里面是符纸红绳,给观众一种”哦——原来是这个”的恍然大悟。

这套骨架是可迁移的:把布袋子换成一把钥匙、一个胶卷盒、一本日记本,结构完全不变。悬念不在物品本身,在”延迟看清”这个动作上。

声音,才是这个镜头隐形的导演

固定机位有个天生的难题:画面不动,怎么交代”起床 → 出门 → 又折返”这一长串动作?

答案是声音。镜头里你并没有全程看到她,但你听到了:穿衣的窸窣声 → 钥匙叮当 → 脚步啪嗒远去 → 一声”砰”的关门 → ……一阵安静……→ 门”咔哒”重新打开 → 脚步折返 → 抓走布袋 → 再一声关门。

声音替画面把剧情演完了,还顺手把”起床”和”出门”两个时空衔接了起来。画面负责悬念和身份,声音负责剧情和节奏——分工清清楚楚。

扒到的提示词:它本质是一份双轨脚本

结尾博主把完整提示词甩了出来(来源标注:命比梦长)。我逐帧扒下来,结构长这样——它不是一段话,是两条平行的轨道

轨道一 · 逐秒视觉时间轴

0–3s 玄关 → 3–4s 起身 → 6–8s 伸手抓钥匙 → 8–9s 拿钥匙转身走出画 → 9–10s 回到初始的虚焦空镜构图 → 【焦点切换】10–11s 镜头从模糊逐渐变清晰 → 11s 焦点完全锁定布袋(深褐棉麻质地、红色细绳、米黄符纸、朱砂道符繁体字全部清晰),并特别注明”这次是平滑的 rack focus” → 12–14s 手从右侧入画抓走布袋 → 14–15s 纯空镜结束。

轨道二 · 【关键音效——必须严格生成】

同样逐秒写死:玄关脱鞋的窸窣声 + 远处城市晨间白噪底噪、钥匙”叮当”清脆碰撞、脚步”啪嗒”远去、一声”砰”的厚重关门 + 门框余震、然后完全安静、再是门”咔哒”金属声 + 门轴”吱呀” + 气流声、脚步折返、抓袋瞬间的麻布摩擦 + 符纸窸窣 + 红绳摆动声、最后再一声”砰”。它甚至单独列了一条「三声门音效节奏对比」,区分出门关门(重、闷)和……不同质感的门声。

看明白了吗?那个被夸”用声音讲故事”的效果,不是 AI 自动送的,是提示词里把音效当成和画面平级的一整轨、逐秒写死、还摁着强调”必须严格生成”。

工具门槛在塌,导演门槛没塌

这份提示词,恰好是”AI 好片”和”AI 垃圾片”的分水岭:

  • AI 负责把这份双轨脚本渲染成画面 + 声音;
  • 但你脑子里得先有”三焦段分工""焦点延迟揭晓""声音衔接时空”这些导演判断,才写得出这份脚本。

会用工具的人越来越多,能写出这种脚本的人没变多。稀缺的从来不是生成能力,是知道该生成什么。

想自己复刻:实操路径

博主提了一句关键:这个镜头要”垫场景图和人物图”。翻译成可操作的步骤:

  1. 先备两张参考图——一张场景图(玄关 + 那面墙的陈设)、一张人物图(角色形象),用来锁一致性;
  2. 喂双轨提示词给支持参考图/首尾帧的视频模型(Seedance、可灵、Vidu 这类),把”固定机位”和”rack focus 虚转实”当成最关键的描述写进去;
  3. 音效层单独处理——目前大多数模型音画同生不稳,稳妥做法是画面出完,再按那条”逐秒音轨”单独铺音效/配音。固定机位 + 后期补音,反而是最可控的组合。

一个值得抄的判断:背景别堆太满

博主还点了原片一个毛病:那面墙信息太杂——照片、便签、贴纸、挂件一大堆,反而误导观众,不知道该看哪儿。他的建议是:身份揭示只保留核心两件——一个罗盘(交代职业)+ 一张闺蜜照(埋剧情伏笔)就够。

这正是《电影人之眼》第一章讲的:画面里每个元素都该有用意,没用意的就是噪音。

这条对做 AI 视频尤其要命:AI 最爱往背景里塞细节(它以为这叫”丰富”),你得主动做减法。否则三层叙事里最微妙的”身份层”,会糊成一团认不出。

可以直接抄走的 5 条

  1. 想让一个镜头信息密度高,别靠剪,靠焦段分工:前景悬念 / 中景剧情 / 后景身份。
  2. 关键物品先虚焦吊胃口,关键时刻 rack focus 揭晓,观众会”恍然大悟”。
  3. 固定机位讲不清的过程,用画外音(脚步 / 开关门 / 物件声)来衔接和补叙。
  4. 写 AI 视频提示词时,把音效当独立一轨逐秒写死,别指望模型自动配。
  5. 背景做减法:身份 / 信息只留 1–2 个有意义的元素,其余都是噪音。

工具会越来越能生成,但”一个镜头讲三件事”这种事,靠的还是有人先在脑子里把它设计出来。AI 时代值得练的,是这部分。