两个能直接抄的 AI 生成提示词模板:一个用来「文生视频」,一个用来「看图反推」。前者把一句视频提示词拆成 6 个固定槽位,后者把一张满意的图沿 8 个维度逆向拆成可复用的提示词。都给到「是什么 + 怎么填 + 填好示例」,拿来就能套。

一、文生视频 6 段法

一条好的文生视频提示词,本质是 6 个槽位各填一句,按固定顺序拼成一句话。顺序固定、各管一件事,模型不容易理解错;换内容时只换槽位里的名词,骨架不动。

公式:[主体] + [动作] + [场景] + [相机] + [风格] + [质感] 读法:谁 + 在干嘛 + 在哪儿/什么光 + 怎么拍 + 什么画风 + 什么质感。

6 段缺一段也能出片,但越全越可控。其中镜头、风格、质感这几段用英文术语命中率最高(模型训练语料里这些词本就是英文)。

逐段填法

① 主体 —— 画面主角,只放 1 个,多了会糊。名词 + 2~3 个修饰词。 示例:一只橘色狸花猫,琥珀色眼睛、毛发蓬松

② 动作 —— 主体正在做什么,用进行时动词,一个连贯动作就好。 示例:慵懒地舔了舔爪子,然后抬头望向镜头

③ 场景 —— 地点 + 时间/光线,环境和光一起定,基调就稳了。 示例:洒满午后阳光的木质窗台上,窗外是虚化的绿色庭院

④ 相机 —— 景别 + 角度 + 运镜,最影响「像不像专业片」,用英文术语最稳。 示例:特写,缓缓推近(close-up, slow dolly in)

相机词速查:

类别常用词(中 / 英)
景别大特写 extreme close-up · 特写 close-up · 中景 medium shot · 全景 wide shot · 大全景 establishing shot
角度平视 eye-level · 俯拍 high angle · 仰拍 low angle · 顶视 top-down · 主观视角 POV
运镜推 dolly in · 拉 dolly out · 摇 pan/tilt · 跟拍 tracking · 环绕 orbit · 升降 crane · 航拍 aerial · 手持 handheld · 固定 static

⑤ 风格 —— 整体画风,选一个主风格词别混叠。 示例:写实电影感(photorealistic)。常用:cartoon / 3D render / cyberpunk / Ghibli / 国风水墨 / claymation / pixel art / oil painting。

⑥ 质感 —— 清晰度与光影的「高级感」收尾,挑 2~3 个叠加。 示例:cinematic, 4K, 浅景深, 柔和体积光。常用:film grain / bokeh / volumetric lighting / motion blur / HDR。

拼好的成品

中文版:

一只橘色狸花猫、琥珀色眼睛毛发蓬松,慵懒地舔爪子然后抬头望向镜头,在洒满午后阳光的木质窗台上、窗外是虚化的绿色庭院,特写缓缓推近,写实电影感,cinematic、4K、浅景深、柔和体积光。

英文版(出片最稳):

A fluffy orange tabby cat with amber eyes, lazily licking its paw then looking up at the camera, on a wooden windowsill bathed in warm afternoon sunlight with a blurred green garden outside, close-up with a slow dolly in, photorealistic cinematic style, 4K, shallow depth of field, soft volumetric lighting.

几个坑

  • 单主体原则:一句塞 2 个以上主体容易粘连变形,要多主体就拆多镜分别生成再剪。
  • 运镜别贪多:一镜一个主运动(推 or 摇 or 跟),三个一起画面会乱晃。
  • 抽象情绪要翻成可见画面:「忧伤」「高级感」模型读不准,换成冷色调/逆光/慢动作。
  • 镜头/风格/质感段用英文:这些是标准术语,中文同义词命中率低。
  • 图生视频时,主体/场景已由图决定,重点写②动作 + ④相机运镜两段即可。

二、图片反推 8 维模板

用途反过来:看到一张别人生成的好图 / 爆款图,想知道「它怎么生成的、我怎么复刻一张同款」。做法是把图丢给多模态模型(GPT-4o / Claude / Gemini),让它沿 8 个维度逐项分析,再吐出英文 80 词 + 中文 50 词两段成品提示词,拿去文生图直接出。

8 维:①主体 ②风格 ③构图 ④光线 ⑤色调 ⑥细节 ⑦氛围 ⑧技术参数 前 7 维是「画面读出来的内容」,第 8 维是「出图要带的参数」。

直接复制这段,连图一起发给模型

你是资深 AI 绘画提示词工程师。请仔细观察我给你的这张图,沿下面 8 个维度逐项分析,
然后输出两段可直接喂给文生图模型的提示词:① 英文版约 80 词,② 中文版约 50 词。

8 个维度:
1 主体——画面主角是什么、几个、什么姿态/表情
2 风格——写实/插画/赛博朋克/油画/3D… 像哪位艺术家或哪种流派
3 构图——景别(特写/全景/俯视/低角)+ 主体在画面里的位置
4 光线——光源方向、强弱、硬光还是柔光、几点的光
5 色调——主色+辅色、冷暖、饱和度高低
6 细节——服饰/材质/纹理/道具等让画面可信的具体元素
7 氛围——情绪、时间、天气、想传达的感觉
8 技术参数——建议的宽高比(--ar)、质量词、推荐用哪个出图模型

请先逐维列出你从图里读到的内容,再给两段成品提示词。模型名只是「推测」请标注。

8 维怎么读

维度从图里读什么示例
① 主体几个、是谁、什么姿态银发短发赛博少女,半身侧脸
② 风格写实/插画?哪一路?像谁赛博朋克写实插画,《银翼杀手》感
③ 构图景别 + 角度 + 主体位置半身特写、低角仰拍、主体偏左
④ 光线方向/强弱/软硬/色温侧逆光,冷蓝主光 + 品红霓虹轮廓光
⑤ 色调主色 + 冷暖 + 饱和冷青蓝为主、品红点缀、高饱和
⑥ 细节服饰/材质/纹理/道具机能夹克金属拉链、皮肤雨珠、电路纹身
⑦ 氛围情绪/时间/天气雨夜,孤冷又锋利
⑧ 技术参数画幅/质量词/模型—ar 2:3,8k ultra-detailed,推测 MJ

反推出的成品

英文版(约 80 词):

A silver-haired cyberpunk girl with short hair, half-body, looking to the right, photorealistic cyberpunk illustration in Blade Runner style. Low-angle medium close-up, subject on the left, neon city behind. Side backlight with cold blue key light and magenta neon rim light, hard high-contrast lighting. Cold teal palette with magenta accents, high saturation. Black tech jacket with metal zippers, rain droplets on skin, glowing circuit tattoo, holographic billboards. Rainy night, lonely and sharp mood. —ar 2:3, masterpiece, ultra-detailed, 8k.

中文版(约 50 词):

银发短发赛博朋克少女半身侧望,写实赛博插画《银翼杀手》风。低角度半身特写、主体偏左、背景霓虹都市。侧逆光,冷蓝主光配品红霓虹轮廓光,硬光高对比。冷青蓝主调点缀品红、高饱和。黑色机能夹克金属拉链、皮肤雨珠反光、发光电路纹身、全息广告牌。雨夜孤冷锋利。竖图 2:3,超精细 8k。

几个坑

  • 模型名只能「推测」:反推无法 100% 确定原图用了哪个模型,涉及模型/参数都标推测。
  • 英文 80 词别超太多:部分模型对超长 prompt 会截断或权重稀释,80 词是甜点区,想强调的词往前放。
  • 主体数量先数清:人/物数错,复刻必崩。
  • 抽象词落到画面:「高级感」「孤独」翻成留白/冷调/逆光等可见元素。
  • —ar 跟原图画幅走:竖图 2:3、横图 16:9、方图 1:1。
  • 复刻是学方法,不抄袭他人受版权保护的具体角色/品牌形象,商用前自查版权。

两个模板一正一反:6 段法把想法拼成视频提示词,8 维反推把满意的图拆回提示词。攒多了就是一套自己的「提示词卡片库」,下次直接调。