AI 配音别只写“有感情”
先别急着调音色
很多人做 AI 配音,第一反应是找“更像真人”的音色。其实问题往往不在音色,而在提示词太空:伤心一点、愤怒一点、自然一点。AI 不是演员本人,它不知道你说的“自然”到底是压着火、忍着哭,还是故作轻松。
活人感配音的核心,不是让 AI “有情绪”,而是让 AI 知道这个人为什么这样说、说给谁听、说到哪一句绷不住。
笼统提示词为什么没用
“委屈”“愤怒”“害怕”只是情绪标签,不是表演指令。真人说话有层次:有人嘴上平静,其实尾音发抖;有人很生气,但因为在公共场合,只能压低声音;有人害怕,不一定尖叫,可能是语速变快、句子变短、呼吸变浅。
所以,AI 配音提示词要从“情绪词”升级成“表演说明书”。
四层提示词法
可以按这四层写:
- 场景:谁在对谁说,刚发生了什么。
- 情绪:主情绪是什么,副情绪是什么。
- 声音动作:语速、音量、停顿、气息、尾音、重音。
- 边界:不要播音腔,不要夸张,不要像广告,不要哭喊。
一个可直接套用的模板:
你在对【对象】说这段话,刚经历了【事件】。主情绪是【情绪】,但要带一点【副情绪】。语速【快/慢/正常】,音量【偏低/正常/提高】,关键句“【句子】”前停顿一下,尾音【收住/发抖/下沉/变轻】。整体像真实对话,不像朗读稿,也不要播音腔。
比如“委屈”不要只写委屈,可以写:声音压低,语速变慢,前半段努力克制,后半段尾音有点发抖,但不要哭腔太重。这样 AI 才能抓到故事感。
教育内容怎么用
对内容和教育行业来说,AI 配音不是只为了省人声成本,而是为了提升表达密度。比如讲公考申论、面试题、学习方法,如果全程一个平直声音,用户很快走神。
可以把一条内容拆成三种声音状态:
开头用“提醒感”,语速略快,制造注意力;讲方法时用“稳定感”,声音清楚、节奏均匀;讲误区或痛点时用“代入感”,稍微放慢,停顿更多。
这比单纯追求“声音好听”更有用。因为用户不是来听播音作品的,他是在判断:这内容和我有没有关系,我要不要继续听。
一张自查清单
每次生成前,先问自己五个问题:
这句话是谁说给谁听?
他说这句话前发生了什么?
他是外放情绪,还是压着情绪?
哪一句最重要,需要停顿或重读?
我有没有写清楚不要什么风格?
如果这五个问题答不出来,生成出来大概率就是“AI 味”。如果答清楚了,即使不是顶级音色,也会更像一个人在说话。
最后的判断
AI 配音的竞争点,会从“谁的声音更像真人”,转向“谁更会给 AI 导演情绪”。提示词不是魔法咒语,而是给 AI 的表演分镜。普通人想把内容做得更有感染力,不必一上来研究复杂参数,先学会把情绪写细,把场景写实,把边界写清楚。
声音有故事,内容才更容易被听完。