说话的人物

AI 生成会说话的人物:声音与画面一起出

更新于 2026 年 9 月 21 日

一句话:默认的视频模型是音画同生的:台词写在分镜里,生成那一次就把画面、口型和声音一起出了,不是先出画面再配音。所以「谁在说」「谁不说」必须在分镜里写清楚。
SceneMixer 生成的 AI 短剧《问剑青云》成片画面(6 个角色、1 集)
样片《问剑青云》:3D CG动画仙侠玄幻 · 1 集,由 SceneMixer 流水线从剧本直接生成 · 看整集

音画同生意味着什么

好处是口型和声音天然对得上,不需要额外的对口型步骤,也不需要为配音再花一次钱。

代价是这一次生成决定一切:台词写错了、说话人标错了,不能只重配音,得重出这一段。所以出片前把分镜读一遍是最省钱的动作——改文字免费,重出视频每次都再扣一次。

谁在说、谁不说,要写清楚

不说话的人会被显式标注闭唇。没有这一句,画面里常出现两三个人嘴同时在动、却只有一条人声的情形。

画外音那几镜,画面里的人全部闭嘴——声音来自画面之外。旁白、电话那头、对讲、广播都是这一类,在台词的括注里标明即可。

说话人如果不在这一镜的画面内名单里,会自动按画外音处理,不给他挂脸。

能做到什么程度

实话实说:口型对得上是概率性的,不是保证。近景单人说话最稳;多人同框、快速交替对白、侧脸和远景都会明显变差。

实用的做法是把对白拆开——一句一镜、切到谁说话就拍谁。这在一段内部是免费的(一次生成里的切换),比让三个人在一个中景里轮流说话稳得多。

声音从哪来

角色配了预置音色就用那个;没配就按角色的文字音色描述来演。语速与语气受台词括注里的演法提示影响。

台词会被逐字念出来,不改写、不增删。所以台词里不要写「他解释了半天」这种叙述,那会被当成台词念出来。

常见问题

需要单独做对口型吗?

不需要。默认的视频模型是音画同生的,生成那一次就把画面、口型和声音一起出了。

口型一定对得上吗?

不保证。近景单人说话最稳;多人同框、快速交替对白、侧脸远景会明显变差。把对白拆成一句一镜会好很多。

能只重新配音吗?

不能。声音和画面是同一次生成的产物,改台词要重出这一段。所以出片前把分镜读一遍最省钱。

为什么画面里好几个人嘴在动?

那一镜没有把非说话人标成闭唇。分镜里补上这一句,改文字免费。

旁白怎么做?

在台词括注里标成画外音。那一镜画面里的人会全部闭嘴,声音来自画面之外。

让人物自己把话说出来

台词写在分镜里,出片时声音和画面一起生成。

免费试用 SceneMixer

注册送 50 积分 · 积分包 ¥6.90 起 · 会员 ¥49/月起

定价·指南·样片·帮助与支持·隐私政策·用户协议·法律信息·联系我们·© 2026 SceneMixer·苏ICP备2026040569号-1