指南 · 制作

2026 AI 短剧角色一致性方法论:为什么「换个镜头就换脸」,设定图、参考图、分镜三层怎么锁

发布于 2026 年 9 月 5 日 · 更新于 2026 年 9 月 12 日

快速结论:AI 短剧的角色一致性指同一角色在全剧几十到上百个镜头里保持同一张脸、同一套服化道、同一种美术基调,它是 2026 年 AI 短剧被平台和观众拒绝的第一原因。一致性不是靠提示词措辞解决的,而是三层各自锁定:第一层角色设定图(白底、方向光、身份特征打头),第二层场景 plate(无人空景、三层纵深、写光源位置),第三层分镜承接(段内动作与位置延续、不点名不在画面的人)。跳脸的三个根因分别对应这三层:文字描述被稀释、参考图烘进了光、镜头之间没有锚点。下面逐层给可执行的做法、工具参考图参数和一份 5 镜头验收清单。
SceneMixer 生成的 AI 短剧《仙骨问罪》成片画面(6 个角色、1 集)
样片《仙骨问罪》:3D CG动画仙侠玄幻 · 1 集,由 SceneMixer 流水线从剧本直接生成 · 看整集

一致性的三层定义

  1. 身份特征层:脸型、眉眼、鼻唇、肤色、发型发色、体型、年龄感,以及一个极易识别的视觉锚点(疤、痣、饰品、发型)。这一层由角色设定图承载。
  2. 服化道层:这一场穿什么、拿什么、场景里有什么。由解析产出的逐角色服装描述和场景 plate 承载,注意服装是逐角色、逐阶层的,不是全剧一个风格标签。
  3. 光与美术层:色彩纪律、材质、陈设密度、光源位置。由场景 plate 和分镜里的布光指令承载,参考图本身要保持中性。

为什么会跳脸:三个根因

症状根因落在哪一层
同一角色隔几段就换一张脸,越来越「大众脸」文字描述被稀释:长相描写夹在大段动作与技术指令中间,模型退回到「好看的脸」先验第一层:设定图里身份特征没有打头,或每段生成没带参考图
脸对了,但同一场景里每个镜头的光和色调都在变参考图烘进了光:定妆照或场景图自带戏剧化布光,被每个镜头继承后与分镜布光打架第二层:参考图不中性
同一段里人物位置、动作、道具状态前后不接;不在场的人突然入画镜头之间没有锚点:分镜没写承接,或用「某某出画」这种否定句点名了不在画面的人第三层:分镜承接

第一层:角色设定图(定妆照)

角色设定图的目的是辨识度,不是气氛。四条硬规则:

已知反例:大衣、长衫类角色在 9:16 全身构图里会「服装吞人」,米白大衣占七成画面、脸缩得很小。这是构图的物理限制,解法是另出一张半身定妆照专门承载脸部辨识度,代价是每角色多一张图。

在 SceneMixer 里,剧本解析产出的 appearance 字段直接成为设定图提示词的主语,每个角色固定出一张 9:16 白底全身照并自动裁出脸部与半身参考,后续每段视频生成时自动带上该角色的参考图。评估设定图质量前先确认是哪个模型在出图:不同图像模型的输出尺寸和先验差别很大,判断依据是图片尺寸与任务记录,不是肉眼猜。

第二层:场景 plate

场景图是给视频当参考的「空景板」,标准同样是中性:

场景风格(美术基调)是项目级设置,只进场景图、道具图和视频提示词,不进角色图,否则白底定妆照就被打上了场景的光。

第三层:分镜里的承接

工具参考图参数对照

模型参考输入单次时长说明核查日期
Seedance 2.0(火山方舟)文本 + 图片 / 视频 / 音频多模态参考,图片可指定首帧、尾帧或参考图角色4–15 秒音画同生;参考图 ≤30MB、宽高 300–6000px;本站默认视频链路之一2026-09-05,据火山方舟 API 文档
Seedance 2.5多模态参考,参考数量上限高于 2.0最长约 30 秒参数以官方文档为准,本文未逐项核验2026-09-05
即梦 / 可灵 / 万相均支持图片参考或首尾帧各不相同参考图上限与多镜头能力以各官方页为准;无论哪家,白底定妆照 + 中性 plate 的做法通用2026-09-05

模型参数变得很快,表里只写核验过的项,其余留空而不是猜。真正决定一致性的不是参考图上限是 9 张还是 50 张,而是你喂进去的那几张是不是中性的。

验收清单:同一角色的 5 个镜头并排看

验收不过的镜头,按上面的三层对号入座回去修那一层,不要笼统地「加强提示词」。

延伸

剧本层面怎么为一致性打基础(地点名统一、每集场景 ≤3–4 个),见竖屏短剧剧本格式与钩子结构;AI 标识与肖像合规见2026 微短剧新规解读。想看这套方法跑出来的整集,去样片页,每部都能看到角色表和逐段成片。

常见问题

为什么参考图要白底?

因为参考图里烘进去的光和背景会被这个角色出现的每一个镜头继承。定妆照带了夜景冷光,白天的戏也会偏冷;带了背景道具,模型会把它当成角色的一部分反复画出来。白底加一盏 75° 侧向主光只负责把脸的立体结构交代清楚,不带任何场景信息,才能被任意镜头的布光覆盖。

AI 视频人物不一致怎么解决?

先分层排查:同一角色不同镜头脸不一样,是设定图层的问题,检查设定图是不是平光、脸在画面里是不是太小;脸对了但衣服光影乱跳,是场景 plate 或分镜布光在打架;同一段里人物动作前后不接,是分镜承接没写延续。三层各自有各自的修法,混在一起改提示词只会越改越乱。

只靠在提示词里反复描写长相能保持一致吗?

不能。文字描述在几十段生成里会被每段不同的动作、场景、布光指令稀释,模型退回到「好看的脸」先验。稳定的做法是每段生成都带同一张角色设定图作为参考图,文字只负责这一段的动作与情绪。

一部剧需要给每个角色做几张设定图?

最少一张 9:16 全身白底定妆照,主要角色建议加一张脸部裁切用于近景参考。长外套、长衫类角色容易「服装吞人」,可以另出一张半身照专门承载脸部辨识度,成本是每角色多一张图。

三层锁定,已经内置在流水线里

解析出的外貌描述直接成为设定图的主语,白底定妆照与场景 plate 自动带进每一段视频生成。

免费注册 SceneMixer

先看样片里同一角色跨镜头的表现,再决定要不要试。

定价·指南·样片·帮助与支持·隐私政策·用户协议·法律信息·联系我们·© 2026 SceneMixer·苏ICP备2026040569号-1