指南 · 制作
发布于 2026 年 9 月 5 日 · 更新于 2026 年 9 月 12 日

| 症状 | 根因 | 落在哪一层 |
|---|---|---|
| 同一角色隔几段就换一张脸,越来越「大众脸」 | 文字描述被稀释:长相描写夹在大段动作与技术指令中间,模型退回到「好看的脸」先验 | 第一层:设定图里身份特征没有打头,或每段生成没带参考图 |
| 脸对了,但同一场景里每个镜头的光和色调都在变 | 参考图烘进了光:定妆照或场景图自带戏剧化布光,被每个镜头继承后与分镜布光打架 | 第二层:参考图不中性 |
| 同一段里人物位置、动作、道具状态前后不接;不在场的人突然入画 | 镜头之间没有锚点:分镜没写承接,或用「某某出画」这种否定句点名了不在画面的人 | 第三层:分镜承接 |
角色设定图的目的是辨识度,不是气氛。四条硬规则:
已知反例:大衣、长衫类角色在 9:16 全身构图里会「服装吞人」,米白大衣占七成画面、脸缩得很小。这是构图的物理限制,解法是另出一张半身定妆照专门承载脸部辨识度,代价是每角色多一张图。
在 SceneMixer 里,剧本解析产出的 appearance 字段直接成为设定图提示词的主语,每个角色固定出一张 9:16 白底全身照并自动裁出脸部与半身参考,后续每段视频生成时自动带上该角色的参考图。评估设定图质量前先确认是哪个模型在出图:不同图像模型的输出尺寸和先验差别很大,判断依据是图片尺寸与任务记录,不是肉眼猜。
场景图是给视频当参考的「空景板」,标准同样是中性:
场景风格(美术基调)是项目级设置,只进场景图、道具图和视频提示词,不进角色图,否则白底定妆照就被打上了场景的光。
| 模型 | 参考输入 | 单次时长 | 说明 | 核查日期 |
|---|---|---|---|---|
| Seedance 2.0(火山方舟) | 文本 + 图片 / 视频 / 音频多模态参考,图片可指定首帧、尾帧或参考图角色 | 4–15 秒 | 音画同生;参考图 ≤30MB、宽高 300–6000px;本站默认视频链路之一 | 2026-09-05,据火山方舟 API 文档 |
| Seedance 2.5 | 多模态参考,参考数量上限高于 2.0 | 最长约 30 秒 | 参数以官方文档为准,本文未逐项核验 | 2026-09-05 |
| 即梦 / 可灵 / 万相 | 均支持图片参考或首尾帧 | 各不相同 | 参考图上限与多镜头能力以各官方页为准;无论哪家,白底定妆照 + 中性 plate 的做法通用 | 2026-09-05 |
模型参数变得很快,表里只写核验过的项,其余留空而不是猜。真正决定一致性的不是参考图上限是 9 张还是 50 张,而是你喂进去的那几张是不是中性的。
验收不过的镜头,按上面的三层对号入座回去修那一层,不要笼统地「加强提示词」。
剧本层面怎么为一致性打基础(地点名统一、每集场景 ≤3–4 个),见竖屏短剧剧本格式与钩子结构;AI 标识与肖像合规见2026 微短剧新规解读。想看这套方法跑出来的整集,去样片页,每部都能看到角色表和逐段成片。
因为参考图里烘进去的光和背景会被这个角色出现的每一个镜头继承。定妆照带了夜景冷光,白天的戏也会偏冷;带了背景道具,模型会把它当成角色的一部分反复画出来。白底加一盏 75° 侧向主光只负责把脸的立体结构交代清楚,不带任何场景信息,才能被任意镜头的布光覆盖。
先分层排查:同一角色不同镜头脸不一样,是设定图层的问题,检查设定图是不是平光、脸在画面里是不是太小;脸对了但衣服光影乱跳,是场景 plate 或分镜布光在打架;同一段里人物动作前后不接,是分镜承接没写延续。三层各自有各自的修法,混在一起改提示词只会越改越乱。
不能。文字描述在几十段生成里会被每段不同的动作、场景、布光指令稀释,模型退回到「好看的脸」先验。稳定的做法是每段生成都带同一张角色设定图作为参考图,文字只负责这一段的动作与情绪。
最少一张 9:16 全身白底定妆照,主要角色建议加一张脸部裁切用于近景参考。长外套、长衫类角色容易「服装吞人」,可以另出一张半身照专门承载脸部辨识度,成本是每角色多一张图。
解析出的外貌描述直接成为设定图的主语,白底定妆照与场景 plate 自动带进每一段视频生成。
免费注册 SceneMixer先看样片里同一角色跨镜头的表现,再决定要不要试。
定价·指南·样片·帮助与支持·隐私政策·用户协议·法律信息·联系我们·© 2026 SceneMixer·苏ICP备2026040569号-1