人物一致性
更新于 2026 年 9 月 21 日

把长相写进提示词,等于每一段都请模型重新想象一次这个人。同一句「二十七八岁、丹凤眼、左眉有疤」,这一段是一张脸、下一段是另一张——模型没有跨次调用的记忆。
参考图才有效:带参考图的视频模型会把图里的长相、发型、衣着、配饰原样照搬。这是它的天性。我们做的是把这个天性用在对的地方——先出一张定妆照,之后每一段都拿它当参考。
每一镜都带一份「画面内」名单。这份名单决定谁拿到脸和参考图——不是正文的措辞。
被提到但不在画面里的人(「朝门口喊」的那个对象、电话那头的人)会被写成画面外的说法,不挂脸。这一条是拿数据换来的:早先把画外的人也点名,逐帧看下来八拍里五拍换脸或凭空多出人;改成只写方位之后,十二拍零换脸。
所以成片里多出一张没见过的脸,第一步是去看那一镜的名单,而不是往正文里加形容词。
本集上一段已经有干净成片、而且是同一场戏接着演的时候,系统会把上一段的最后一帧也挂成参考图。好处是状态延续得住——人还在床上、伤还在、桌上的东西没动。
代价要说清楚:同一个人的镜头会照搬那一帧的取景,该切近景的时候可能被拽回同样的中景。这是整帧参考图本身带来的,换个说法、放到第几张都改不掉。条件不满足时(换了地点、时间跳了、人换了、状态图变了)会自动不挂。
生成是有概率的。同一段文字跑两次会给两条不同的片子,一致性是把概率往上推,不是保证。四个人以上同框、连续格斗这类画面,出问题的概率明显更高。
两个角色写得太像(同龄、同性别、同一身衣服),也会互相污染。真正管用的做法是在人物库里给每人一个一眼能认的视觉锚点——一道疤、一个饰品、一个发型——而不是指望模型分辨两段相似的描述。
常见三种:这个角色没有设定图(只有文字描述)、那一镜的「画面内」名单里没有他却在正文点了名、或者他和另一个角色的外貌描述太像。前两种改完就好,第三种要在人物库里给两人拉开区分度。
不能保证——生成是概率性的。设定图 + 画面内名单 + 上一段末帧这三层是把概率推上去的结构,不是承诺。人多、动作复杂的镜头出错概率更高。
不能用于还原真实自然人的面孔,这是明令禁止的。可以上传你自己画的或有权使用的人设图。
同场衔接时上一段的最后一帧被挂成了参考图,取景会被它拽住。改上一段的分镜文字可以把那一帧摘下来。
写清楚这一镜画面里到底有谁(只写真的在画面里的)、给每人一个视觉锚点、别在一镜里塞四个人以上。两人对手戏用侧面双人镜或过肩镜,比「A 面朝 B、B 在景深处」稳得多。
定价·指南·样片·帮助与支持·隐私政策·用户协议·法律信息·联系我们·© 2026 SceneMixer·苏ICP备2026040569号-1