director.staging
多角色调度方法论——3 人以上同框的站位设计/视线网络/注意力引导/前后景分层/AI 生成中的多角色一致性控制;Nomi 写多人 shot 的 prompt(谁站哪/朝向/视线/谁是焦点)时参考,走应用内 Seedance/可灵生成。
git clone --depth 1 https://github.com/aqm857886159/Nomi /tmp/director.staging && cp -r /tmp/director.staging/skills/director-staging ~/.claude/skills/director.stagingSKILL.md
# 多角色调度方法论
写多人戏 shot 时用。核心产出是**一段能写进 shot `prompt` 字段的调度描述**:谁站哪、朝向哪、视线看谁、这一刻谁是焦点——经应用内 Seedance/可灵生成。走位交给自然语言相对位置(画面左/右/中央偏后、前景/背景),**不钉坐标**。
**为什么要它**:AI 生成多角色场景时,角色越多越难控制——位置漂移、角色融合、动作混乱。3 人以上同框如果没有明确的调度设计,生成结果一定是乱的。调度的本质 = 在每个瞬间告诉观众「现在看谁」。
## 底层逻辑:一刻一焦点
画面同时出现多个角色时,观众只能关注一个。让某个角色成为焦点的手段(写进 prompt):
1. **空间位置**——谁在前景、谁在背景。
2. **动作差异**——在动的人比静止的人吸引注意力。
3. **光线引导**——亮的人比暗的人吸引注意力。
4. **视线汇聚**——其他角色都在看的那个人 = 焦点。
5. **景别选择**——近景中的角色比远景中的角色更受关注。
## 站位设计模板
写 prompt 时先选一个站位骨架,用相对位置落到文字里。
**三人 · 三角站位**
```
A
/ \
B C
```
最稳定的三人构图。A 在顶点 = A 是焦点/决策者。变体:等腰三角(三人平等)、锐角三角(A 远离 BC = A 被孤立/对立)。适用:讨论、对峙、一对二的谈判。
**三人 · 一字排列**
```
A — B — C
```
三人面向同一方向或面向镜头。B 在中间 = B 是视觉中心。适用:共同面对某个事物(屏幕、窗外景象)、仪式、并肩。
**四人 · 菱形/方形**
```
A
B C
D
```
A 和 D 是对角线上的主要交流者,B 和 C 是旁观者/辅助者。适用:会议、审讯(A 审 D,BC 旁听)。
**四人以上 · 层次分组**
超过 4 人时不要让每个人都有独立存在感,分三层:
- **焦点组(1-2 人)**:前景,有动作和台词——prompt 里详细描述。
- **反应组(1-2 人)**:中景,有反应表情——简要提及朝向。
- **背景组(其余)**:后景,存在但不吸引注意力——一句话带过。
## 视线网络设计
多角色场景里视线关系是最重要的调度工具。选一种写进 prompt。
**视线汇聚**(所有人看一个人)
```
B -> A <- C
^
D
```
A 是绝对焦点、权力/信息中心。适用:演讲、审判、宣布决定。prompt 写法:「所有人的视线集中在 A 身上。」
**视线对抗**(两组人互看)
```
A -> <- B
C -> <- D
```
两个阵营对立。适用:谈判、对峙、两队交锋前。prompt 写法:「A 和 C 面向右侧注视 B 和 D,B 和 D 面向左侧回视。」
**视线分散**(各看各的)
```
A ->
B v
C <-
```
没有焦点,混乱/各怀心思/尴尬。适用:争吵后的沉默、各自思考、信任瓦解。
**视线传递**(接力看)
```
A -> B -> C -> D
```
信息或反应在角色之间传递。适用:消息传来时的连锁反应。按时间顺序写进 prompt:「A 先抬头看向 B,B 转头看向 C,C 的表情凝固。」
## 注意力引导:让出焦点
每个时刻画面里有且只有一个焦点角色,其他角色要「让」出注意力。
| 「让」的方式 | 效果 | prompt 示例 |
|------|------|-----------|
| 静止 | 动的人吸引注意力 | 「B 和 C 保持静止,A 站起身」 |
| 虚焦 | 清晰的人吸引注意力 | 「前景 B 虚焦,焦点在后方的 A」 |
| 暗光 | 亮的人吸引注意力 | 「A 被顶灯照亮,B 和 C 在阴影中」 |
| 背对 | 正面的人吸引注意力 | 「B 背对镜头,A 正面面向镜头」 |
| 低姿态 | 高位的人吸引注意力 | 「B 和 C 坐着,A 站着俯视」 |
**焦点切换**(视频镜头内从 A 转到 B)需要一个「交接动作」,别突然跳:A 的视线转向 B(最常用)/ A 说了 B 的名字 / 镜头从 A 推向 B / A 停止动作、B 开始动作。**同一条 prompt 里不要同时让两个角色做大动作**——AI 会混乱。一刻一焦点,切换要有明确交接。
## AI 生成中的多角色控制策略
**角色数量 → 可靠度 → 写法**
| 同框人数 | 可靠度 | 建议 |
|---------|-------|------|
| 2 人 | 高 | 自由发挥 |
| 3 人 | 中高 | 明确站位,焦点角色详细描述 |
| 4 人 | 中 | 焦点组 + 背景组分层描述 |
| 5+ 人 | 低 | 焦点组详细,其余「模糊存在」 |
**3 人场景**——详细描述每个人的位置、朝向和动作:
> 画面中三人呈三角站位。角色A(画面左侧,面朝右)双臂交叉在胸前。角色B(画面右侧,面朝左)靠在墙上。角色C(画面中央偏后,面朝镜头)坐在椅子上,双手放在扶手上。角色A 和角色B 的视线都指向角色C。
**4+ 人场景**——焦点组详细 + 其余模糊:
> 前景:角色A 站在台前,双手撑在台面上(焦点,详细动作和表情)。中景:角色B 和角色C 分立两侧,面向角色A(反应组,简要朝向)。背景:其余人站在各自岗位上,注视着角色A(一句带过)。
**群演/多人背景**——不逐个描述,用整体:
> 空间内各操作台前坐满了人——有低头操作终端的、有交头接耳的、有盯着投影的。
**避免事项**
- 不要在一条 prompt 里让 3 个以上角色同时做不同的大动作。
- 不要在中景/远景里要求 AI 展现微表情(看不清)。
- 不要给背景角色太多描述——AI 会把注意力分散到背景上。
- 不要让角色站在几乎相同的位置——AI 可能把两人「融合」。
## 多角色的一致性
同一个人跨多个多人 shot 出现,靠 anchor 机制锁长相(Nomi 的锚/参考图 + 首尾帧承接,细节见 director-consistency,本文不重复):镜头引用角色锚、**prompt 里不重描外貌**,只写这一刻的站位/朝向/视线/动作。站位模板与视线网络负责的是**空间关系**,anchor 负责的是**身份不漂移**,两者叠加才稳。
站位相关的一致性提醒:
- 别让两个角色站几乎同一位置(会融合),拉开前后景或左右距离。
- 群演/一次性配角不建锚,用去个性化描述(戴盔/背影/远景)避穿帮。
- 手部特写易多指,多人场景非必要不给手特写。
## 核心原则
- 每个时刻只有一个焦点;焦点切换必须有交接动作,不能突然跳。
- 能用 2 人讲的故事不要用 4 人——角色越多越难控制。
- 5 人以上同框:先用远景/全景建立一次空间关系,再切到 2-3 人的近景组合分别演。
- 背景角色「存在」就够了,不需要详细描述。Mandatory for every Nomi corrective change: user-reported bugs, regressions, CI-only failures, flaky tests, performance or security defects, review/audit findings, and compatibility failures in any production path. Classify one_off versus recurring before implementation. Recurring and high-risk repairs require a schema-v3 contract, shared enforcement boundary, structural prevention, dependency lifecycle decision, and changed regression evidence.
品牌宣传片 playbook。把产品文案/卖点做成一条「3 秒钩子 → 卖点 → 使用场景 → 行动号召」的短宣传片,分阶段执行(剧本审阅 → 拆镜 → 落画布 → 生成 → 排时间轴),每阶段暂停让用户审阅。
编辑创作区文档:读取当前内容,追加或替换文本,维护分镜描述格式。
非对抗性动作场景(跑酷/追逐/攀爬/特技/坠落)的动作编排知识——专业动作词汇、环境交互、动作节奏、FPV 追拍、身体力学约束、怎么把动作精确物理化地描述进视频提示词;Nomi 写动作戏 shot 时参考。
服化道——设计「人物设定图」与「场景环境图」的生图提示词,含顶部「风格前缀块」(摄影机/胶片/调色/画幅等烧进画面的统一风格)+ 生图 avoid(多指/文字水印/穿帮等)+ identity DNA(角色跨图一致的关键特征锁定)。Nomi 为角色/场景等视觉 anchor(`carrier: visual`)生成参考图、写它的生图 prompt 时参考。
镜头语言与摄影技法方法论——统一景别体系/构图规则/运镜的情绪语言/打光方案/景深控制/色温光源/镜头特性,以及这些怎么翻译成视频提示词该怎么写。Nomi 拆镜头或写视频 shot 的 prompt 时参考。