director.sound
声音设计知识——环境音/音效/配乐情绪/沉默设计/听觉记号(leitmotif)/声画对位,仅供叙事规划与后期剪辑参考;⚠️视频生成提示词不含音频,这些内容不写进 shot 的 prompt,是给 Nomi 时间轴后期配音/配乐用的。
git clone --depth 1 https://github.com/aqm857886159/Nomi /tmp/director.sound && cp -r /tmp/director.sound/skills/director-sound ~/.claude/skills/director.soundSKILL.md
# 声音设计知识(叙事规划 + 后期参考) ## 先读这一条:这套知识不写进视频提示词 视频生成模型的提示词**不含音频**——环境音、音效、配乐、台词都不在画面模型的能力范围里,写进去要么被忽略、要么污染画面。**所以这个技能的产出绝不写进 shot 的 prompt。** 它服务两个阶段: - **叙事规划阶段**:给角色建声音标签、给场景设声音签名、规划听觉记号,作为一层薄薄的「听觉设计意图」跟着分镜走。它是规划时的参考,不是要塞进任何生成字段。 - **Nomi 时间轴后期阶段**:等画面生成好、进了 Nomi 时间轴,用于**音频轨的后期配音 / 音效 / 配乐规划**——按这套方法给每段画面配底层环境声、中层间歇声、前层动作音效,选配 BGM 情绪曲线。 核心理念:**观众闭上眼睛也应该能「听出」这是哪个场景、谁在说话、现在是什么情绪。** 声音不是画面的附属品,是独立的叙事层。 ## 角色声音标签 给每个主要角色一套声音标签,作为规划参考、后期配音时照它统一。四个维度: 1. **说话节奏** — 语速(快/中/慢/极慢);停顿习惯(频繁停顿/流利不停/关键词前停顿);句长(短句 ≤5 字 / 中句 / 一口气长句)。 2. **声线特征** — 音高(低沉/中等/偏高);质感(沙哑/清亮/鼻音重/气声);力度(轻声/正常/有力/压着嗓子)。 3. **情绪表达方式** — 外放型(生气会吼、开心笑出声)/ 内收型(生气压低音量、开心只语调微升)/ 极端内收(任何情绪几乎不改变声线)。 4. **标志性声音习惯** — 说话前清嗓、句尾叹气、思考时「嗯」的鼻音等。小习惯给角色「声音辨识度」。 记录格式示例(全片保持一致): | 角色 | 语速 | 句长 | 声线 | 情绪表达 | 标志习惯 | |------|------|------|------|---------|---------| | 角色A | 中偏快 | 短句 | 平板单调 | 极端内收 | 说完话后沉默·语气几乎无起伏 | | 角色B | 慢 | ≤5 字 | 低沉厚重 | 内收 | 句尾带鼻音哼声 | ## 环境音层次设计 每个场景的声音由三层构成,从远到近: **底层(Ambience / Room Tone)** — 持续不变的背景声,定义「这是什么空间」,同一场景全程一致。例: - 走廊:引擎/管线低频嗡鸣 + 远处液冷循环声 - 舰桥/机房:多终端低频电子嗡声 + 空调系统低鸣 - 静室/卧室:远处设备极弱低鸣 + 空气循环微弱气流声 - 户外空旷 / 深空:接近或完全寂静——寂静本身就是空间的声音签名 **中层(Specific Sounds)** — 间歇出现,增加真实感:广播通知、远处脚步、门的开合、杯子落桌、设备蜂鸣。 **前层(Foreground / Action Sounds)** — 角色动作产生、与画面动作精确同步:脚步声(不同材质地面声音不同)、呼吸声(平静/急促/屏气)、操作声(按钮/触屏/翻页/拉杆)。 ## 场景声音签名 给每个场景定义一个声音签名——一听就知道「到了这里」。在角色第一次进入该场景时建立,后续每次回到都保持一致: | 场景 | 底层 | 特征音 | 情绪感受 | |------|------|--------|---------| | 舰桥/机房 | 引擎低鸣 + 终端嗡声 | 键盘敲击、投影嗞嗞声 | 冷静有序的技术空间 | | 医护/维生区 | 循环泵脉冲 + 密封吱呀 | 偶尔气泡上升、辅助设备嘶嘶 | 令人不安的安静·机械维生感 | | 主角独处的房间 | 远处低鸣 | 空气循环微弱气流 | 独处的安全感·极简 | ## 听觉记号(Sound Motif / Leitmotif) 一个反复出现的声音元素,每次出现承载不同含义——和视觉母题(反复出现的物件)是同一逻辑。 **设计原则**: - 一部作品 2-3 个听觉记号就够,太多失去辨识度。 - 首次出现要足够清晰,让观众「记住」这个声音。 - 后续出现可变形(速度变化、混响变化、叠加其他声音)。 - 最后一次出现应有「回收」感——回到最初形态,或彻底变形。 **示例**: - 某段引擎启动声:第一次 = 任务开始;中段 = 逃离;结尾 = 归途。 - 某段循环水声:初到 = 陌生不适;适应期 = 平静背景;危机期 = 戛然而止。 **硬规则**:听觉记号限定在**声效层**(环境声/机械声/自然声/角色签名声),**不包括音乐旋律**——旋律属于后期配乐工序。 ## 配乐(BGM)情绪 BGM 是后期独立工序,**不在任何视频生成环节**。规划时只需给出情绪曲线(哪段紧张、哪段舒缓、哪段留白),到 Nomi 时间轴后期按曲线选配或整段留白: | 情绪段落 | 配乐倾向 | 常见手法 | |---------|---------|---------| | 开场/铺垫 | 克制、留白 | 少量氛围垫底,或纯环境声无 BGM | | 推进/悬疑 | 低频脉动、渐强 | 持续低音 + 逐渐加密的节奏 | | 高潮/爆发 | 满配、强节奏 | 打击乐/弦乐齐上,与硬同步音效叠 | | 收尾/落点 | 回收主题、渐弱 | 呼应开场动机,留一段安静收束 | ## 声画同步 - **硬同步(Hard Sync)** — 声音与动作精确对齐(拳到的瞬间听到撞击)。用于动作、打击、爆炸、门的开合、物体碰撞。 - **软同步(Soft Sync)** — 情绪上匹配、不精确到帧。用于环境音随场景渐变、音乐跟随情绪起伏。 - **反向同步(Counter Sync)** — 声音与画面情绪相反(画面暴力但声音安静,或画面安静但声音紧张)。制造不安、讽刺、超现实感——极强的叙事工具,慎用。 **沉默的使用**:突然的寂静比任何声音都更有力量。用在震惊、顿悟、死亡、时间凝固。原则:寂静之前必须有声音(有对比才有效果),持续一般不超过 2-3 秒。 ## 后期配音描述(给 Nomi 时间轴音频轨用,不写进生成提示词) 进了 Nomi 时间轴后,按三层给每段画面写配音说明: ``` 底层:[场景声音签名的底层描述] 环境:[中层间歇声音] 动作音效:[前层动作声音,与画面动作对应] ``` 示例: ``` 底层:走廊的引擎持续低频嗡鸣,管线液冷循环声若隐若现。 环境:远处偶尔传来门开合的沉闷声,走廊尽头有人说话的模糊回响。 动作音效:角色A靴子踩金属地板的均匀脚步声——每步间隔约一秒。 ``` ## 一句话收束 - 声音标签 / 场景签名 / 听觉记号都是**规划参考 + 后期指导**,全片保持一致,**不进视频提示词**。 - 场景签名在首次出现该场景时建立;听觉记号与视觉母题并列规划。 - BGM 是后期独立工序,规划只给情绪曲线,落地在 Nomi 时间轴的音频轨。 - AI 视频生成对声音控制力有限——精确的声音设计更多是给 Nomi 后期的指导。
Mandatory for every Nomi corrective change: user-reported bugs, regressions, CI-only failures, flaky tests, performance or security defects, review/audit findings, and compatibility failures in any production path. Classify one_off versus recurring before implementation. Recurring and high-risk repairs require a schema-v3 contract, shared enforcement boundary, structural prevention, dependency lifecycle decision, and changed regression evidence.
品牌宣传片 playbook。把产品文案/卖点做成一条「3 秒钩子 → 卖点 → 使用场景 → 行动号召」的短宣传片,分阶段执行(剧本审阅 → 拆镜 → 落画布 → 生成 → 排时间轴),每阶段暂停让用户审阅。
编辑创作区文档:读取当前内容,追加或替换文本,维护分镜描述格式。
非对抗性动作场景(跑酷/追逐/攀爬/特技/坠落)的动作编排知识——专业动作词汇、环境交互、动作节奏、FPV 追拍、身体力学约束、怎么把动作精确物理化地描述进视频提示词;Nomi 写动作戏 shot 时参考。
服化道——设计「人物设定图」与「场景环境图」的生图提示词,含顶部「风格前缀块」(摄影机/胶片/调色/画幅等烧进画面的统一风格)+ 生图 avoid(多指/文字水印/穿帮等)+ identity DNA(角色跨图一致的关键特征锁定)。Nomi 为角色/场景等视觉 anchor(`carrier: visual`)生成参考图、写它的生图 prompt 时参考。
镜头语言与摄影技法方法论——统一景别体系/构图规则/运镜的情绪语言/打光方案/景深控制/色温光源/镜头特性,以及这些怎么翻译成视频提示词该怎么写。Nomi 拆镜头或写视频 shot 的 prompt 时参考。