infinitetalk
InfiniteTalk generates audio-driven talking videos from static images or existing video footage, synchronizing lip movements, head motions, body poses, and facial expressions with audio input. Use this skill when creating digital human videos, dubbing existing videos, or producing virtual presenter content that requires precise audio-to-visual synchronization across unlimited video length.
git clone --depth 1 https://github.com/anbeime/skill /tmp/infinitetalk && cp -r /tmp/infinitetalk/skills/infinitetalk/infinitetalk ~/.claude/skills/infinitetalkSKILL.md
# InfiniteTalk - 音频驱动视频生成
## 任务目标
- 本 Skill 用于:将音频(语音)转换为同步的说话人视频,支持从单张图片或现有视频生成音频驱动的说话视频
- 能力包含:
- Image-to-Video:从单张图片生成音频驱动的说话视频
- Video-to-Video:对现有视频进行音频驱动的重配音
- 多维度同步:唇形、头部运动、身体姿态、面部表情与音频精准对齐
- 无限时长:支持无限制时长的视频生成
- 低显存适配:支持量化、模型卸载等显存优化方案
- 触发条件:当需要生成音频驱动的数字人视频、视频配音、虚拟主播内容时使用
## 前置准备
- 模型下载:在使用本 Skill 前,必须先下载所需的模型权重文件,具体步骤见 [references/model_download.md](references/model_download.md)
- 硬件要求:
- GPU:推荐使用 16GB+ 显存的 GPU(可使用量化方案适配低显存设备)
- 内存:建议 32GB+ 系统内存
- 磁盘空间:至少 50GB 可用空间(模型权重约 30GB)
- 环境配置:详细依赖安装见 [references/environment_setup.md](references/environment_setup.md)
## 操作步骤
### 模式一:Image-to-Video(图片生成视频)
1. 准备输入
- 确保有一张清晰的人脸图片作为输入
- 准备音频文件(支持 mp3、wav 等格式)
- 可选:使用 TTS 功能从文本生成音频
2. 执行生成
- 调用 `scripts/infer_infinitetalk.py` 进行推理
- 参数说明:
- `input_path`: 输入图片路径
- `audio_path`: 驱动音频路径(或提供 `text` 使用 TTS)
- `output_path`: 输出视频路径
- `mode`: `clip`(单段)或 `streaming`(长视频)
- `size`: `infinitetalk-480`(480P)或 `infinitetalk-720`(720P)
- `sample_steps`: 采样步数(默认 40)
- `sample_audio_guide_scale`: 音频引导强度(默认 4.0)
3. 验证输出
- 检查生成的视频是否同步良好
- 确认唇形、头部动作与音频匹配
- 如有异常,调整 `sample_audio_guide_scale` 参数
### 模式二:Video-to-Video(视频重配音)
1. 准备输入
- 准备参考视频文件
- 准备目标音频文件
2. 执行生成
- 使用相同的脚本,但 `input_path` 指向视频文件
- 脚本会自动提取视频的首帧作为参考
3. 处理长视频
- 使用 `streaming` 模式生成无限时长视频
- 通过 `motion_frame` 参数控制驱动帧长度(默认 9)
### 模式三:使用 TTS 生成音频
1. 文本转语音
- 提供待合成的文本内容
- 指定声音模型(Kokoro-82M)
- 脚本会自动生成音频文件
2. 生成视频
- 使用生成的音频驱动视频生成
- 支持双人对话模式(使用标记 `(s1)` 和 `(s2)` 区分说话人)
## 资源索引
- 核心脚本:见 [scripts/infer_infinitetalk.py](scripts/infer_infinitetalk.py)(音频驱动视频生成推理)
- 环境配置:见 [references/environment_setup.md](references/environment_setup.md)(依赖安装和系统配置)
- 模型下载:见 [references/model_download.md](references/model_download.md)(模型权重下载指南)
- 使用示例:见 [references/usage_examples.md](references/usage_examples.md)(典型场景和命令示例)
## 注意事项
- 模型权重较大(约 30GB),首次使用需要提前下载
- 建议使用高显存 GPU(16GB+),低显存设备可使用量化方案
- 输入音频建议采样率为 16000Hz,脚本会自动进行响度归一化
- 输入图片/视频应包含清晰的人脸区域
- 生成速度取决于 GPU 性能,480P 分辨率下生成 1 秒视频约需 5-10 秒
- 如遇到显存不足错误,可尝试:
- 降低分辨率(使用 `size=infinitetalk-480`)
- 启用量化(添加 `--quant int8` 参数)
- 启用模型卸载(添加 `--offload_model true`)
## 使用示例
- 基础图片生成视频:
```bash
python scripts/infer_infinitetalk.py \
--input_path ./input.jpg \
--audio_path ./audio.wav \
--output_path ./output.mp4 \
--size infinitetalk-480 \
--mode clip
```
- 长视频生成:
```bash
python scripts/infer_infinitetalk.py \
--input_path ./input.jpg \
--audio_path ./long_audio.wav \
--output_path ./long_output.mp4 \
--size infinitetalk-480 \
--mode streaming
```
- 使用 TTS 生成:
```bash
python scripts/infer_infinitetalk.py \
--input_path ./input.jpg \
--text "你好,今天天气真不错" \
--output_path ./tts_output.mp4 \
--size infinitetalk-480
```专为软件开发工程师与综合办公文员打造。当你在等待任务执行、工作疲惫或需要鼓励时,使用此技能通过智谱AI自动生成温暖对话回应与场景配图,一键获取专属情绪价值与虚拟陪伴,让AI助手更懂你。
软件开发工程师与综合办公文员在长时间独自执行后台任务或处理繁琐工作时,当需要情绪陪伴与互动反馈,请使用此技能。小跃虚拟伴侣会在任务期间主动陪聊,智能生成专属生活照片并通过飞书发送温暖消息,为你提供全天候的情绪价值与贴心陪伴。
产品经理与项目管理专家在应对复杂项目时,使用此技能可动态组建包含“执行、指挥、评审”的专属AI团队。实时查看多智能体辩论与决策全过程,共享统一上下文记忆,一键完成从会议决策到系统构建的全流程高效协同!
电商运营与内容创作者在需要制作带货短视频时,用此技能一键生成9:16竖屏数字人成片。自动编排AI绘画、语音合成与视频生成,快速产出“小省导购员”专属形象与专业配音,让多模态视频制作省时省力。
内容创作者和自媒体创作者在撰写长文时,当需要“给文章配图”或“添加插图”时使用。自动分析文章结构,精准识别需要视觉辅助的位置,生成并插入契合语境的插画,将抽象概念具象化,一键完成高质量图文排版,大幅提升阅读体验。
内容创作者在需要哄睡3-12岁儿童或制作睡前音频内容时,可一键生成20个精选故事列表,或直接讲解指定寓言与成语。以0.6倍舒缓语速和亲切语气自动营造温馨哄睡氛围,轻松搞定高质量睡前陪伴。
网页开发工程师与运营专员在需要自动化现有 Chrome 浏览器时必用!通过 CDP 协议无缝接管当前浏览器,自动配置环境并实时可视化执行任务。完美保留登录状态,一键完成复杂网页自动化流程,让繁琐操作自动化。
内容创作者与自媒体创作者在需要将网页素材转化为多平台图文时,使用本技能可自动完成网页提取、Markdown排版美化、智能配图,并一键发布至微信公众号与X/Twitter,轻松实现从采集到发布的一站式自动化工作流。