infinitetalk

仓库创建 2026年2月2日最近提交 1 天前SkillHot 收录 21 天前
▸ 精选理由

支持唇形/头部/表情同步与无限时长,适合虚拟主播与配音场景。

▸ 风险提示

需下载大型模型权重并占用显卡显存,且可能涉及版权及隐私问题。

这个 Skill 做什么

将音频驱动生成与同步说话人的视频(Image/Video-to-Video)。

把音频驱动成和说话人嘴型、头部与身体动作精准同步的视频,可从单张图片生成 Image-to-Video,也可对已有素材做 Video-to-Video 重配音。适合做虚拟主播、数字人带货、视频配音或长时段生成,支持无限时长输出。内置显存优化(量化、模型卸载等),但需要提前下载模型权重才能使用。

▸ 展开 SKILL.md 英文原文

音频驱动的稀疏帧视频配音工具,支持音频驱动的 Video-to-Video 和 Image-to-Video 生成,实现精准的唇形、头部、身体姿态同步,支持无限时长视频生成

开发编程音频驱动视频生成数字人同步通用
4.2k
Stars
417
Forks
40
仓库内 Skill
+1.0k
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/infinitetalk/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/infinitetalk/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# InfiniteTalk - 音频驱动视频生成

## 任务目标
- 本 Skill 用于:将音频(语音)转换为同步的说话人视频,支持从单张图片或现有视频生成音频驱动的说话视频
- 能力包含:
  - Image-to-Video:从单张图片生成音频驱动的说话视频
  - Video-to-Video:对现有视频进行音频驱动的重配音
  - 多维度同步:唇形、头部运动、身体姿态、面部表情与音频精准对齐
  - 无限时长:支持无限制时长的视频生成
  - 低显存适配:支持量化、模型卸载等显存优化方案
- 触发条件:当需要生成音频驱动的数字人视频、视频配音、虚拟主播内容时使用

## 前置准备
- 模型下载:在使用本 Skill 前,必须先下载所需的模型权重文件,具体步骤见 [references/model_download.md](references/model_download.md)
- 硬件要求:
  - GPU:推荐使用 16GB+ 显存的 GPU(可使用量化方案适配低显存设备)
  - 内存:建议 32GB+ 系统内存
  - 磁盘空间:至少 50GB 可用空间(模型权重约 30GB)
- 环境配置:详细依赖安装见 [references/environment_setup.md](references/environment_setup.md)

## 操作步骤

### 模式一:Image-to-Video(图片生成视频)
1. 准备输入
   - 确保有一张清晰的人脸图片作为输入
   - 准备音频文件(支持 mp3、wav 等格式)
   - 可选:使用
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有