infinitetalk

仓库创建 2026年2月2日最近提交 1 天前SkillHot 收录 20 天前
▸ 精选理由

适合虚拟主播与数字人视频生成的端到端解决方案。

▸ 风险提示

需下载模型权重并依赖显卡/外部模型源,可能占用高资源

这个 Skill 做什么

将音频驱动生成或重配音视频,同步唇形与头部姿态,支持长时长。

把音频驱动成说话视频:从单张图片或现有视频生成与语音精确对齐的唇形、头部和身体动作,支持长时长输出。当需要做虚拟主播、视频配音或给已有视频重新配音时特别有用。特点是多维度同步精度高并支持低显存优化,能做无限时长的音频驱动视频生成。

▸ 展开 SKILL.md 英文原文

音频驱动的稀疏帧视频配音工具,支持音频驱动的 Video-to-Video 和 Image-to-Video 生成,实现精准的唇形、头部、身体姿态同步,支持无限时长视频生成

垂直行业音频驱动视频合成虚拟人通用
4.2k
Stars
417
Forks
40
仓库内 Skill
+1.0k
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# InfiniteTalk - 音频驱动视频生成

## 任务目标
- 本 Skill 用于:将音频(语音)转换为同步的说话人视频,支持从单张图片或现有视频生成音频驱动的说话视频
- 能力包含:
  - Image-to-Video:从单张图片生成音频驱动的说话视频
  - Video-to-Video:对现有视频进行音频驱动的重配音
  - 多维度同步:唇形、头部运动、身体姿态、面部表情与音频精准对齐
  - 无限时长:支持无限制时长的视频生成
  - 低显存适配:支持量化、模型卸载等显存优化方案
- 触发条件:当需要生成音频驱动的数字人视频、视频配音、虚拟主播内容时使用

## 前置准备
- 模型下载:在使用本 Skill 前,必须先下载所需的模型权重文件,具体步骤见 [references/model_download.md](references/model_download.md)
- 硬件要求:
  - GPU:推荐使用 16GB+ 显存的 GPU(可使用量化方案适配低显存设备)
  - 内存:建议 32GB+ 系统内存
  - 磁盘空间:至少 50GB 可用空间(模型权重约 30GB)
- 环境配置:详细依赖安装见 [references/environment_setup.md](references/environment_setup.md)

## 操作步骤

### 模式一:Image-to-Video(图片生成视频)
1. 准备输入
   - 确保有一张清晰的人脸图片作为输入
   - 准备音频文件(支持 mp3、wav 等格式)
   - 可选:使用
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有