infinitetalk
仓库创建 2026年2月2日最近提交 1 天前SkillHot 收录 20 天前
▸ 精选理由
适合虚拟主播与数字人视频生成的端到端解决方案。
▸ 风险提示
需下载模型权重并依赖显卡/外部模型源,可能占用高资源
这个 Skill 做什么
将音频驱动生成或重配音视频,同步唇形与头部姿态,支持长时长。
把音频驱动成说话视频:从单张图片或现有视频生成与语音精确对齐的唇形、头部和身体动作,支持长时长输出。当需要做虚拟主播、视频配音或给已有视频重新配音时特别有用。特点是多维度同步精度高并支持低显存优化,能做无限时长的音频驱动视频生成。
▸ 展开 SKILL.md 英文原文
音频驱动的稀疏帧视频配音工具,支持音频驱动的 Video-to-Video 和 Image-to-Video 生成,实现精准的唇形、头部、身体姿态同步,支持无限时长视频生成
4.2k
Stars
417
Forks
40
仓库内 Skill
+1.0k
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/anbeime/skill/main/skills/infinitetalk/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# InfiniteTalk - 音频驱动视频生成 ## 任务目标 - 本 Skill 用于:将音频(语音)转换为同步的说话人视频,支持从单张图片或现有视频生成音频驱动的说话视频 - 能力包含: - Image-to-Video:从单张图片生成音频驱动的说话视频 - Video-to-Video:对现有视频进行音频驱动的重配音 - 多维度同步:唇形、头部运动、身体姿态、面部表情与音频精准对齐 - 无限时长:支持无限制时长的视频生成 - 低显存适配:支持量化、模型卸载等显存优化方案 - 触发条件:当需要生成音频驱动的数字人视频、视频配音、虚拟主播内容时使用 ## 前置准备 - 模型下载:在使用本 Skill 前,必须先下载所需的模型权重文件,具体步骤见 [references/model_download.md](references/model_download.md) - 硬件要求: - GPU:推荐使用 16GB+ 显存的 GPU(可使用量化方案适配低显存设备) - 内存:建议 32GB+ 系统内存 - 磁盘空间:至少 50GB 可用空间(模型权重约 30GB) - 环境配置:详细依赖安装见 [references/environment_setup.md](references/environment_setup.md) ## 操作步骤 ### 模式一:Image-to-Video(图片生成视频) 1. 准备输入 - 确保有一张清晰的人脸图片作为输入 - 准备音频文件(支持 mp3、wav 等格式) - 可选:使用
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有