qwen-voice-cloning

仓库创建 2026年7月27日最近提交 22 小时前SkillHot 收录 17 小时前
这个 Skill 做什么

把某个人的声音从视频里整出来、训练成可合成的模型。流程会先用 yt-dlp 下载视频、用 Demucs 把人声从伴奏里分离,再用 ECAPA-TDNN 选出目标说话人、Whisper 把内容转成文本,最后用 Qwen3-TTS 进行微调输出自定义声线。适合需要从多说话人视频里提取单一说话人并做个性化 TTS 的场景,优点是一条龙自动化并针对单人提取优化。

▸ 展开 SKILL.md 英文原文

End-to-end voice cloning pipeline using Qwen3-TTS. Covers video acquisition, vocal separation, speaker filtering, transcription, fine-tuning, and inference. Optimized for single-speaker extraction from multi-speaker video content.

0
Stars
0
Forks
40
仓库内 Skill
积累中
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/trojan-lord/hermes-cuso/main/skills/.archive/qwen-voice-cloning/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/trojan-lord/hermes-cuso/main/skills/.archive/qwen-voice-cloning/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# Qwen3-TTS Voice Cloning Pipeline

Complete workflow for cloning a specific speaker's voice from video content using Qwen3-TTS, Demucs, Whisper, and ECAPA-TDNN speaker embeddings.

## Overview

```
Video URLs → yt-dlp → Demucs (vocal separation) → Speaker Filtering (ECAPA-TDNN)
    → Whisper (transcription) → Fine-tuning (Qwen3-TTS) → Custom Voice Model
```

## Hardware Requirements

- **GPU:** 4GB+ VRAM for inference (Qwen3 TTS 1.7B in Q8_0 = ~1.8GB)
- **GPU:** 8GB+ VRAM for fine-tuning (1.7B model + optimizer states)
- **RAM:** 16GB+ recommended for CPU fallback
- **Disk:** ~50GB for models + pipeline output
- **Note:** Speaker filtering runs efficiently on CPU (~150s for 5 hours of audio
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有