tts-voice-synthesis

仓库创建 2026年2月2日最近提交 1 天前SkillHot 收录 20 天前
▸ 精选理由

适合配音、虚拟主播与多语言语音输出的生产化场景。

▸ 风险提示

需下载模型权重且涉及音色克隆,注意版权与隐私合规

这个 Skill 做什么

支持音色克隆、情感化与流式实时的高质量 TTS 语音合成服务。

把文本转换成高质量语音,支持从参考音频克隆音色、根据情绪自动调整语调并能流式实时输出,覆盖多语言和方言。需要配音、角色配音或拟人化、有情感的语音输出时用,并可在高质量(1.7B)与快速(0.6B)模型之间选择。特点是支持音色自动采集与克隆、情感化语义适配和边输入边播的流式生成,适合直播或交互式场景。

▸ 展开 SKILL.md 英文原文

智能语音合成服务,支持音色克隆、拟人化语义适配配音、流式实时生成、多语言与方言支持,提供 1.7B/0.6B 双模型选择

内容创作语音合成音色克隆流式实时通用
4.2k
Stars
417
Forks
40
仓库内 Skill
+1.0k
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/anbeime/skill/main/skills/tts-voice-synthesis/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/anbeime/skill/main/skills/tts-voice-synthesis/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# TTS 语音合成服务

## 任务目标
- 本 Skill 用于:将文本转换为高质量语音,支持音色克隆、情感适配、流式生成和多语言支持
- 能力包含:
  - 角色音色自动采集与克隆(从参考音频提取音色特征)
  - 拟人化语义适配配音(根据文本情绪自动调整语音语调、语速、音调)
  - 流式实时配音(支持边输入文本边生成语音)
  - 多语言与方言支持(中文、英文及多种方言)
  - 双模型选择(1.7B 高质量模型、0.6B 快速模型)
- 触发条件:当需要将文本转换为语音、克隆特定音色、生成情感化配音时使用

## 前置准备
- 模型下载:根据选择的 TTS 模型下载对应的权重,详见 [references/model_config.md](references/model_config.md)
- 硬件要求:
  - GPU:推荐使用 8GB+ 显存的 GPU(0.6B 模型可在 CPU 上运行)
  - 内存:建议 16GB+ 系统内存
  - 磁盘空间:至少 10GB 可用空间(模型权重约 3-5GB)
- 依赖配置:确保已安装所需的 Python 依赖包

## 操作步骤

### 模式一:基础语音合成
1. 文本准备
   - 确认待合成的文本内容
   - 智能体将分析文本情绪和语义特征

2. 选择音色
   - 使用预置音色(见 references/model_config.md)
   - 或使用已克隆的自定义音色

3. 执行合成
   - 调用 `scripts/tts_generate.py` 进行语音生成
   - 根据情绪分析结果自动设置
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有