tts-voice-synthesis
仓库创建 2026年2月2日最近提交 1 天前SkillHot 收录 20 天前
▸ 精选理由
适合配音、虚拟主播与多语言语音输出的生产化场景。
▸ 风险提示
需下载模型权重且涉及音色克隆,注意版权与隐私合规
这个 Skill 做什么
支持音色克隆、情感化与流式实时的高质量 TTS 语音合成服务。
把文本转换成高质量语音,支持从参考音频克隆音色、根据情绪自动调整语调并能流式实时输出,覆盖多语言和方言。需要配音、角色配音或拟人化、有情感的语音输出时用,并可在高质量(1.7B)与快速(0.6B)模型之间选择。特点是支持音色自动采集与克隆、情感化语义适配和边输入边播的流式生成,适合直播或交互式场景。
▸ 展开 SKILL.md 英文原文
智能语音合成服务,支持音色克隆、拟人化语义适配配音、流式实时生成、多语言与方言支持,提供 1.7B/0.6B 双模型选择
4.2k
Stars
417
Forks
40
仓库内 Skill
+1.0k
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/anbeime/skill/main/skills/tts-voice-synthesis/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/anbeime/skill/main/skills/tts-voice-synthesis/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# TTS 语音合成服务 ## 任务目标 - 本 Skill 用于:将文本转换为高质量语音,支持音色克隆、情感适配、流式生成和多语言支持 - 能力包含: - 角色音色自动采集与克隆(从参考音频提取音色特征) - 拟人化语义适配配音(根据文本情绪自动调整语音语调、语速、音调) - 流式实时配音(支持边输入文本边生成语音) - 多语言与方言支持(中文、英文及多种方言) - 双模型选择(1.7B 高质量模型、0.6B 快速模型) - 触发条件:当需要将文本转换为语音、克隆特定音色、生成情感化配音时使用 ## 前置准备 - 模型下载:根据选择的 TTS 模型下载对应的权重,详见 [references/model_config.md](references/model_config.md) - 硬件要求: - GPU:推荐使用 8GB+ 显存的 GPU(0.6B 模型可在 CPU 上运行) - 内存:建议 16GB+ 系统内存 - 磁盘空间:至少 10GB 可用空间(模型权重约 3-5GB) - 依赖配置:确保已安装所需的 Python 依赖包 ## 操作步骤 ### 模式一:基础语音合成 1. 文本准备 - 确认待合成的文本内容 - 智能体将分析文本情绪和语义特征 2. 选择音色 - 使用预置音色(见 references/model_config.md) - 或使用已克隆的自定义音色 3. 执行合成 - 调用 `scripts/tts_generate.py` 进行语音生成 - 根据情绪分析结果自动设置
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有