OpenBMB/VoxCPM — 无 Tokenizer 的开源 TTS,2B 参数支持 30 语言+声音设计+48kHz(23k ⭐)
OpenBMB 出品的端到端扩散自回归 TTS 系统,2B 参数训练自 200 万小时多语言语音数据,支持 30 种语言、零样本克隆、文本描述声音设计和 48kHz 高保真输出,Apache-2.0 商用免费。
OpenMOSS/MOSS-TTS — 开源语音生成全家桶,零样本克隆+31语言+实时流式(2k ⭐)
OpenMOSS 团队开源的语音与音效生成模型家族,涵盖零样本 TTS、多说话人对话、声音设计、音效生成和实时流式五大场景,最小 100M 参数可 CPU 部署,支持 31 种语言。
supertone-inc/supertonic — 闪电级本地多语言 TTS,ONNX 原生运行,无需 GPU(4.4k ⭐,今日 +859)
Supertone 开源的极速本地多语言文字转语音引擎,通过 ONNX 原生运行,无需 GPU 即可实时合成高质量语音,支持中英日韩等多语言,今日新增 859 star。
VibeVoice — 微软开源语音 AI 平台,实时语音交互全栈方案(27k ⭐)
microsoft/VibeVoice 是微软开源的语音 AI 平台,提供实时语音识别、合成、对话全栈能力,支持多语言和低延迟流式处理,是构建语音 AI 助手和实时音频应用的完整解决方案。
Qwen3-TTS 1.7B 离线整合包 - 顶尖开源AI语音工具集
最新的Qwen3-TTS 1.7B离线整合包,集成文字转语音、语音克隆等功能的开源AI语音全家桶
Fish Speech — 开源语音克隆与 TTS,10 秒样本即可复刻声线
顶级开源文字转语音系统,支持约 50 种语言,10-30 秒音频即可克隆声线,自然语言标签控制情绪语气,中文词错率低至 0.54%。
Real-Time Voice Cloning - 5 秒语音克隆
Clone a voice in 5 seconds to generate arbitrary speech in real-time - CorentinJ/Real-Time-Voice-Cloning
GPT-SoVITS - 少样本语音克隆合成
1 min voice data can also be used to train a good TTS model! (few shot voice cloning) - RVC-Boss/GPT-SoVITS
Voice-Pro - TTS 与语音克隆 WebUI
面向创作者的 Gradio WebUI,集成 Edge-TTS、Kokoro 等 TTS 引擎和零样本语音克隆功能。
VoiceBox - 开源语音合成工作室
基于 Qwen3-TTS 的开源语音合成工作室,提供高质量文本转语音、语音克隆等功能。