语音合成 / 识别
共 83 个AI 用户与开发者推荐的语音合成 / 识别。
whisper.cpp
github.comOpenAI Whisper 语音识别模型的 C/C++ 高性能移植版,无依赖、可离线本地运行
基于 CTranslate2 的 Whisper 语音识别重实现,速度更快、显存占用更低,支持量化与本地部署。
开源语音音色转换(变声)框架,10 分钟语音即可训练模型,带网页界面与实时变声。
GPT-SoVITS
github.com开源少样本语音克隆与TTS项目,5秒零样本、1分钟微调即可复刻音色,支持多语言。
NVIDIA NeMo Speech
github.comNVIDIA 开源语音 AI 框架,支持语音识别、语音合成与语音大模型训练部署。
Whisper large-v3-turbo
huggingface.coOpenAI 开源的高效语音识别模型,支持多语言转录与翻译,速度更快。
Fish Speech
github.comFish Audio 开源的 SOTA 多语言 TTS 系统,支持 80+ 语言与自然语言标签控制情感韵律。
XTTS-v2
huggingface.coCoqui 开源的多语言语音克隆模型,仅需 6 秒音频即可克隆音色并跨语言合成语音。
开源框架,用于构建可实时听、说、看的多模态语音 AI Agent,支持 WebRTC 与电话接入。
开源语音识别工具包,支持训练、推理、流式 ASR、VAD、标点与说话人分离,并提供 OpenAI 兼容与 MCP 服务。
PaddleSpeech
github.com百度飞桨开源的语音工具包,涵盖流式语音识别、语音合成、声纹识别与语音翻译,曾获 NAACL2022 最佳 Demo 奖。
sherpa-onnx
github.com基于新一代 Kaldi 与 onnxruntime 的离线语音工具库,支持识别、合成、说话人分离等,跨平台多语言。
WhisperX
github.com基于 Whisper 的快速语音识别工具,支持词级时间戳与说话人分离,速度可达实时 70 倍。
Bark
github.comSuno 开源的 Transformer 文本转音频模型,可生成多语言语音、音乐、音效与非语言声音
开源 Python 框架,用于构建实时语音与多模态 AI 智能体,支持多智能体协作与低延迟对话。
Azure Speech in Foundry Tools
azure.microsoft.com微软 Azure 的语音 AI 服务,提供语音识别、文本转语音、翻译和自定义语音模型。
Kokoro-82M
huggingface.co轻量级开源 TTS 模型,仅 8200 万参数,质量媲美大模型,速度快、成本低,Apache 许可。
VoxCPM
github.comOpenBMB 开源的无分词器 TTS 系统,2B 模型支持 30 种语言、音色设计与克隆,输出 48kHz 音频。