语音合成 / 识别
共 83 个AI 用户与开发者推荐的语音合成 / 识别。
SenseVoiceSmall
huggingface.coFunAudioLLM 开源的多语言语音理解模型,支持 ASR、语种识别、情感识别与音频事件检测,推理极快。
VibeVoice-1.5B
huggingface.co微软开源的长篇多说话人语音合成模型,可生成播客级对话音频,最长 90 分钟、最多 4 位说话人。
parakeet-tdt-0.6b-v3
huggingface.co英伟达开源的多语言语音识别模型,6 亿参数,支持 25 种欧洲语言自动识别转写
Tortoise TTS
github.com注重音质与多音色的开源文本转语音系统,韵律自然,支持本地 GPU 推理。
Fish Audio
fish.audio高表现力 AI 语音平台,支持 TTS、语音克隆与语音转文字,情感控制强,15 秒克隆音色。
RealtimeSTT
github.com低延迟实时语音转文字 Python 库,支持语音活动检测、唤醒词与即时转写。
WhisperLive
github.com基于 OpenAI Whisper 的近实时语音转写服务,支持麦克风与音频文件,可自建服务器。
IndexTTS
github.com工业级零样本语音克隆 TTS 系统,单段参考音频即可克隆音色,支持多语言与情感、语速、发音精细控制。
Parakeet ASR
huggingface.coNVIDIA 开源的高效语音识别模型系列,含 CTC 与 RNN-Transducer 变体,支持流式与多语言。
VoiceStudio
github.com开源全本地 ElevenLabs 替代品,支持语音克隆、配音、听写、转录与有声书,覆盖 646 种语言。
VoiceStudio
github.com开源本地化的 ElevenLabs 替代品,支持声音克隆、配音、听写与有声书,覆盖 646 种语言。
TTS-WebUI
github.com开源本地语音生成 WebUI,集成 20+ TTS、语音克隆与音乐生成模型,支持扩展安装。
TTS WebUI
github.com基于 Gradio + React 的本地语音与音频生成 WebUI,通过扩展集成数十种 TTS、音乐与音频模型。
开源免费的语音转文字听写工具,支持本地 Whisper/Parakeet 模型与云端 BYOK,跨平台且隐私优先。
Voice-Pro
github.com开源 Gradio 语音工作台,集成 Whisper 识别、零样本声音克隆、多语言 TTS 与翻译,可处理 YouTube 音频。
WhisperLiveKit
github.com本地实时语音转文字工具,支持流式识别、说话人分离、翻译,兼容 OpenAI/Deepgram API。
Dia
github.comNari Labs 开源的 1.6B 参数 TTS 模型,一次生成超真实对话,支持情感、语气与非语言音效控制。