aiknow

语音合成 / 识别

共 83 个AI 用户与开发者推荐的语音合成 / 识别。

全部 AI 创作AI 绘图 59AI 视频 31AI 音乐 16音频处理 5语音合成 / 识别 33数字人 12AI 3D 5AI 设计 14

Whisper

github.com

OpenAI 开源的通用语音识别模型,支持多语言转写、翻译与语种识别,可本地运行。

开源可自部署本地模型命令行LinuxMac
开源模型 · 2 处推荐

whisper.cpp

github.com

OpenAI Whisper 语音识别模型的 C/C++ 高性能移植版,无依赖、可离线本地运行

开源可自部署本地模型MacWindowsLinux
本地部署 / 运行 · 1 处推荐

faster-whisper

github.com★ 25,703

基于 CTranslate2 的 Whisper 语音识别重实现,速度更快、显存占用更低,支持量化与本地部署。

开源可自部署有 API本地模型LinuxWindows
语音合成 / 识别 · 1 处推荐

ElevenLabs

elevenlabs.io

超写实 AI 语音平台,提供语音合成、克隆、配音与语音 Agent,支持 70+ 语言。

免费+付费有 API多模态网页
语音合成 / 识别 · 3 处推荐

开源语音音色转换(变声)框架,10 分钟语音即可训练模型,带网页界面与实时变声。

开源中文界面可自部署本地模型Linux网页
语音合成 / 识别 · 1 处推荐

GPT-SoVITS

github.com

开源少样本语音克隆与TTS项目,5秒零样本、1分钟微调即可复刻音色,支持多语言。

开源可自部署本地模型网页WindowsLinux
训练与微调 / 量化 · 1 处推荐

NVIDIA 开源语音 AI 框架,支持语音识别、语音合成与语音大模型训练部署。

开源可自部署多模态本地模型LinuxWindows
开发 SDK / 工具库 · 1 处推荐

OpenAI 开源的高效语音识别模型,支持多语言转录与翻译,速度更快。

开源网页LinuxWindowsMac
开源模型 · 1 处推荐

Fish Speech

github.com

Fish Audio 开源的 SOTA 多语言 TTS 系统,支持 80+ 语言与自然语言标签控制情感韵律。

开源可自部署多模态有 API本地模型Linux
开源模型 · 1 处推荐

XTTS-v2

huggingface.co

Coqui 开源的多语言语音克隆模型,仅需 6 秒音频即可克隆音色并跨语言合成语音。

开源可自部署本地模型LinuxWindowsMac
开源模型 · 1 处推荐

Vosk

github.com

开源离线语音识别工具包,支持 20 多种语言,模型仅约 50MB,可流式实时转写。

开源可自部署有 API本地模型LinuxWindows
本地部署 / 运行 · 1 处推荐

LiveKit Agents

github.com★ 14,546

开源框架,用于构建可实时听、说、看的多模态语音 AI Agent,支持 WebRTC 与电话接入。

开源有 API多模态可自部署GPTLinux
语音合成 / 识别 · 1 处推荐

FunASR

github.com★ 20,580

开源语音识别工具包,支持训练、推理、流式 ASR、VAD、标点与说话人分离,并提供 OpenAI 兼容与 MCP 服务。

开源有 API支持 MCP可自部署本地模型命令行
语音合成 / 识别 · 1 处推荐

Murf AI

murf.ai

AI 语音平台,提供超低延迟 TTS API、200+ 拟真音色与对话式语音 Agent,支持 35+ 语言。

有 API网页
语音合成 / 识别 · 2 处推荐

PaddleSpeech

github.com

百度飞桨开源的语音工具包,涵盖流式语音识别、语音合成、声纹识别与语音翻译,曾获 NAACL2022 最佳 Demo 奖。

开源可自部署本地模型LinuxWindowsMac
开发 SDK / 工具库 · 1 处推荐

ChatTTS

github.com

面向对话场景的开源语音合成模型,支持中英文、多说话人,韵律自然,可控制笑声停顿。

开源可自部署本地模型LinuxWindowsMac
开源模型 · 1 处推荐

sherpa-onnx

github.com

基于新一代 Kaldi 与 onnxruntime 的离线语音工具库,支持识别、合成、说话人分离等,跨平台多语言。

开源可自部署本地模型LinuxMacWindows
本地部署 / 运行 · 1 处推荐

WhisperX

github.com

基于 Whisper 的快速语音识别工具,支持词级时间戳与说话人分离,速度可达实时 70 倍。

开源可自部署本地模型LinuxWindows命令行
语音合成 / 识别 · 1 处推荐

CosyVoice

github.com

基于大模型的多语言语音生成系统,支持零样本语音克隆、流式合成与指令控制。

开源可自部署通义千问本地模型LinuxWindows
语音合成 / 识别 · 1 处推荐

Bark

github.com

Suno 开源的 Transformer 文本转音频模型,可生成多语言语音、音乐、音效与非语言声音

开源可自部署本地模型LinuxWindowsMac
开源模型 · 2 处推荐

Pipecat

github.com★ 16,184

开源 Python 框架,用于构建实时语音与多模态 AI 智能体,支持多智能体协作与低延迟对话。

开源有 API多模态可自部署LinuxMac
语音合成 / 识别 · 1 处推荐

微软 Azure 的语音 AI 服务,提供语音识别、文本转语音、翻译和自定义语音模型。

有 API多模态网页
官方 API 平台 · 1 处推荐

Kokoro-82M

huggingface.co

轻量级开源 TTS 模型,仅 8200 万参数,质量媲美大模型,速度快、成本低,Apache 许可。

开源可自部署有 API本地模型网页Linux
开源模型 · 1 处推荐

VoxCPM

github.com

OpenBMB 开源的无分词器 TTS 系统,2B 模型支持 30 种语言、音色设计与克隆,输出 48kHz 音频。

开源可自部署中文界面本地模型LinuxWindows
语音合成 / 识别 · 1 处推荐