aiknow

语音合成 / 识别

共 83 个AI 用户与开发者推荐的语音合成 / 识别。

全部 AI 创作AI 绘图 59AI 视频 31AI 音乐 16音频处理 5语音合成 / 识别 33数字人 12AI 3D 5AI 设计 14

SenseVoiceSmall

huggingface.co

FunAudioLLM 开源的多语言语音理解模型,支持 ASR、语种识别、情感识别与音频事件检测,推理极快。

开源可自部署本地模型LinuxMacWindows
开源模型 · 1 处推荐

VibeVoice-1.5B

huggingface.co

微软开源的长篇多说话人语音合成模型,可生成播客级对话音频,最长 90 分钟、最多 4 位说话人。

开源可自部署本地模型网页LinuxWindows
开源模型 · 1 处推荐

parakeet-tdt-0.6b-v3

huggingface.co

英伟达开源的多语言语音识别模型,6 亿参数,支持 25 种欧洲语言自动识别转写

开源本地模型LinuxMacWindows
开源模型 · 1 处推荐

Tortoise TTS

github.com

注重音质与多音色的开源文本转语音系统,韵律自然,支持本地 GPU 推理。

开源可自部署本地模型LinuxWindowsMac
语音合成 / 识别 · 2 处推荐

MiniMax

minimax.io

中国多模态大模型公司,自研文本、语音、视频、音乐模型,并推出多款 AI 原生应用。

国际版有 API多模态中文界面网页
国产大模型 · 1 处推荐

Amphion

github.com

开源音频、音乐与语音生成工具包,支持 TTS、歌声合成、音色转换等任务,注重可复现研究。

开源可自部署LinuxWindowsMac
语音合成 / 识别 · 1 处推荐

Fish Audio

fish.audio

高表现力 AI 语音平台,支持 TTS、语音克隆与语音转文字,情感控制强,15 秒克隆音色。

免费+付费有 API多模态中文界面网页
语音合成 / 识别 · 1 处推荐

RealtimeSTT

github.com

低延迟实时语音转文字 Python 库,支持语音活动检测、唤醒词与即时转写。

开源可自部署本地模型LinuxMacWindows
语音合成 / 识别 · 1 处推荐

WhisperLive

github.com

基于 OpenAI Whisper 的近实时语音转写服务,支持麦克风与音频文件,可自建服务器。

开源可自部署有 API本地模型LinuxMac
本地部署 / 运行 · 1 处推荐

IndexTTS

github.com

工业级零样本语音克隆 TTS 系统,单段参考音频即可克隆音色,支持多语言与情感、语速、发音精细控制。

开源可自部署多模态本地模型Linux网页
语音合成 / 识别 · 1 处推荐

Respeecher

respeecher.com

面向影视与媒体制作的专业 AI 语音克隆与配音工具,支持跨语言克隆和情感化语音合成。

有 API网页
语音合成 / 识别 · 1 处推荐

Parakeet ASR

huggingface.co

NVIDIA 开源的高效语音识别模型系列,含 CTC 与 RNN-Transducer 变体,支持流式与多语言。

开源可自部署本地模型LinuxWindowsMac
开源模型 · 1 处推荐

VoiceStudio

github.com

开源全本地 ElevenLabs 替代品,支持语音克隆、配音、听写、转录与有声书,覆盖 646 种语言。

开源可自部署多模态中文界面本地模型Mac
语音合成 / 识别 · 1 处推荐

MiniMax

minimax.cn

国产多模态通用大模型公司,自研文本、音频、图像、视频、音乐模型,并推出星野等 AI 原生产品。

国内版有 API多模态中文界面网页
国产大模型 · 1 处推荐

VoiceStudio

github.com

开源本地化的 ElevenLabs 替代品,支持声音克隆、配音、听写与有声书,覆盖 646 种语言。

开源可自部署多模态中文界面本地模型Mac
语音合成 / 识别 · 1 处推荐

TTS-WebUI

github.com

开源本地语音生成 WebUI,集成 20+ TTS、语音克隆与音乐生成模型,支持扩展安装。

开源可自部署本地模型网页WindowsLinux
语音合成 / 识别 · 1 处推荐

TTS WebUI

github.com

基于 Gradio + React 的本地语音与音频生成 WebUI,通过扩展集成数十种 TTS、音乐与音频模型。

开源可自部署本地模型网页WindowsLinux
本地部署 / 运行 · 1 处推荐

OpenWhispr

github.com★ 9,031

开源免费的语音转文字听写工具,支持本地 Whisper/Parakeet 模型与云端 BYOK,跨平台且隐私优先。

开源有 API可自部署本地模型桌面客户端Linux
语音输入 · 1 处推荐

Voice-Pro

github.com

开源 Gradio 语音工作台,集成 Whisper 识别、零样本声音克隆、多语言 TTS 与翻译,可处理 YouTube 音频。

开源可自部署多模态中文界面本地模型Windows
语音合成 / 识别 · 1 处推荐

Moonshine

github.com

开源端侧实时语音工具包,低延迟语音转文字、意图识别与语音合成,无需联网和密钥

开源可自部署免登录本地模型网页Mac
语音合成 / 识别 · 1 处推荐

WhisperLiveKit

github.com

本地实时语音转文字工具,支持流式识别、说话人分离、翻译,兼容 OpenAI/Deepgram API。

开源有 API可自部署本地模型LinuxMac
语音合成 / 识别 · 1 处推荐

Dia

github.com

Nari Labs 开源的 1.6B 参数 TTS 模型,一次生成超真实对话,支持情感、语气与非语言音效控制。

开源可自部署本地模型LinuxWindowsMac
开源模型 · 1 处推荐

AuK

github.com

腾讯混元开源的 1.5B 语音生成与编辑基础模型,支持零样本 TTS、语音编辑与增强。

开源可自部署中文界面本地模型LinuxWindows
国产大模型 · 1 处推荐

D-ID

d-id.com

数字人平台,用照片或视频生成会说话的多语言 AI 虚拟人视频与实时对话代理。

有 API多模态网页
数字人 · 2 处推荐