aiknow

语音合成 / 识别

共 83 个AI 用户与开发者推荐的语音合成 / 识别。

全部 AI 创作AI 绘图 59AI 视频 31AI 音乐 16音频处理 5语音合成 / 识别 33数字人 12AI 3D 5AI 设计 14

基于 CTranslate2 的 Whisper 命令行客户端,兼容 OpenAI 原版 CLI,速度最高提升 4 倍且更省内存。

开源可自部署本地模型命令行LinuxMac
本地部署 / 运行 · 1 处推荐

Cartesia

cartesia.ai

基于状态空间模型的实时语音平台,提供低延迟流式 TTS、转录与语音 Agent API。

有 API网页
官方 API 平台 · 1 处推荐

WellSaid

wellsaid.io

基于真人配音演员授权录音训练的 AI 语音合成平台,提供 280+ 逼真音色,支持多语言与团队协作。

免费+付费网页
语音合成 / 识别 · 3 处推荐

Handy

github.com

免费开源的离线语音转文字桌面应用,按快捷键说话即可将文字粘贴到任意输入框。

开源可自部署免登录本地模型WindowsMac
语音输入 · 1 处推荐

MockingBird

github.com

5 秒克隆声音并实时生成任意语音的开源语音克隆项目,支持中文与多平台。

开源可自部署本地模型WindowsLinuxMac
语音合成 / 识别 · 1 处推荐

Vibe

github.com

开源离线音视频转写工具,基于 Whisper 等模型,支持多语言、批量与实时预览。

开源可自部署多模态有 API本地模型Mac
会议与转写 · 1 处推荐

Descript

descript.com

AI 音视频编辑器,像编辑文本一样剪辑视频,支持转录、录音、AI 配音与生成素材。

免费+付费多模态网页MacWindows
AI 视频 · 1 处推荐

Dia-1.6B

huggingface.co

Nari Labs 开源的 1.6B 文本转语音模型,可生成带情感、语气和非语言声音的对话语音。

开源可自部署多模态本地模型网页Linux
开源模型 · 1 处推荐

Duix.Avatar

github.com

开源 AI 数字人工具包,支持离线视频生成与真人克隆,可文本/语音驱动虚拟形象。

开源可自部署多模态Windows
数字人 · 1 处推荐

dictate

github.com

Linux 本地语音转文字工具,基于 Whisper,为 Claude Code 提供免打字语音输入,无需云端和 API Key。

开源可自部署免登录本地模型Linux命令行
写作 · 1 处推荐

Resemble AI

resemble.ai

企业级多模态深度伪造检测与音频水印平台,支持实时识别AI生成的音视频图像,可本地或云端部署。

有 API可自部署多模态网页
官方 API 平台 · 2 处推荐

Vibe

thewh1teagle.github.io

本地优先的音视频转写应用,支持近百种语言、Whisper 全系模型、AI 摘要与字幕导出,隐私安全。

开源可自部署多模态本地模型Linux
会议与转写 · 1 处推荐

Fliki

fliki.ai

文本转视频工具,2000+ AI 配音、80+ 语言,自动生成画面、字幕与配乐。

免费+付费多模态网页
AI 视频 · 1 处推荐

WhisperAPI

whisper-api.com

基于 OpenAI Whisper 的音频视频转写 API,支持 98+ 语言、10GB 大文件,按量付费。

免费+付费有 API多模态网页
推理云 / GPU 算力 · 1 处推荐

Ultravox

ultravox.ai

实时语音原生 AI 基础设施,提供低延迟、自然的语音 Agent API 与 SDK。

有 API网页
官方 API 平台 · 1 处推荐

Descript Overdub

descript.com

Descript 的 AI 语音克隆与音频修复功能,可重新生成人声、匹配语调并降噪。

多模态网页MacWindows
语音合成 / 识别 · 1 处推荐

ZenMic

zenmic.com

把文本、文档或链接一键转成自然多说话人音频,支持完整脚本编辑、30+ 音色与 MP3 导出。

网页
语音合成 / 识别 · 1 处推荐

Open Notebook

open-notebook.ai

开源、注重隐私的 AI 笔记与研究平台,可把笔记转成播客,支持自选模型。

开源可自部署网页
论文与学术 · 1 处推荐

Aqua Voice

aquavoice.com

实时语音转文字工具,准确率高,支持 Mac、Windows、iPhone,可无缝用于各类应用与 AI 提示词输入。

MacWindowsiOS
语音输入 · 1 处推荐

Wispr Flow

wisprflow.ai

语音转文字听写工具,能在任意应用中把口语变成润色后的书面文字,速度比打字快4倍。

Mac网页Windows
语音输入 · 2 处推荐

Superwhisper

superwhisper.com

跨平台 AI 语音转文字工具,支持离线与云端识别、100+ 语言和自定义 AI 模式。

GPTClaude本地模型MacWindowsiOS
语音输入 · 1 处推荐

Supertonic

github.com

轻量级端侧多语言 TTS,基于 ONNX 本地推理,99M 参数,支持 31 种语言与 44.1kHz 输出。

开源可自部署本地模型网页MacWindows
语音合成 / 识别 · 1 处推荐

iSpeech

ispeech.org

提供语音合成与语音识别 API 的云平台,支持多语言多音色,面向企业级应用。

有 API网页
官方 API 平台 · 1 处推荐

CapCut

capcut.com

字节跳动旗下的 AI 视频剪辑工具,支持智能成片、字幕、抠像与文生视频。

免费+付费多模态中文界面网页MacWindows
AI 视频 · 1 处推荐