aiknow
pyannote/speaker-diarization-3.1

pyannote/speaker-diarization-3.1

huggingface.co

pyannote 开源说话人分离模型,纯 PyTorch 实现,输入音频输出谁在何时说话的标注。

开源可自部署LinuxMacWindows
被推荐 1 次

适合做什么

适合开发者做会议转写、播客分角色、语音分析等需要区分说话人的场景。

标签与属性

同类推荐

开源模型

OpenAI 开源的通用语音识别模型,支持多语言转写、翻译与语种识别,可本地运行。

开源可自部署本地模型命令行Linux
github.com2 处推荐
开源模型

Stability AI 开源的潜在扩散文生图模型,可根据文本提示生成照片级写实图像。

开源可自部署多模态本地模型网页
huggingface.co2 处推荐
开源模型

Stability AI 开源的文生图扩散模型,SDXL 基础版,可本地或云端推理生成高清图像。

开源可自部署有 API网页Linux
huggingface.co1 处推荐
开源模型

CodeFormer

★ 18,173

基于码本查找 Transformer 的盲人脸修复模型,可修复老照片、增强模糊人脸并支持上色与补全。

可自部署LinuxWindows
github.com1 处推荐
开源模型

Meta 开源的 80 亿参数指令微调大模型,支持多语言与长上下文,可本地部署。

开源可自部署本地模型网页Linux
huggingface.co1 处推荐
开源模型

Meta 开源的 70B 指令微调大模型,性能接近 405B,支持多语言与工具调用。

开源可自部署本地模型网页Linux
huggingface.co1 处推荐