开源模型
共 97 个AI 用户与开发者推荐的开源模型。
Qwen3.8-Flash-Next
huggingface.co阿里通义千问开源的多模态大模型,支持图文理解,可在 Hugging Face 下载部署。
gpt-oss-20b
huggingface.coOpenAI 开源的 20B 参数大模型,可在 Hugging Face 下载并本地部署运行。
腾讯音乐 Lyra Lab 开源的实时高保真唇形同步模型,可在 V100 上 30fps+ 运行,支持多语言。
DeepSeek-V4.1-Flash
huggingface.coDeepSeek 在 Hugging Face 上发布的多模态开源大模型,支持图文输入与本地部署。
Janus-Pro-7B
huggingface.coDeepSeek 开源的多模态理解与生成统一模型,解耦视觉编码,7B 参数。
Kokoro-82M
huggingface.co轻量级开源 TTS 模型,仅 8200 万参数,质量媲美大模型,速度快、成本低,Apache 许可。
Qwen-Image-Edit
huggingface.co通义千问开源图像编辑模型,支持中英文字精准编辑与语义/外观修改,性能达 SOTA。
VoxCPM
github.comOpenBMB 开源的无分词器 TTS 系统,2B 模型支持 30 种语言、音色设计与克隆,输出 48kHz 音频。
SenseVoiceSmall
huggingface.coFunAudioLLM 开源的多语言语音理解模型,支持 ASR、语种识别、情感识别与音频事件检测,推理极快。
GLM-5.3
huggingface.co智谱开源大模型 GLM-5.3,基于 GLM-5.2 后训练强化,复杂编程能力显著提升。
Stable Audio 3.0
stability.aiStability AI 推出的生成式音频模型家族,基于全授权数据训练,部分模型开放权重可下载。
VibeVoice-1.5B
huggingface.co微软开源的长篇多说话人语音合成模型,可生成播客级对话音频,最长 90 分钟、最多 4 位说话人。
parakeet-tdt-0.6b-v3
huggingface.co英伟达开源的多语言语音识别模型,6 亿参数,支持 25 种欧洲语言自动识别转写
GLM-OCR
huggingface.co智谱开源的多模态 OCR 模型,基于 GLM-V 架构,在 OmniDocBench 上排名第一,擅长复杂文档理解。
GLM-5
github.com智谱开源 MoE 大模型系列,主打编程与长程 Agent 任务,含 1M 上下文与 Flash 版本
MiniMax-H3
huggingface.coMiniMax 开源的全模态生成系统,可理解文本图像视频音频并生成带原生立体声的 2K 视频。