AI 创作
共 175 个AI 用户与开发者推荐的AI 创作。
基于 Gradio 的 Stable Diffusion 网页界面,支持文生图、图生图、局部重绘与插件扩展。
开源可自部署有 API本地模型网页Windows
AI 绘图 · 1 处推荐
开源图像/视频超分辨率与修复算法,用合成数据训练,支持动漫与实拍画质增强。
开源可自部署有 API本地模型WindowsLinux
AI 绘图 · 1 处推荐
腾讯 ARC 开源的实用人脸修复算法,基于 GAN 先验修复模糊老照片,支持 CPU 与 Windows 运行。
可自部署本地模型网页WindowsLinuxMac
AI 绘图 · 1 处推荐
基于 CTranslate2 的 Whisper 语音识别重实现,速度更快、显存占用更低,支持量化与本地部署。
开源可自部署有 API本地模型LinuxWindows
语音合成 / 识别 · 1 处推荐
开源AI数字人工具,单张照片加音频即可生成逼真的说话头视频,CVPR 2023论文项目。
可自部署多模态网页LinuxWindows
数字人 · 1 处推荐
基于深度神经网络的开源人声分离工具,带图形界面,可提取伴奏与人声。
开源可自部署本地模型桌面客户端Windows
音频处理 · 1 处推荐
开源语音音色转换(变声)框架,10 分钟语音即可训练模型,带网页界面与实时变声。
开源中文界面可自部署本地模型Linux网页
语音合成 / 识别 · 1 处推荐
基于 SDXL 的开源离线 AI 绘图软件,无需调参,专注提示词即可生成高质量图像。
开源可自部署免登录本地模型WindowsLinux
AI 绘图 · 1 处推荐
Meta 开源的音乐源分离模型,可将歌曲分离为人声、鼓、贝斯等音轨,基于混合 Transformer 架构。
开源可自部署本地模型命令行LinuxMac
音频处理 · 1 处推荐
开源框架,用于构建可实时听、说、看的多模态语音 AI Agent,支持 WebRTC 与电话接入。
开源有 API多模态可自部署GPTLinux
语音合成 / 识别 · 1 处推荐
InvokeAI
github.com面向 Stable Diffusion 等模型的本地开源 AI 绘图引擎,提供 WebUI、统一画布与节点式工作流。
开源可自部署本地模型网页WindowsMac
AI 绘图 · 1 处推荐
开源语音识别工具包,支持训练、推理、流式 ASR、VAD、标点与说话人分离,并提供 OpenAI 兼容与 MCP 服务。
开源有 API支持 MCP可自部署本地模型命令行
语音合成 / 识别 · 1 处推荐
输入主题或关键词,自动生成脚本、素材、字幕与配乐,一键合成高清短视频的开源工具。
开源可自部署有 API中文界面Kimi网页
AI 视频 · 1 处推荐
AudioCraft
audiocraft.metademolab.comMeta 开源的生成式音频代码库,含 MusicGen 文生音乐与 AudioGen 音效生成。
开源可自部署多模态本地模型网页Linux
AI 音乐 · 1 处推荐
WhisperX
github.com基于 Whisper 的快速语音识别工具,支持词级时间戳与说话人分离,速度可达实时 70 倍。
开源可自部署本地模型LinuxWindows命令行
语音合成 / 识别 · 1 处推荐