aiknow
Prism

Prism

huggingface.co

腾讯混元与复旦等提出的动态稀疏注意力框架,用于原生 2K 联合视频-音频生成模型训练,训练提速 2.5 倍。

开源多模态网页
被推荐 1 次

适合做什么

适合研究视频-音频联合生成、稀疏注意力与高效训练的 AI 研究者与工程师。

标签与属性

价格
特性
平台

同类推荐

开源模型

Whisper

★ 110,133

OpenAI 开源的通用语音识别模型,支持多语言转写、翻译与语种识别,可本地运行。

开源可自部署本地模型命令行Linux
github.com2 处推荐
开源模型

Meta 开源的图像分割基础模型,支持点/框提示生成高质量物体掩码,零样本能力强。

开源可自部署本地模型LinuxWindows
github.com1 处推荐
开源模型

开源的潜在文本到图像扩散模型,可在消费级 GPU 上本地生成高质量图片。

可自部署多模态本地模型LinuxWindows
github.com1 处推荐
开源模型

Stability AI 开源的潜在扩散文生图模型,可根据文本提示生成照片级写实图像。

开源可自部署多模态本地模型网页
huggingface.co2 处推荐
开源模型

Stability AI 开源的文生图扩散模型,SDXL 基础版,可本地或云端推理生成高清图像。

开源可自部署有 API网页Linux
huggingface.co1 处推荐
开源模型

Grounding DINO

★ 10,649

开放集目标检测模型,用文本提示即可检测任意物体,ECCV 2024 官方开源实现

开源可自部署多模态LinuxWindows
github.com1 处推荐