aiknow

BLIP-2

github.com

BLIP-2 是 Salesforce 开源的视觉语言预训练模型,用轻量查询 Transformer 连接冻结的图像编码器与大语言模型。

开源多模态可自部署LinuxWindows
被推荐 1 次

适合做什么

适合研究者与开发者做图文理解、图像描述、视觉问答等跨模态任务,需自行部署。

标签与属性

同类推荐

开源模型

OpenAI 开源的通用语音识别模型,支持多语言转写、翻译与语种识别,可本地运行。

开源可自部署本地模型命令行Linux
github.com2 处推荐
开源模型

Meta 开源的图像分割基础模型,支持点/框提示生成高质量物体掩码,零样本能力强。

开源可自部署本地模型LinuxWindows
github.com1 处推荐
开源模型

开源的潜在文本到图像扩散模型,可在消费级 GPU 上本地生成高质量图片。

可自部署多模态本地模型LinuxWindows
github.com1 处推荐
开源模型

Google 开源的预训练语言模型,提供 TensorFlow 代码与预训练权重,含 24 个小型模型。

开源可自部署本地模型LinuxMac
github.com1 处推荐
开源模型

Stability AI 开源的潜在扩散文生图模型,可根据文本提示生成照片级写实图像。

开源可自部署多模态本地模型网页
huggingface.co2 处推荐
开源模型

Stability AI 开源的文生图扩散模型,SDXL 基础版,可本地或云端推理生成高清图像。

开源可自部署有 API网页Linux
huggingface.co1 处推荐