CLIP
github.com
OpenAI 开源的多模态视觉语言模型,通过图文对比预训练实现零样本图像分类与图文匹配。
开源多模态可自部署美国LinuxMac
GitHub ★ 34,417被推荐 1 次
适合做什么
适合研究者与开发者做零样本图像分类、图文检索、多模态特征提取,或作为文生图模型的文本编码器。
标签与属性
同类推荐
阿里通义千问开源文本向量模型,8B 规模,MTEB 多语言榜第一,支持 100+ 语言与代码检索。
开源可自部署通义千问网页Linux
huggingface.co1 处推荐
Google DeepMind 开源的多模态嵌入模型,统一文本、图像、视频、音频到 768 维向量空间,可端侧运行。
开源多模态可自部署本地模型Android
huggingface.co1 处推荐