返回模型库
模型情报档案开源

clip vit base patch32

CLIP(对比语言-图像预训练)由OpenAI开发,是一个在4亿图像-文本对上训练的神经网络。ViT-B/32变体使用补丁大小为32的视觉变换器。它通过计算图像和文本嵌入之间的相似度实现零样本图像分类。

内容深度
73

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年6月29日

深度解读

模型概览与适用场景

概述

CLIP(对比语言-图像预训练)是由OpenAI开发的一个模型,它从自然语言监督中学习视觉概念。clip-vit-base-patch32变体使用视觉变换器(ViT)基础架构,补丁大小为32。该模型在从互联网收集的4亿(图像,文本)对上训练。该模型可用于零样本图像分类,通过比较图像嵌入与候选标签文本嵌入之间的相似度。

能力

  • 零样本图像分类:无需特定任务训练即可将图像分类到任何类别集合中。
  • 图像-文本相似度:计算图像与文本描述之间的相似度分数。
  • 多模态嵌入:在共享空间中为图像和文本生成对齐的嵌入。
  • 灵活的标签集:使用任何自然语言标签,不限于固定类别。
  • 跨模态检索:通过文本查询检索图像,反之亦然。

使用场景

  • 内容审核:将图像分类为安全/不安全等类别。
  • 图像搜索:使用自然语言查询搜索图像。
  • 视觉问答:与其他模型结合用于VQA。
  • 鲁棒分类:在分布外数据上表现良好。
  • 原型设计:无需训练即可快速测试分类任务。

许可与部署

该模型在MIT许可下发布。可通过Hugging Face的transformers库、ONNX或TensorFlow部署。它支持PyTorch、TensorFlow和JAX框架。该模型与Hugging Face的推理端点兼容。

替代方案

  • OpenCLIP:开源重新实现,具有多种架构。
  • SigLIP:Google的sigmoid损失变体。
  • BLIP:引导语言-图像预训练。
  • ALIGN:Google的ALIGN模型。
  • Florence:Microsoft的Florence模型。

常见问题

问:输入尺寸是多少? 答:模型期望图像尺寸为224x224像素。

问:我可以微调这个模型吗? 答:可以,可以在下游任务上进行微调。

问:它支持哪些语言? 答:主要是英语,但可以泛化到其他语言。

问:有多少参数? 答:大约1.51亿个参数。

问:它在Hugging Face上可用吗? 答:是的,在openai/clip-vit-base-patch32

继续发现

相关 AI 模型

模型库

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。