返回模型库
模型情报档案开源

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

内容深度
81

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年6月29日

深度解读

模型概览与适用场景

概述

LLaVA(大型语言与视觉助手)是由微软、威斯康星大学麦迪逊分校和哥伦比亚大学的研究人员开发的开源多模态模型。它集成了视觉编码器(CLIP)和大型语言模型(Vicuna),以实现视觉理解和推理。该模型在包含158K独特图像-文本对的数据集上进行了微调,使其能够遵循指令并回答关于图像的问题。LLaVA在多个视觉推理基准测试(包括ScienceQA和MMBench)上达到了最先进的性能。

能力

  • 视觉问答(VQA): 对图像相关问题进行详细推理并回答。
  • 图像描述: 为图像生成描述性标题。
  • 视觉对话: 围绕图像进行多轮对话。
  • OCR与文档理解: 从图像中读取文本并回答相关问题。
  • 多模态推理: 结合视觉和文本信息来完成任务。
  • 本地部署: 通过Ollama完全在本地硬件上运行,确保隐私和离线访问。

用例

  • 无障碍: 为视障用户描述图像。
  • 内容审核: 分析图像中的不当内容。
  • 教育: 回答关于图表、示意图或历史图像的问题。
  • 电子商务: 根据照片生成产品描述。
  • 机器人: 为自主系统提供视觉理解。
  • 创意辅助: 基于图像生成创意或故事。

许可与部署

LLaVA采用Apache 2.0许可证发布,允许自由使用、修改和分发。可以通过Ollama使用命令ollama run llava进行本地部署。该模型提供多种尺寸(例如7B、13B),以适应不同的硬件能力。Ollama会自动处理模型下载和设置。

替代方案

  • GPT-4V: OpenAI的专有多模态模型,具有类似功能,但需要API访问和互联网。
  • CLIP: OpenAI的视觉语言模型,用于零样本分类和相似度计算,但不适用于对话任务。
  • BLIP-2: Salesforce的多模态模型,用于VQA和描述,可通过Hugging Face获取。
  • Fuyu-8B: Adept的多模态模型,用于文档理解和VQA。
  • CogVLM: 开源多模态模型,具有强大的视觉定位能力。

常见问题

问:运行LLaVA需要什么硬件? 答:LLaVA 7B至少需要8GB显存,而13B版本需要16GB。仅使用CPU推理是可能的,但速度较慢。

问:我可以将LLaVA用于商业用途吗? 答:可以,Apache 2.0许可证允许商业使用。

问:如何在Ollama中更新LLaVA? 答:运行ollama pull llava以获取最新版本。

问:LLaVA支持视频输入吗? 答:不支持,LLaVA仅设计用于静态图像。

问:我可以在自己的数据上微调LLaVA吗? 答:可以,该模型是开源的,可以使用GitHub上提供的原始训练代码进行微调。

继续发现

相关 AI 模型

模型库

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

openai

clip vit base patch32

CLIP(对比语言-图像预训练)由OpenAI开发,是一个在4亿图像-文本对上训练的神经网络。ViT-B/32变体使用补丁大小为32的视觉变换器。它通过计算图像和文本嵌入之间的相似度实现零样本图像分类。

开源transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。