返回模型库
模型情报档案开源

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

内容深度
129

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年7月22日

深度解读

模型概览与适用场景

概述

UniDepth v2(检查点:lpiccinelli/unidepth-v2-vitl14)是一款专为单目度量深度估计设计的先进计算机视觉模型。该模型基于 Vision Transformer 架构(ViT-L/14 配置),处理单个 RGB 图像并输出稠密的像素级深度图,保留真实世界的度量尺度,而非仅保持相对顺序。该检查点托管在 Hugging Face Hub 上,包含约 4 亿个参数,并以 Safetensors 格式分发为 F32 精度,以实现安全高效的加载。截至最新可用指标,该模型的下载量已超过 1730 万次,反映出其在研究和生产流水线中的广泛采用。官方实现和文档维护在 https://github.com/lpiccinelli-eth/UniDepth。

能力

UniDepth v2 的主要能力是将非结构化的 2D 图像转换为具有度量精度的结构化 3D 几何表示。与仅预测深度顺序的相对深度估计器不同,该模型经过校准以估计物理单位(通常为米)中的绝对距离,使其适用于需要精确空间推理的应用场景。ViT-L/14 骨干网络提供高分辨率特征提取,能够实现精细的边缘保留以及对复杂纹理和遮挡的稳健处理。该模型与 model_hub_mixin 接口无缝集成,允许通过 UniDepth Python 库轻松实例化。评估背景表明,性能高度依赖于输入分辨率和光照条件;虽然基准测试显示其在室内和室外场景中具有很强的泛化能力,但域偏移(例如极端天气、非照片级渲染)可能会引入校准漂移。需注意安全和隐私问题:深度图本质上编码了空间布局,如果未经适当的过滤或匿名化处理,可能会无意中泄露敏感的环境数据。

用例

度量深度估计解锁了机器人技术、增强现实和计算机视觉领域的多种下游应用。在自主系统中,该模型为导航和路径规划提供了可靠的障碍物距离估计,而无需立体相机或 LiDAR。对于 AR/VR 开发,它支持快速场景重建和虚拟对象放置,并具有准确的尺度感知。摄影测量和 3D 建模工作流程受益于预生成的深度先验,从而加速网格生成和纹理映射。建筑可视化和城市规划团队利用这些输出进行地形分析和体积估算。此外,该模型作为多模态流水线的基础组件,其中深度线索指导分割、目标检测和视觉定位任务。与传统立体匹配算法相比,其轻量级的 footprint 使其特别适用于计算资源受限的边缘部署场景。

许可证与部署

lpiccinelli/unidepth-v2-vitl14 的具体许可条款在源文档中未得到确认;用户应在商业集成之前,直接在官方 GitHub 存储库或 Hugging Face 模型卡片上验证确切的许可证文件(例如 MIT、Apache 2.0 或自定义学术许可证)。部署原生支持通过 PyTorch 和 Safetensors 运行时,这最小化了序列化开销并降低了恶意负载注入的风险。该模型目前未通过 Hugging Face Inference Providers 部署,这意味着用户必须自行托管或将其集成到专用的推理端点中。硬件需求随 0.4B 参数数量和 F32 精度而变化;在标准消费级 GPU(如 NVIDIA RTX 3090/4090)上进行推理是可行的,尽管更高分辨率可能需要 16GB+ VRAM。对于生产环境,建议进行混合精度(FP16/BF16)转换或量化以优化吞吐量。运行时依赖项包括官方 UniDepth 库、PyTorch 和标准视觉工具。建议持续监控校准漂移和输入分布变化,以维持长期的度量准确性。

替代方案

有几个竞争模型解决单目深度估计问题,每个模型都有独特的权衡。Depth Anything v2 提供强大的相对和度量能力,具有不同的骨干网络大小,通常优先考虑速度和易于集成。MiDaS 仍然是相对深度预测的广泛采用的基线,但如果没有额外的缩放步骤,它缺乏原生的度量校准。ZoeDepth 通过混合训练策略结合度量和相对输出,为多样化的流水线提供灵活性。基于 DPT 的架构通过 Transformer 驱动的特征聚合提供具有竞争力的性能。在选择替代方案时,开发人员应权衡许可证兼容性、推理延迟、度量校准可靠性以及生态系统支持等因素。UniDepth v2 通过其对度量一致性的明确关注以及稳健的 ViT-L/14 特征提取脱颖而出,尽管用户应根据其特定领域数据集验证性能。

常见问题

度量深度估计和相对深度估计有什么区别? 相对深度模型预测表面的顺序(近 vs 远)而不涉及物理尺度,而度量深度模型输出以米等现实世界单位表示的距离,从而实现直接的空间计算。

推荐用于推理的硬件是什么? 建议 GPU 至少拥有 16GB VRAM 以处理高分辨率输入。该模型默认以 F32 精度运行,但 FP16/BF16 转换可以显著减少内存使用并提高吞吐量。

此模型可以用于商业用途吗? 源文档中未确认许可条款。请在部署前查看官方存储库或模型卡片以获取明确的商业使用权。

我如何将模型集成到我的流水线中? 安装官方 UniDepth 库,通过 model_hub_mixin 接口加载检查点,并传递预处理后的 RGB 张量。详细的 API 示例可在 GitHub 文档中找到。

继续发现

相关 AI 模型

模型库

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

openai

clip vit base patch32

CLIP(对比语言-图像预训练)由OpenAI开发,是一个在4亿图像-文本对上训练的神经网络。ViT-B/32变体使用补丁大小为32的视觉变换器。它通过计算图像和文本嵌入之间的相似度实现零样本图像分类。

开源transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。