返回模型库
模型情报档案开源

CLAP HTSAT-Fused 模型

CLAP(对比语言-音频预训练)HTSAT-Fused 是一个学习音频与文本联合表示的模型,支持零样本音频分类和检索。它使用 HTSAT 作为音频编码器,RoBERTa 作为文本编码器,并在 LAION-Audio-630K 数据集上训练。该模型适用于无需针对特定类别预训练的音频分类以及音频-文本检索等任务。

内容深度
107

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年6月26日

深度解读

模型概览与适用场景

概述

CLAP(对比语言-音频预训练)HTSAT-Fused 是一个多模态模型,学习音频与自然语言描述之间的共享嵌入空间。该模型在论文《Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation》(arXiv:2211.06687)中提出。模型使用 HTSAT(层次化令牌语义音频变换器)作为音频编码器,RoBERTa 作为文本编码器,并采用特征融合机制以提升性能。它在包含 630,000 个音频-文本对的 LAION-Audio-630K 数据集上训练。

能力

  • 零样本音频分类:无需针对特定标签训练即可将音频分类到任意类别。
  • 零样本音频检索:基于自然语言查询检索音频片段,或找到与给定音频匹配的文本描述。
  • 特征提取:提取音频和文本嵌入,用于下游任务。
  • 跨模态理解:在共享空间中对齐音频和文本表示。

使用场景

  • 音频标注:自动为音频文件添加描述性标签。
  • 基于内容的音频搜索:使用文本查询搜索音频片段。
  • 辅助技术:通过文本描述帮助听障用户理解音频。
  • 多媒体分析:在大型数据集中索引和检索音频。

许可与部署

  • 许可:MIT 许可证。
  • 部署:可通过 Hugging Face Transformers 获取。可使用 pipeline API 进行音频分类或特征提取。需要 PyTorch 和 transformers 库。

替代方案

  • CLAP(原始版):使用不同音频编码器(如 CNN14、ResNet)的原始 CLAP 模型。
  • AudioCLIP:将 CLIP 扩展到音频,采用类似的对比学习方法。
  • Wav2CLIP:另一种对比音频-语言模型。
  • ImageBind:Meta 的多模态模型,绑定音频、图像、文本等。

常见问题

问:CLAP HTSAT-Fused 与其他 CLAP 模型有何区别? 答:该模型使用 HTSAT 作为音频编码器并带有特征融合机制,相比早期 CLAP 版本,在音频分类和检索任务上性能更优。

问:能否将此模型用于实时音频分类? 答:取决于硬件。模型相对较大,但可在 GPU 上进行推理。对于实时应用,可考虑更小的模型或优化。

问:如何使用此模型进行零样本分类? 答:提供候选类别名称列表作为文本提示。模型计算音频嵌入与每个文本嵌入的相似度,然后选择相似度最高的类别。

问:文本编码器支持哪些语言? 答:文本编码器是 RoBERTa,主要基于英语训练。其他语言性能可能下降。

问:官方仓库在哪里? 答:官方仓库位于 https://github.com/LAION-AI/CLAP

继续发现

相关 AI 模型

模型库

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。