返回模型库
模型情报档案开源

bge m3

BGE-M3 是 BAAI 开发的多语言嵌入模型,支持密集、稀疏和多向量检索,上下文长度达 8192 个 token。

内容深度
148

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年6月29日

深度解读

模型概览与适用场景

概述

BGE-M3(BAAI 通用嵌入 - 多语言、多粒度、多功能)是北京人工智能研究院(BAAI)开发的最先进的多语言嵌入模型。它旨在处理超过 100 种语言,并支持三种检索模式:密集检索、稀疏检索(词汇匹配)和多向量检索(ColBERT 风格)。该模型基于 XLM-RoBERTa 架构,可处理多达 8192 个 token,适用于长文档。它在 MIRACL 和 MLQA 等多语言基准测试中表现出色。

能力

  • 多语言支持:覆盖 100 多种语言,在低资源语言上表现强劲。
  • 多功能检索:密集嵌入用于语义搜索,稀疏嵌入用于关键词匹配,多向量(ColBERT)用于细粒度相关性。
  • 长上下文:支持多达 8192 个 token,实现文档级检索。
  • 高效推理:提供 ONNX 格式,便于优化部署。
  • 微调:可使用 sentence-transformers 针对特定领域任务进行微调。

使用场景

  • 多语言语义搜索:跨不同语言的文档进行搜索。
  • 跨语言信息检索:基于一种语言的查询检索另一种语言的相关内容。
  • RAG(检索增强生成):在多语言环境中用作 LLM 的检索器。
  • 文档分类:生成用于文本分类的嵌入。
  • 聚类与去重:跨语言对相似文本进行分组。

许可与部署

  • 许可:MIT 许可证(开源)。
  • 部署:可通过 Hugging Face Transformers、sentence-transformers 和 ONNX runtime 使用。可在 CPU 或 GPU 上部署。
  • 官方仓库https://huggingface.co/BAAI/bge-m3

替代方案

  • E5-mistral-7b-instruct:更大的模型(7B),用于高质量嵌入,但仅支持英文。
  • Multilingual-E5-large:支持 100 多种语言,但上下文较短(512 个 token)。
  • LaBSE:谷歌的多语言嵌入模型,适用于双语文本挖掘,但限制为 512 个 token。
  • Cohere Embed v3:专有多语言模型,token 限制为 512。
  • Jina Embeddings v2:支持 8192 个 token,但语言较少。

常见问题

问:最大序列长度是多少? 答:8192 个 token。

问:是否支持稀疏检索? 答:是的,它同时输出密集和稀疏嵌入。

问:可以微调吗? 答:可以,使用 sentence-transformers 或 Hugging Face Trainer。

问:支持哪些语言? 答:超过 100 种语言,包括低资源语言。

问:有 ONNX 版本吗? 答:有,可在 Hugging Face 上获取。

问:与 BGE-base-en 相比如何? 答:BGE-M3 是多语言的,支持更长的上下文,而 BGE-base-en 仅支持英文。

继续发现

相关 AI 模型

模型库

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。