返回模型库
模型情报档案开源

facebook/opt-125m · Hugging Face

facebook/opt-125m 是 Meta AI 推出的 1.25 亿参数开源因果语言模型,属于 OPT(Open Pre-trained Transformer)系列。它支持英文文本生成,可通过 Hugging Face Transformers 库在 PyTorch、TensorFlow 和 JAX 上使用。

内容深度
231

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年8月11日

深度解读

模型概览与适用场景

概述

facebook/opt-125m 是一个轻量级开源因果语言模型,由 Meta AI 开发,托管于 Hugging Face Hub。该模型拥有约 1.25 亿参数,属于 OPT(Open Pre-trained Transformer)系列,源自论文《OPT: Open Pre-trained Transformer Language Models》(arxiv:2205.01068)。模型专为英文文本生成任务设计,采用仅解码器(decoder-only)Transformer 架构,适用于补全、续写和少样本提示等多种自然语言处理应用。

该模型于 2022 年 5 月 11 日首次上传至 Hugging Face,最近一次修改时间为 2023 年 9 月 15 日。截至目前,总下载量已超过 2.01 亿次,最近统计周期内约 1700 万次,反映出其作为大语言模型研究与教育入门模型的广泛采用。

能力

facebook/opt-125m 配置为 AutoModelForCausalLM,配合 AutoTokenizer 使用,支持 Hugging Face Transformers 生态中的标准文本生成流程。其 token 配置如下:开始序列(BOS)和结束序列(EOS) token 均设为 </s>,填充 token 为 <pad>。默认启用 token 归一化,不进行首尾空白字符去除。

该模型支持在三大主流深度学习框架上进行推理:PyTorch、TensorFlow 和 JAX,便于广泛的开发者与研究人员使用。Hub 上还提供量化版本,适用于资源受限的硬件部署。模型已标记支持 Microsoft Azure 部署,托管于美国区域。

作为小型语言模型,facebook/opt-125m 特别适合少样本学习场景,其架构和训练方法基于《Language Models are Few-Shot Learners》(arxiv:2005.14165)一文所述原则。它可以根据提示输入生成连贯的英文文本续写,常用于基准测试、原型开发和教学目的。

应用场景

  • 教育与研究原型开发:体积小,适合学生和研究人员学习 LLM 架构、微调与推理,无需昂贵 GPU 基础设施。
  • 少样本提示实验:支持上下文学习模式,用户可在极低计算开销下演示少样本能力。
  • 文本补全与生成:适用于简单文本续写、创意写作辅助及基线生成基准测试。
  • 流水线测试:开发者可用于验证推理流水线、分词流程和部署配置,之后再扩展至更大模型。
  • 边缘与嵌入式部署:量化版本支持在计算和内存资源有限的设备上部署。

许可证与部署

该模型采用 Hugging Face 分类为“other”的许可证,通常对应 Meta 为 OPT 系列定制的开源研究许可证,允许在特定条件下进行研究和商业使用。用户应查阅模型卡中的 LICENSE.md 文件以获取具体条款。

部署选项包括:

  • Hugging Face Inference Endpoints:在专属、全托管的基础设施上部署模型。
  • Text Generation Inference (TGI):使用 Hugging Face 优化的推理工具包提供服务。
  • Microsoft Azure:模型已标记支持 Azure 部署,可实现云端推理。
  • 本地推理:使用 Transformers 库配合 PyTorch、TensorFlow 或 JAX 后端在本地运行。

鉴于 1.25 亿参数的规模,硬件要求较为宽松。基本用途可在 CPU 上运行,而对延迟敏感的应用建议使用 GPU 加速。量化版本(如 4-bit 或 8-bit)可进一步优化资源占用。

替代方案

  • facebook/opt-6.7b / opt-1.3b:同系列更大参数版本,能力更强但计算需求更高。
  • facebook/opt-imx-max:经过指令微调的 OPT 模型,专为聊天和对话应用设计。
  • mistralai/Mistral-7B-v0.1:能力更强的开源权重模型,具备出色的多语言和推理性能。
  • meta-llama/Llama-2-7b-hf:Meta 后续推出的开源 LLM 系列,训练数据和许可证均有改进。
  • gpt2:OpenAI 早期的 1.24 亿参数模型,常作为小规模文本生成的基线参考。

常见问题

facebook/opt-125m 是什么? 它是 Meta AI 推出的 1.25 亿参数因果语言模型,属于 OPT 开源模型系列,专为英文文本生成设计。

它使用什么许可证? 模型采用 Meta 的自定义开源研究许可证,在 Hugging Face 上归类为“other”。完整条款请参阅 LICENSE.md 文件。

能否用于商业用途? 在 Meta OPT 许可证条款允许范围内可进行商业使用,但用户应核实具体许可证文件中的限制条件。

支持哪些框架? 通过 Hugging Face Transformers 库支持 PyTorch、TensorFlow 和 JAX。

模型是否已量化? Hugging Face Hub 上提供量化版本,便于在内存有限的硬件上部署。

与 GPT-2 相比如何? 两者参数规模相近(约 1.25 亿),但 OPT 使用更大的训练数据集且架构略有不同。OPT 的少样本能力通常更强。

可以在哪里部署? 可通过 Hugging Face Inference Endpoints、Text Generation Inference、Microsoft Azure 部署,或在本地硬件上自行运行。

继续发现

相关 AI 模型

模型库

amazon

amazon/chronos-2 · Hugging Face

Chronos-2 是亚马逊开发的一个拥有1.2亿参数的编码器-only时间序列基础模型。基于T5架构构建,它支持单变量、多变量以及协变量感知任务的零样本预测。它在公开基准测试中达到了最先进的准确率,同时保持了极高的推理效率。

开源chronos-forecasting

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。