返回模型库
模型情报档案开源

Kokoro 82M

Kokoro 82M 是一个拥有8200万参数的文本转语音模型,基于StyleTTS2-LJSpeech微调,支持英语和阿拉伯语。在Hugging Face上已获得超过1670万次下载。

内容深度
136

词级内容信号

覆盖分类
1

用于主题聚类和内链

索引状态
已发布

2026年6月26日

深度解读

模型概览与适用场景

概述

Kokoro 82M 是由 Hexgrad 开发的文本转语音(TTS)模型,在 Hugging Face 上以模型 ID hexgrad/Kokoro-82M 提供。该模型拥有8200万参数,是一个相对轻量但功能强大的 TTS 模型。它已获得显著人气,累计下载量超过1670万次。该模型基于 StyleTTS2 架构,具体从 yl4579/StyleTTS2-LJSpeech 微调而来。支持英语和阿拉伯语,并以 Apache 2.0 许可证发布。

能力

Kokoro 82M 擅长从文本生成自然语音。主要能力包括:

  • 多语言支持:主要为英语和阿拉伯语。
  • 高质量语音:利用 StyleTTS2 框架实现富有表现力和逼真的语音合成。
  • 高效推理:拥有8200万参数,在质量和计算效率之间取得平衡,适用于实时应用。
  • 可定制的语音风格:继承 StyleTTS2 的能力,可控制说话风格、情感和韵律。
  • 开源:Apache 2.0 许可证允许商业和研究用途。

使用场景

  • 语音助手:集成到虚拟助手中实现自然交互。
  • 无障碍工具:为视障用户将文本转换为语音。
  • 内容创作:为视频、播客和有声书生成配音。
  • 语言学习:为英语和阿拉伯语学习者提供发音示例。
  • 客户服务:在呼叫中心自动化语音回复。

许可证与部署

  • 许可证:Apache 2.0,允许免费使用、修改和分发。
  • 部署:可通过 Hugging Face Inference API 部署,或使用 transformerstorch 等库本地部署。该模型针对 GPU 推理优化,但也可在 CPU 上运行,速度较慢。

替代方案

  • StyleTTS2:基础模型,同样开源,具有类似能力。
  • Tacotron2:经典 TTS 模型,广泛使用但表现力较弱。
  • FastSpeech2:非自回归模型,推理速度更快。
  • VITS:端到端 TTS,采用变分推理,质量高。
  • Coqui TTS:开源 TTS 工具包,包含多种模型。

常见问题

问:Kokoro 82M 支持哪些语言? 答:支持英语和阿拉伯语。

问:Kokoro 82M 免费使用吗? 答:是的,它以 Apache 2.0 许可证发布,免费用于商业和非商业用途。

问:如何使用 Kokoro 82M? 答:可以通过 Hugging Face 的 transformers 库或直接从模型中心使用。模型页面提供了示例代码。

问:模型大小是多少? 答:拥有8200万参数。

问:我可以微调 Kokoro 82M 吗? 答:可以,由于它是开源的,您可以在自定义数据集上微调。

问:在哪里可以找到原始论文? 答:该模型基于 StyleTTS2(arxiv:2306.07691)和其他参考工作。

继续发现

相关 AI 模型

模型库

lpiccinelli

lpiccinelli/unidepth-v2-vitl14 · Hugging Face

UniDepth v2 (ViT-L/14) 是一个拥有 0.4B 参数的 PyTorch 模型,用于单目度量深度估计,利用视觉 Transformer 骨干网络从单个 RGB 图像中预测具有尺度感知的深度图。

开源UniDepth

Qwen

Qwen/Qwen3-8B · Hugging Face

Qwen/Qwen3-8B 是由阿里云通义千问团队开发的拥有 80 亿参数的大型语言模型,在 Hugging Face 上以 Apache 2.0 许可证发布。该模型专为高级文本生成、对话式 AI 和复杂推理任务设计,支持工具使用和长上下文理解。

开源transformers

google-t5

google-t5/t5-small · Hugging Face

T5-small 是由 Google 开发并托管在 Hugging Face 上的紧凑型多语言编码器-解码器 Transformer 模型。该模型采用 Apache 2.0 许可证,支持翻译、摘要和问答等多种语言的文本到文本生成任务,包括英语、法语、德语和罗马尼亚语。它针对低延迟推理以及在各种硬件后端上的高效部署进行了优化。

开源transformers

Qwen

Qwen3 0.6B

Qwen3 0.6B 是阿里云 Qwen3 系列中的紧凑型文本生成模型,专为高效对话式 AI 和语言任务设计。拥有 6 亿参数,平衡了性能与资源使用,支持多语言和长上下文长度。

开源transformers

Ollama

llava

LLaVA(大型语言与视觉助手)是一种多模态AI模型,它将视觉编码器与大型语言模型(LLM)相结合,以执行涉及图像和文本的任务。它可以理解图像、回答关于图像的问题、生成描述,并进行视觉对话。该模型可通过Ollama进行本地部署。

开源

BAAI

bge small en v1.5

BGE Small EN v1.5 是 BAAI 开发的一款紧凑型句子嵌入模型,针对英文文本进行了优化。拥有 3300 万参数,兼顾效率与性能,支持语义搜索、聚类和分类等任务。已被广泛采用,下载量超过 6100 万。

开源sentence-transformers

站内探索

继续探索 ToolSeekAI

从模型档案跳转到工具、新闻和排行榜,形成更完整的 AI 决策路径。