模型分类入口
从主题切入,更快找到适合当前任务的模型
模型档案
最新模型
不确定该看哪个模型?可以先按开源状态、模型类型和关键词筛选,再进入详情页查看能力、许可证、适用场景和相关工具。
iFLYTEK
讯飞星火
讯飞星火是科大讯飞大模型,聚焦语音、教育与行业场景。
UndisclosedProprietary发布 2023-05-01
OpenAI
Whisper Large v3
Whisper Large v3 是被广泛使用的语音识别模型,适合转录、本地化和音频数据流程。
开源1.55BMIT发布 2023-11-06
laion
CLAP HTSAT-Fused 模型
CLAP(对比语言-音频预训练)HTSAT-Fused 是一个学习音频与文本联合表示的模型,支持零样本音频分类和检索。它使用 HTSAT 作为音频编码器,RoBERTa 作为文本编码器,并在 LAION-Audio-630K 数据集上训练。该模型适用于无需针对特定类别预训练的音频分类以及音频-文本检索等任务。
开源transformers
MiniMax
MiniMax ABAB
MiniMax ABAB 系列面向长文本与角色扮演对话场景。
UndisclosedProprietary发布 2024-01-01
hexgrad
Kokoro 82M
Kokoro 82M 是一个拥有8200万参数的文本转语音模型,基于StyleTTS2-LJSpeech微调,支持英语和阿拉伯语。在Hugging Face上已获得超过1670万次下载。
开源