news 2026/8/17 23:31:45

Dolphin模型选型指南:base、small、medium、large怎么选最适合你?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Dolphin模型选型指南:base、small、medium、large怎么选最适合你?

Dolphin模型选型指南:base、small、medium、large怎么选最适合你?

【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin

Dolphin 是由 DataoceanAI 与清华大学联合训练的开源多语言多任务ASR语音识别模型,支持 40 种东方语言与 22 种中文方言,可同时完成语音识别、VAD 端点检测、语音分段和语种识别。面对Dolphin模型选型这个新手常遇到的问题,本指南将用最简单的方式讲清 base、small、medium、large 四个尺寸的区别,帮你快速找到最适合自己的那一款。

为什么 Dolphin 值得关注?🤔

Dolphin 采用 CTC-Attention 联合架构,编码器基于 E-Branchformer,解码器为标准 Transformer,训练数据超过 21 万小时。它沿用了 Whisper 与 OWSM 的创新思路,并做了针对性改进:引入两级语言标记体系(语言 + 区域),让模型能更精细地处理不同地区的中文方言和东方语言。

上图展示了 Dolphin 的多任务数据格式:从 SOS 起始符出发,依次包含语言(LANGUAGE)、区域(REGION)、转录(TRANSCRIBE)标记,输出既支持带时间戳的文本,也支持纯文本转录,这也是它能同时做识别、分段、打时间戳的原因。

Dolphin模型选型核心:四个尺寸的完整对比

官方规划了 4 个规格的模型,参数规模从 0.1B 到 1.7B 不等:

模型参数量当前是否开放定位
base0.1 B✅ 已开放轻量入门
small0.4 B✅ 已开放均衡主力(默认)
medium0.9 B⏳ 规划中高精度
large1.7 B⏳ 规划中旗舰级

注意:目前公开可用的主要是 base 和 small 及其衍生版本,medium、large 尚未开放,选型时请优先考虑现有模型。

base:轻量部署的最佳起点

base(0.1B)适合谁?追求低延迟、低资源消耗的开发者。如果你只是想在 CPU 上快速验证效果,或者部署到资源受限的边缘设备,base 是最省心的选择。它体积小、加载快,日常短语音转写完全够用。

small:官方默认的均衡主力

small(0.4B)是官方 CLI 工具的默认模型,也是绝大多数用户的首选。它在准确率与速度之间取得了最佳平衡,无需指定--model参数即可直接使用。无论你是个人开发者还是中小型项目,从 small 入手基本不会出错。

medium 与 large:等待开放的旗舰精度

medium(0.9B)和 large(1.7B)代表了更高的识别精度上限,适合对准确率有极致要求的场景(如专业字幕、会议纪要),但目前尚未开放下载,可以先关注官方更新,届时再迁移升级。

中文方言场景:别忘了 .cn 家族

如果你的语音数据以中文为主,选型时还应关注专门的中文方言系列(dolphin/model_registry.py中定义了全部可用模型):

模型名特点适用场景
base.cn中文方言增强中文为主、兼顾方言
base.cn.streaming中文流式识别实时字幕、直播转写
small.cn中文方言均衡版中文高精度场景
small.cn.streaming中文流式均衡版实时会议、客服质检
small.cn.prompt支持提示词热词热词纠错、专业术语

Dolphin 共支持 22 种中文方言区域码,如zh-SICHUAN(四川话)、zh-SHANGHAI(上海话)、zh-MINNAN(闽南语)等,完整清单见 languages.md。

按场景快速决策:一张表搞定选型

你的需求推荐模型理由
首次体验、CPU 环境base加载快、够轻量
通用中英混转写small官方默认,均衡
实时字幕/直播base.cn.streaming / small.cn.streaming流式低延迟
中文方言重度场景small.cn中文专项增强
人名、专业词纠错small.cn.prompt热词提示词加持

五分钟快速上手:安装与使用

Dolphin 使用非常简单,先安装 FFmpeg 并执行pip install -U dataoceanai-dolphin,随后一行命令即可完成转写:

# 默认使用 small 模型 dolphin audio.wav # 指定中文方言模型 dolphin audio.wav --model small.cn --lang_sym "zh" --region_sym "CN" # 流式模型示例 dolphin audio.wav --model small.cn.streaming

Python 调用同样直观,核心入口是 dolphin/transcribe.py 中的load_modeltranscribe

import dolphin from dolphin import transcribe model = dolphin.load_model('small.cn', device="cuda") result = transcribe(model, 'audio.wav', lang_sym="zh") print(result.text)

模型首次使用时会被自动下载并缓存在~/.cache/dolphin/目录,下载后本地运行不依赖网络。

总结

Dolphin 模型的选型并不复杂:入门选 base,通用选 small,中文方言选 .cn 系列,实时场景选 streaming,热词纠错选 prompt。medium 和 large 虽未开放,但 Dolphin 的模型注册表 dolphin/model_registry.py 已预留扩展位,未来升级路径清晰。现在就用pip install -U dataoceanai-dolphin安装,从 base 或 small 开始你的第一条语音转写吧!🎉

【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/17 23:31:31

Cordis核心概念图解:Context、Fiber与Plugin的三体关系

Cordis核心概念图解:Context、Fiber与Plugin的三体关系 【免费下载链接】cordis Meta-Framework of Spatiotemporal Composability 项目地址: https://gitcode.com/GitHub_Trending/co/cordis Cordis 是一个面向**时空可组合性(Spatiotemporal Co…

作者头像 李华
网站建设 2026/8/17 23:31:18

大麦自动抢票完整指南:从零配置到一次抢到心仪门票的实战教程

大麦自动抢票完整指南:从零配置到一次抢到心仪门票的实战教程 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 凌晨 10 点开票&#xff0…

作者头像 李华
网站建设 2026/8/17 23:27:01

零基础体验Kiwi在线Demo:30秒看懂韩语词性标注全过程

零基础体验Kiwi在线Demo:30秒看懂韩语词性标注全过程 【免费下载链接】Kiwi Kiwi(지능형 한국어 형태소 분석기) 项目地址: https://gitcode.com/gh_mirrors/kiwi1/Kiwi 想学韩语却总被复杂的词性分析劝退?本文为你带来韩语形态素分析器 Kiwi 的在…

作者头像 李华
网站建设 2026/8/17 23:25:51

录音转换文字的软件有哪些,免费与专业档这样搭配

去年备考时做了大量听课笔记,把市面上主流的录音转文字软件几乎都装了一遍,从微信小程序到专业语音平台再到剪辑工具里的隐藏功能。用下来最大的感受是:这类软件没有"谁全面碾压谁",更像是在免费档、专业档之间按需搭配…

作者头像 李华
网站建设 2026/8/17 23:23:40

测试 (1) - 认识测试(1):认识测试 测试的岗位

测试(1)认识测试 & 测试的岗位 文章目录测试(1)认识测试 & 测试的岗位注意:1. 什么是测试?1.1 生活中的测试场景商场买衣服:Java程序测试:可能的面试题:1.2 为什…

作者头像 李华