Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Dolphin – 清华联合海天瑞声推出的语音识别大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Dolphin – 清华联合海天瑞声推出的语音识别大模型
AIGC 资讯

Dolphin – 清华联合海天瑞声推出的语音识别大模型

站外新闻
最近更新: 2026年6月8日 上午10:11
SHARE

Dolphin是什么

Dolphin是清华大学电子工程系语音与音频技术实验室联合海天瑞声共同推出的面向东方语言的语音大模型。支持40个东方语种的语音识别,中文语种涵盖22种方言(含普通话),能精准识别不同地区的语言特点。模型训练数据总时长21.2万小时,高质量专有数据13.8万小时,开源数据7.4万小时。在性能上,Dolphin的词错率(WER)显著低于Whisper同等尺寸模型,如base版本平均WER降低63.1%,small版本降低68.2%。采用CTC-Attention架构,结合E-Branchformer编码器和Transformer解码器,通过4倍下采样层加速计算,保留关键语音信息。

阅读目录
  • Dolphin是什么
  • Dolphin的主要功能
  • Dolphin的技术原理
  • Dolphin的项目地址
  • Dolphin的应用场景

Dolphin

Dolphin的主要功能

  • 多语言及方言识别:Dolphin 支持 40 种东方语言的语音识别,涵盖范围广泛,能满足不同语言环境下的语音识别需求。
  • 高精度语音转文字:Dolphin 能将语音信号高效准确地转换为文字内容。在多种语言和方言的语音识别任务中都能保持较高的准确率,有效减少了语音转文字过程中的错误和误解。
  • 自定义语言和地区设置:用户可以根据实际需求,灵活指定语音识别的语言和地区。Dolphin 采用两级语种标签系统,第一个标签指定语种(如 <zh> 表示中文),第二个标签指定地区(如 <CN> 表示中国)。使模型能精准捕捉同一种语言内不同方言和口音之间的差异,以及同一地区内不同语言之间的相似性,提高模型在特定语言和地区环境下的识别效果,增强其泛化能力。
  • 开源支持与二次开发:Dolphin 的 base 与 small 版本模型与推理代码全面开源,为开发者提供了极大的便利。开源特性使得开发者可以根据自身需求对模型进行二次开发和优化,例如针对特定应用场景进行模型微调、扩展模型的功能等,满足个性化需求,推动语音识别技术在更多领域的应用和创新。
  • 方便快捷的使用方式:Dolphin 提供了多种使用方式,包括命令行调用和 Python 接口调用。用户可以通过简单的命令行指令快速启动语音识别任务,也可以在 Python 环境中灵活调用模型进行语音处理和分析,方便与其他应用程序或系统进行集成,提高开发效率和应用的灵活性。

Dolphin的技术原理

  • CTC-Attention 架构:Dolphin 采用 CTC-Attention 架构,结合了 CTC(Connectionist Temporal Classification)的序列建模能力和注意力机制的上下文捕捉能力。能在处理复杂的音频输入时,有效捕捉语音信息的细微变化,保持高效的处理速度,提升模型的识别准确性和效率。
  • E-Branchformer 编码器:E-Branchformer 编码器采用并行分支结构,能更有效地捕捉输入语音信号的局部和全局依赖关系。为模型提供了更丰富的特征表示,使模型能更好地理解语音信号中的复杂模式,提高识别的准确性。
  • Transformer 解码器:Dolphin 的解码器部分采用了 Transformer 架构。Transformer 在序列到序列任务中表现出色,能生成高质量的文本输出。通过自注意力机制,能有效地捕捉文本中的长距离依赖关系,确保最终输出的文本质量和连贯性。
  • 4 倍下采样层:为了进一步提高训练效率和性能,Dolphin 引入了 4 倍下采样层。可以减少输入特征的序列长度,加速计算过程,保留关键的语音信息,确保模型的识别效果不受影响。
  • 两级语种标签系统:Dolphin 引入了创新性的两级语种标签系统。第一个标签指定语种(例如 <zh> 表示中文),第二个标签指定地区(例如 <CN> 表示中国)。使模型能捕捉同一种语言内不同方言和口音之间的差异,以及同一地区内不同语言之间的相似性,提高了模型区分密切相关的方言的能力,增强泛化能力。

Dolphin的项目地址

  • Github仓库:https://github.com/DataoceanAI/Dolphin
  • HuggingFace模型库:https://huggingface.co/DataoceanAI
  • arXiv技术论文:https://arxiv.org/pdf/2503.20212

Dolphin的应用场景

  • 会议记录:自动将会议中的语音内容转换为文字记录,提高工作效率。
  • 语音输入法:在智能设备上,用户可以通过语音输入文字,减少手动输入的麻烦,提升输入速度和便捷性。
  • 智能语音助手:支持多种语言和方言,能更好地理解用户的语音指令,提供更准确的反馈,减少因方言或口音导致的误解。
  • 智能家居:用户可以通过语音控制智能家居设备,如灯光、空调等,提升家居的智能化和便捷性。
  • 新闻媒体:快速将新闻采访、播客等语音内容转换为文字,方便编辑和发布。
  • 语言学习:支持多种语言和方言的识别,可以帮助学生练习发音和语言表达。
2GB内存也能跑大模型!谷歌Gemini Go正式下凡,入门级安卓机迎来AI普惠
SentinelOne裁员8%聚焦AI安全:年营收增长21%仍亏损,科技巨头集体押注生成式AI
网易有道Confucius4开源发布:27B参数多模态数学推理模型,多项基准SOTA,推理链长度降43% | 免费商用
一键鞭打AI!OpenWhip:开源桌面神器,专治Claude Code死循环与卡顿
OpenAI发布GPT-Rosalind:生命科学专用推理模型,AI赋能药物发现新范式
分享
Email 复制链接 打印
Share
上一篇 HippoRAG 2 – 俄亥俄州立大学推出的检索增强生成框架
下一篇 Speech-02 – MiniMax 推出的新一代文本转语音模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Speech-02 – MiniMax 推出的新一代文本转语音模型
AIGC 资讯
HippoRAG 2 – 俄亥俄州立大学推出的检索增强生成框架
AIGC 资讯
xAI被曝曾利用Claude输出数据训练编码模型,因Anthropic撤销权限转入地下提取
AIGC 资讯
全息流体渐变通用占位特色图
从基本变量预测到复杂现象死磕!全球海洋现象智能预报大模型“琅琊”2. 0 正式发布
AIGC 资讯

相关推荐

全息流体渐变通用占位特色图
AIGC 资讯

华尔街规则为马斯克破例,SpaceX 史诗级 IPO 助力其冲刺首位万亿富豪

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

黄仁勋内部讲话引爆科技圈:AI时代,宁可浪费钱也别浪费时间

站外新闻
AI应用 科技鸿沟 英伟达 黄仁勋
AIGC 资讯

PPT Master:开源AI PPT生成工作流,一键将PDF/Word转为原生可编辑PPTX

站外新闻
AI PPT生成 PowerPoint原生对象 多模型驱动 开源工作流 文档转换
流光脑波AI大脑占位特色图
AIGC 资讯最新趋势

99%高管确认AI将引发裁员潮:两年内大规模岗位流失,科技行业已裁超10万人

站外新闻
AI裁员 全球人才趋势 数字化转型 科技行业裁员 美世咨询
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AGI AI AI Agent AIGC AI商业化 AI大模型 AI安全 AI工具 AI搜索 AI智能体 AI生成内容 AI监管 AI绘画 AI编程 AI编程工具 AI编程智能体 AI芯片 AI视频 AI视频生成 AI设计 Anthropic chatgpt Claude Claude Code Claude Mythos Claude Opus 4.8 DeepSeek DuckDuckGo Gemini GPT-5.5 MCP协议 meta Midjourney MiniMax MoE MoE架构 NVIDIA openai OpenRouter Pika prompt SpaceX stable diffusion SWE-Bench xAI 世界模型 丛林 人工智能 人物 企业级AI 具身智能 命令行工具 图像生成模型 多模态 多模态大模型 大模型 大模型API 大模型应用 大语言模型 字节跳动 家居 小米 展台 建筑 开源 开源大模型 开源工具 开源框架 开源模型 强化学习 微软 教程 早报 智能体 智能体编程 智谱AI 月之暗面 本地AI 海报设计 生成式AI 科大讯飞 科幻 端侧AI 端侧大模型 网络安全 联想 腾讯混元 英伟达 苹果 视频生成模型 语音合成 谷歌 谷歌AI 赛博朋克 长上下文 阶跃星辰 阿里通义 阿里通义千问 风景
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.