Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: FireRedASR – 小红书开源的自动语音识别模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > FireRedASR – 小红书开源的自动语音识别模型
AIGC 资讯

FireRedASR – 小红书开源的自动语音识别模型

站外新闻
最近更新: 2026年6月9日 上午6:29
SHARE

FireRedASR是什么

FireRedASR 是小红书开源的工业级自动语音识别(ASR)模型家族,支持普通话、中文方言和英语,在普通话 ASR 基准测试中达到了新的最佳水平(SOTA),在歌词识别方面表现出色。 模型家族包含两个主要版本:

阅读目录
  • FireRedASR是什么
  • FireRedASR的主要功能
  • FireRedASR的技术原理
  • FireRedASR的项目地址
  • FireRedASR的应用场景

FireRedASR-LLM:采用 Encoder-Adapter-LLM 框架,基于大型语言模型(LLM)的能力,实现 SOTA 性能,支持无缝端到端语音交互。在普通话基准测试中平均字符错误率(CER)为 3.05%,相比之前的 SOTA 模型(3.33%)降低了 8.4%。

FireRedASR-AED:采用基于注意力的编码器-解码器(AED)架构,平衡高性能和计算效率,可作为基于 LLM 的语音模型中的有效语音表示模块。在普通话基准测试中平均 CER 为 3.18%,优于拥有超过 12B 参数的 Seed-ASR。

FireRedASR

FireRedASR的主要功能

  • 高精度语音识别:FireRedASR 包含两个版本,FireRedASR-LLM 和 FireRedASR-AED。其中,FireRedASR-LLM 采用 Encoder-Adapter-LLM 框架,专注于极致的语音识别精度。
  • 高效推理:FireRedASR-AED 基于经典的 Attention-based Encoder-Decoder 架构,参数量为 1.1B,平衡了高准确率与推理效率。
  • 多场景适配:FireRedASR 在多种日常场景下表现出色,包括短视频、直播、语音输入和智能助手等。与业内领先的 ASR 服务提供商和 Paraformer-Large 相比,FireRedASR-LLM 的 CER 相对降低 23.7%~40.0%。
  • 歌词识别能力:在歌词识别场景中,FireRedASR-LLM 的 CER 实现了 50.2%~66.7% 的相对降低,展现了极强的适配能力。
  • 多语言支持:FireRedASR 支持普通话,在中文方言和英语语音识别方面表现出色,进一步拓宽了其应用范围。
  • 开源与社区支持:FireRedASR 的模型和推理代码均已开源,推动语音识别技术的社区驱动改进和学术研究。

FireRedASR的技术原理

  • FireRedASR-LLM:FireRedASR-LLM 采用 Encoder-Adapter-LLM 框架,结合了大型语言模型(LLM)的能力,实现极致的语音识别精度。包含三个核心组件:
    • Conformer 基础编码器:负责提取语音特征,生成连续的语音表示。
    • 轻量级适配器:将编码器的输出转换为与 LLM 语义空间匹配的表示。
    • 预训练文本 LLM:基于 Qwen2-7B-Instruct 初始化,用于生成最终的文本输出。
    • 训练策略:在训练过程中,编码器和适配器是可训练的, LLM 的大部分参数保持固定,仅通过 Low-Rank Adaptation(LoRA)进行微调。确保编码器和适配器能有效地将语音特征映射到 LLM 的语义空间,同时保留 LLM 的预训练能力。
    • 输入与推理:在推理时,输入包括提示(prompt)和语音,LLM 执行 next-token-prediction,生成识别文本。
  • FireRedASR-AED:FireRedASR-AED 基于经典的注意力机制编码器-解码器(AED)架构,平衡高性能和计算效率。由以下部分组成:
    • Conformer 编码器:基于 Conformer 模型处理语音特征,能同时捕捉局部和全局依赖关系。
    • Transformer 解码器:采用 Transformer 架构进行序列转换,包含多头自注意力模块和前馈模块。
    • 输入特征:输入特征为 80 维的 log Mel 滤波器组,经过全局均值和方差归一化处理。
    • 训练数据:训练数据包含约 7 万小时的高质量普通话音频数据,以及约 1.1 万小时的英语音频数据。

FireRedASR的项目地址

  • Github仓库:https://github.com/FireRedTeam/FireRedASR
  • HuggingFace模型库:https://huggingface.co/FireRedTeam/FireRedASR-AED-L
  • arXiv技术论文:https://arxiv.org/pdf/2501.14350

FireRedASR的应用场景

  • 智能语音助手:FireRedASR 可以用于开发智能语音助手,如智能家居控制、智能客服等。高精度的语音识别能力能准确理解用户的语音指令,提供流畅的交互体验。
  • 视频和直播:在短视频和直播领域,FireRedASR 能实时生成字幕,帮助观众更好地理解内容。
  • 歌词识别:FireRedASR 在歌词识别场景中表现尤为突出,能广泛应用于音乐平台和卡拉OK等场景。
  • 语音输入:FireRedASR 可以用于语音输入场景,如语音打字、语音笔记等。高效的推理能力和高精度的识别效果能显著提升用户的输入效率。
Open Materials 2024 – Meta 开源的大型开放数据集和配套预训练模型
Qwen2.5-Coder – 阿里Qwen团队开源的全系代码模型,覆盖六个主流模型尺寸
SWE-Lancer – OpenAI 推出的大模型基准测试
StockBot – 基于Llama3的AI金融Agent,提升股票投资效率
podlm-public – 开源的AI博客生成工具,支持网页URL、文本转换成博客
分享
Email 复制链接 打印
Share
上一篇 Gemini 2.0 Pro – 谷歌推出的高性能多模态AI模型
下一篇 GPT‑5.3 Instant – OpenAI 推出的轻量级对话模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
AIGC 资讯
Matrix -Game3.5 – 昆仑万维开源的实时流式交互世界模型
AIGC 资讯
vivago R1- 智象未来推出的无限时长多模态创作智能体
AIGC 资讯
GPT‑5.3 Instant – OpenAI 推出的轻量级对话模型
AIGC 资讯

相关推荐

AIGC 资讯

Gemini 2.5 Pro (I/O 版) – 谷歌推出的升级版多模态AI模型

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

阿里新一代大模型千问3. 8 将至:预览版抢先登陆阿里云与Qoder,正式版拟近期开源

站外新闻
AIGC 资讯

SwiftEdit – AI文本引导图像编辑框架,0.23秒内实现高质量的图像编辑

站外新闻
AIGC 资讯

GLM-4V-Flash – 智谱 AI 推出的首个免费多模态模型API

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.