Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型
AIGC 资讯

Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型

站外新闻
最近更新: 2026年7月22日 下午9:34
SHARE

Fun-ASR-Realtime是什么

Fun-ASR-Realtime 是阿里千问推出的流式实时语音识别大模型。模型通过 WebSocket 流式协议实现边说边出字,首字延迟百毫秒,尾字延迟同样极低。模型支持普通话、16 种方言及 30 种语言的实时识别,具备上下文理解、热词定制、情感识别、时间戳输出等能力。

阅读目录
  • Fun-ASR-Realtime是什么
  • Fun-ASR-Realtime的主要功能
  • Fun-ASR-Realtime的技术原理
  • 如何使用Fun-ASR-Realtime
  • Fun-ASR-Realtime的核心优势
  • Fun-ASR-Realtime的同类竞品对比
  • Fun-ASR-Realtime的应用场景

Fun-ASR-Realtime

Fun-ASR-Realtime的主要功能

  • 实时流式识别:通过 WebSocket 双工通信实现低延迟音频到文本转换,支持边说边出字。
  • 多方言多语种支持:覆盖 16 种方言(含粤语、吴语、闽语、客家话等)和 30 种语言,适配出海客服、国际会议等场景。
  • 上下文纠错:基于历史对话上下文和实时热词进行自我纠正,如将”叶鹿”根据上下文修正为”夜鹭”。
  • 情感识别:Qwen-ASR 模型支持 7 类细粒度情绪识别;Paraformer 支持 3 类极性情感识别。
  • 时间戳输出:Fun-ASR 与 Paraformer 默认输出句级与字级时间戳,便于字幕对齐和关键词高亮。
  • 热词定制:支持通过热词提升品牌名、人名、专有术语的识别准确率。
  • VAD 智能断句:服务端自动检测语音起点和终点,支持自定义静音阈值和灵敏度。
  • 非人声过滤:自动过滤非人声内容,提升识别纯度。

Fun-ASR-Realtime的技术原理

  • 大模型流式架构:模型采用基于 Transformer 或 Conformer 的大模型作为骨干网络,通过流式推理机制实现音频边输入边输出,避免等待整段音频结束后再处理,将首字延迟压缩至百毫秒级。
  • 因果注意力与分块处理:模型在推理时采用因果注意力掩码,确保每个时间步的预测仅依赖当前及历史音频帧,不依赖未来信息;同时通过固定长度音频分块输入,平衡延迟与准确率。
  • 泛 Context 强化训练:在训练阶段引入历史对话上下文(Historical Context)和实时热词(Hotwords)作为辅助输入,通过上下文感知重打分(Context-aware Rescoring)机制,使模型能根据语境动态修正识别结果,如将叶鹿根据观鸟上下文纠正为夜鹭。
  • 多任务联合建模:模型在语音识别主任务基础上,联合训练情感识别和语音活动检测(VAD)任务,通过共享编码器提取通用声学表征,在单一前向传播中同步输出转写文本、情感标签和断句边界。
  • 时间戳对齐机制:基于连接时序分类(CTC)或注意力对齐路径,在解码过程中同步预测每个字/词在音频中的起止时间戳,输出句级和字级两种粒度,满足字幕对齐和关键词定位需求。

如何使用Fun-ASR-Realtime

  • 获取凭证:在阿里云百炼控制台https://help.aliyun.com/zh/model-studio/real-time-speech-recognition-user-guide获取 API Key 并配置到环境变量。
  • 安装 SDK:通过 pip 或 Maven 安装最新版 DashScope SDK。
  • 配置参数:创建 Recognition 实例,设置模型名 fun-asr-realtime、音频格式(如 pcm/wav)及采样率。
  • 建立连接:通过 WebSocket 与阿里云推理服务端建立双工连接。
  • 发送音频:按固定帧长循环读取麦克风或音频文件数据并发送。
  • 接收结果:在回调中处理实时返回的 on_event 事件,获取中间结果和句级最终结果。
  • 结束任务:音频发送完毕后调用 stop() 或发送 finish-task 指令关闭识别会话。

Fun-ASR-Realtime的核心优势

  • 低延迟高准确:首字延迟百毫秒,准确率接近离线模型,实现又快又准。
  • 方言识别领先:在 16 种方言测试中 12 类领先火山与腾讯同类产品,吴语系准确率行业顶尖。
  • 上下文自纠错:具备语境理解能力,能根据后续信息自动修正前期误识别内容。
  • 工业场景鲁棒:在复杂背景、远场嘈杂及带口音场景下,中英文识别准确率均领先竞品。
  • 生态接入便捷:通过阿里云百炼平台统一提供,支持多语言 SDK 和 WebSocket 直连,提供完整高并发最佳实践方案。

Fun-ASR-Realtime的同类竞品对比

维度 Fun-ASR-Realtime GPT-4o-Transcribe / Realtime API
产品定位 专为流式实时语音识别设计的大模型 基于 GPT-4o 的转录模型,支持通过 Realtime API 流式传输或 REST 批量转录
首字延迟 百毫秒级,原生流式架构 流式模式下约 300–500ms,取决于网络与 VAD 配置;批量模式无实时性
流式架构 原生 WebSocket 双工流式,端到端优化 通过 Realtime API WebSocket 支持流式输入,但 transcription 模式仅在 turn 结束时返回完整结果,delta 连续性有限
方言支持 16 种方言(吴语、闽语、客家话等),上海话 92.41% 准确率 99+ 语言零样本覆盖,但方言/低资源语言准确率显著下降,无中文方言专项优化
上下文纠错 支持,可根据语境自动修正前期误识别(如”叶鹿”→”夜鹭”) 基于 GPT-4o 语言理解能力,对歧义词(如 their/there/they’re)有上下文解析优势,但无实时跨句纠错机制

Fun-ASR-Realtime的应用场景

  • 直播实时字幕:面向长时直播、多人互动场景提供毫秒级延迟的字幕输出,支持说话人频繁切换和复杂赛制环境,已在影视飓风「重返荒岛」100 小时直播中验证,累计输出 132 万字实时字幕。
  • 会议实时转写:在远程会议、线下论坛等场景中边说边出字,输出带句级与字级时间戳的结构化文本,便于会后快速回溯关键发言与定位时间节点。
  • 客服通话质检:实时识别客服与用户的双向对话内容,同步进行情感状态检测,支持热词定制以精准捕捉品牌名、产品名和投诉关键词,实现通话过程中的实时风险预警。
  • 语音输入法:为移动端、车载终端、IoT 设备提供低延迟方言输入能力,支持粤语、吴语、闽语等 16 种方言实时转写,提升非普通话用户的输入效率与体验。
PaSa – 字节跳动推出的学术论文检索智能体
SocraticLM – 中科大和科大讯飞共同推出的苏格拉底教学大模型
TrajectoryCrafter – 腾讯和港中文推出的单目视频自由运镜技术
NutWorld – 新加坡国立、南洋理工和Skywork AI推出的视频处理框架
重磅开源!FlashLabs发布Chroma 1.0:实时端到端语音模型,延迟低于1秒,语音克隆精度超人类基线10.96%
分享
Email 复制链接 打印
Share
上一篇 用户强烈反对!微软做出让步:Teams 会议中途可一键关闭 AI 功能
下一篇 AI有了“办公神器”:开源OfficeCLI让智能体自主驾驭文档
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Claude Opus 5 – Anthropic 最新发布的旗舰级模型
AIGC 资讯
MineExplorer – 美团推出的开放世界分钟级长程任务评测基准
AIGC 资讯
WorkBuddy Bench – 腾讯开源的编码智能体评测套件
AIGC 资讯
[AI生图咒语] 严肃职业肖像摄影提示词 (LinkedIn/商务高管头像)
AI 生图 Prompt 写实人像

相关推荐

AIGC 资讯

腾讯云发布音视频 AI 品牌 WAND:内置六大自研模型与60+项AI能力

站外新闻
AI 工具AIGC 资讯

CWM:Meta开源代码世界模型,320亿参数AI如何革新软件开发?

站外新闻
AI编程 CWM meta 代码世界模型 开源模型
AIGC 资讯

AniDoc – 2D动画上色AI模型,基于视频扩散模型自动将草图序列转换成彩色动画

站外新闻
AIGC 资讯

CharacterFactory – 大连理工推出的AI角色创作工具

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.