Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型
AIGC 资讯

Fun-ASR-Realtime – 阿里千问推出的流式实时语音识别模型

站外新闻
最近更新: 2026年7月22日 下午9:34
SHARE

Fun-ASR-Realtime是什么

Fun-ASR-Realtime 是阿里千问推出的流式实时语音识别大模型。模型通过 WebSocket 流式协议实现边说边出字,首字延迟百毫秒,尾字延迟同样极低。模型支持普通话、16 种方言及 30 种语言的实时识别,具备上下文理解、热词定制、情感识别、时间戳输出等能力。

阅读目录
  • Fun-ASR-Realtime是什么
  • Fun-ASR-Realtime的主要功能
  • Fun-ASR-Realtime的技术原理
  • 如何使用Fun-ASR-Realtime
  • Fun-ASR-Realtime的核心优势
  • Fun-ASR-Realtime的同类竞品对比
  • Fun-ASR-Realtime的应用场景

Fun-ASR-Realtime

Fun-ASR-Realtime的主要功能

  • 实时流式识别:通过 WebSocket 双工通信实现低延迟音频到文本转换,支持边说边出字。
  • 多方言多语种支持:覆盖 16 种方言(含粤语、吴语、闽语、客家话等)和 30 种语言,适配出海客服、国际会议等场景。
  • 上下文纠错:基于历史对话上下文和实时热词进行自我纠正,如将”叶鹿”根据上下文修正为”夜鹭”。
  • 情感识别:Qwen-ASR 模型支持 7 类细粒度情绪识别;Paraformer 支持 3 类极性情感识别。
  • 时间戳输出:Fun-ASR 与 Paraformer 默认输出句级与字级时间戳,便于字幕对齐和关键词高亮。
  • 热词定制:支持通过热词提升品牌名、人名、专有术语的识别准确率。
  • VAD 智能断句:服务端自动检测语音起点和终点,支持自定义静音阈值和灵敏度。
  • 非人声过滤:自动过滤非人声内容,提升识别纯度。

Fun-ASR-Realtime的技术原理

  • 大模型流式架构:模型采用基于 Transformer 或 Conformer 的大模型作为骨干网络,通过流式推理机制实现音频边输入边输出,避免等待整段音频结束后再处理,将首字延迟压缩至百毫秒级。
  • 因果注意力与分块处理:模型在推理时采用因果注意力掩码,确保每个时间步的预测仅依赖当前及历史音频帧,不依赖未来信息;同时通过固定长度音频分块输入,平衡延迟与准确率。
  • 泛 Context 强化训练:在训练阶段引入历史对话上下文(Historical Context)和实时热词(Hotwords)作为辅助输入,通过上下文感知重打分(Context-aware Rescoring)机制,使模型能根据语境动态修正识别结果,如将叶鹿根据观鸟上下文纠正为夜鹭。
  • 多任务联合建模:模型在语音识别主任务基础上,联合训练情感识别和语音活动检测(VAD)任务,通过共享编码器提取通用声学表征,在单一前向传播中同步输出转写文本、情感标签和断句边界。
  • 时间戳对齐机制:基于连接时序分类(CTC)或注意力对齐路径,在解码过程中同步预测每个字/词在音频中的起止时间戳,输出句级和字级两种粒度,满足字幕对齐和关键词定位需求。

如何使用Fun-ASR-Realtime

  • 获取凭证:在阿里云百炼控制台https://help.aliyun.com/zh/model-studio/real-time-speech-recognition-user-guide获取 API Key 并配置到环境变量。
  • 安装 SDK:通过 pip 或 Maven 安装最新版 DashScope SDK。
  • 配置参数:创建 Recognition 实例,设置模型名 fun-asr-realtime、音频格式(如 pcm/wav)及采样率。
  • 建立连接:通过 WebSocket 与阿里云推理服务端建立双工连接。
  • 发送音频:按固定帧长循环读取麦克风或音频文件数据并发送。
  • 接收结果:在回调中处理实时返回的 on_event 事件,获取中间结果和句级最终结果。
  • 结束任务:音频发送完毕后调用 stop() 或发送 finish-task 指令关闭识别会话。

Fun-ASR-Realtime的核心优势

  • 低延迟高准确:首字延迟百毫秒,准确率接近离线模型,实现又快又准。
  • 方言识别领先:在 16 种方言测试中 12 类领先火山与腾讯同类产品,吴语系准确率行业顶尖。
  • 上下文自纠错:具备语境理解能力,能根据后续信息自动修正前期误识别内容。
  • 工业场景鲁棒:在复杂背景、远场嘈杂及带口音场景下,中英文识别准确率均领先竞品。
  • 生态接入便捷:通过阿里云百炼平台统一提供,支持多语言 SDK 和 WebSocket 直连,提供完整高并发最佳实践方案。

Fun-ASR-Realtime的同类竞品对比

维度 Fun-ASR-Realtime GPT-4o-Transcribe / Realtime API
产品定位 专为流式实时语音识别设计的大模型 基于 GPT-4o 的转录模型,支持通过 Realtime API 流式传输或 REST 批量转录
首字延迟 百毫秒级,原生流式架构 流式模式下约 300–500ms,取决于网络与 VAD 配置;批量模式无实时性
流式架构 原生 WebSocket 双工流式,端到端优化 通过 Realtime API WebSocket 支持流式输入,但 transcription 模式仅在 turn 结束时返回完整结果,delta 连续性有限
方言支持 16 种方言(吴语、闽语、客家话等),上海话 92.41% 准确率 99+ 语言零样本覆盖,但方言/低资源语言准确率显著下降,无中文方言专项优化
上下文纠错 支持,可根据语境自动修正前期误识别(如”叶鹿”→”夜鹭”) 基于 GPT-4o 语言理解能力,对歧义词(如 their/there/they’re)有上下文解析优势,但无实时跨句纠错机制

Fun-ASR-Realtime的应用场景

  • 直播实时字幕:面向长时直播、多人互动场景提供毫秒级延迟的字幕输出,支持说话人频繁切换和复杂赛制环境,已在影视飓风「重返荒岛」100 小时直播中验证,累计输出 132 万字实时字幕。
  • 会议实时转写:在远程会议、线下论坛等场景中边说边出字,输出带句级与字级时间戳的结构化文本,便于会后快速回溯关键发言与定位时间节点。
  • 客服通话质检:实时识别客服与用户的双向对话内容,同步进行情感状态检测,支持热词定制以精准捕捉品牌名、产品名和投诉关键词,实现通话过程中的实时风险预警。
  • 语音输入法:为移动端、车载终端、IoT 设备提供低延迟方言输入能力,支持粤语、吴语、闽语等 16 种方言实时转写,提升非普通话用户的输入效率与体验。
阿里健康氢离子集齐三大医学顶刊,成国内首个获 NEJM、JAMA、BMJ 全文授权的医学 AI 平台
NodeTool – AI工作流可视化构建器,拖放节点设计复杂工作流
百度PP-OCRv5发布:0.07亿参数,40+语言识别,CPU每秒处理370+字符的轻量级OCR模型
SkyReels-A2 – 昆仑万维推出的可控视频生成框架
VRAG-RL框架详解:阿里通义如何用强化学习突破多模态RAG推理瓶颈?
分享
Email 复制链接 打印
Share
上一篇 用户强烈反对!微软做出让步:Teams 会议中途可一键关闭 AI 功能
下一篇 AI有了“办公神器”:开源OfficeCLI让智能体自主驾驭文档
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

面壁智能开源MiniCPM-Robot:1.5B的VLA模型完整放出,个人开发者也能在真机器人上跑操作

站外新闻
AIGC 资讯

AuraFlow – Fal团队推出的开源AI文生图模型

站外新闻
AIGC 资讯最新趋势

谷歌D4RT:4D重建模型速度提升300倍,动态场景AI追踪与预测的革命

站外新闻
4D重建 具身智能 动态追踪 自动驾驶 谷歌DeepMind
AIGC 资讯

Magma – 微软研究院联合华盛顿等高校推出的多模态AI基础模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.