Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MAI-Voice-2 – 微软推出的新一代文本转语音模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MAI-Voice-2 – 微软推出的新一代文本转语音模型
AIGC 资讯

MAI-Voice-2 – 微软推出的新一代文本转语音模型

站外新闻
最近更新: 2026年6月7日 下午5:59
SHARE

MAI-Voice-2是什么

MAI-Voice-2 是微软推出的新一代文本转语音(TTS)模型,是微软迄今最具表现力和自然感的语音合成模型。相比前代在保真度、语言覆盖、说话人一致性和情感范围上全面提升,支持 15+ 种语言,具备细粒度情感控制、零样本语音克隆和代码切换能力。

阅读目录
  • MAI-Voice-2是什么
  • MAI-Voice-2的主要功能
  • MAI-Voice-2的技术原理
  • 如何使用MAI-Voice-2
  • MAI-Voice-2的核心优势
  • MAI-Voice-2的项目地址
  • MAI-Voice-2的同类竞品对比
  • MAI-Voice-2的应用场景

MAI-Voice-2

MAI-Voice-2的主要功能

  • 多语言自然合成:从仅英语扩展至 15+ 种语言,保持同等的自然度和表现力。
  • 细粒度情感控制:通过情感标签(如悲伤、耳语、兴奋、困惑等)精确调控语音情感。
  • 零样本语音克隆:仅需 5-60 秒参考音频即可克隆目标声音,支持所有语言。
  • 说话人身份稳定:在长内容包含有声书、播客、讲座中保持一致的说话人特征。
  • 自然代码切换:支持印地语-英语、西班牙语-英语等语言对自然混说,不丢失韵律和身份一致性。
  • 角色风格扮演:支持励志教练、体育解说员等特定角色风格。

MAI-Voice-2的技术原理

  • 自研语音基础模型架构:MAI-Voice-2 构建于微软内部自研的语音基础模型之上,采用端到端神经网络语音合成架构。模型能 holistic 地理解输入文本,自动适配语调、情感和说话风格,无需开发者进行大量手动调参即可生成类人语音。架构与 Azure Neural HD 语音类似,在表现力、语言覆盖和说话人一致性上实现代际提升。
  • 多语言统一建模:MAI-Voice-2 从 MAI-Voice-1 的英语单语言模型扩展为支持 15+ 种语言的统一多语言语音合成系统。模型针对声调语言、音高重音语言、重音计时语言和音节计时语言等不同音系学体系进行深度优化,确保各语言在自然度和表现力上达到与英语同等的输出质量。
  • 零样本语音克隆(Voice Prompting):模型支持零样本语音克隆能力,仅需 5–60 秒的参考音频即可提取说话人身份特征并迁移到目标语言,无需针对特定说话人进行微调或重新训练。基于语音提示(Voice Prompting)技术实现,系统通过参考音频编码器提取 speaker embedding,在合成过程中保持音色、语调和韵律特征的一致性。

如何使用MAI-Voice-2

  • Azure Foundry 访问:通过 Azure Foundry 平台直接调用 MAI-Voice-2 API。
  • 自定义品牌声音:上传 5-60 秒参考音频即可创建自定义声音,无需重新训练或微调。
  • 情感标签控制:在请求中添加情感标签来调控输出语音的情绪风格。
  • 授权申请:语音克隆功能需申请授权,系统仅支持经许可的声音用于生产环境。

MAI-Voice-2的核心优势

  • 音质领先:在盲测中 72% 的情况下被用户偏好于前代 MAI-Voice-1。
  • 真假难辨:说话人相似度极高,合成语音与真人录音难以区分。
  • 安全合规:系统级强制 consent 机制,生产环境仅允许授权许可的声音克隆,杜绝未授权滥用。
  • 长文本稳定:在数小时的长内容中保持一致的说话人身份和音质。
  • 低门槛克隆:无需专业录音棚或大量训练数据,几秒音频即可复刻声音。

MAI-Voice-2的项目地址

  • 项目官网:https://microsoft.ai/news/mai-voice-2expressive-speech-in-10-languages/

MAI-Voice-2的同类竞品对比

对比维度 MAI-Voice-2 Gemini 3.1 Flash TTS
开发方 微软(Microsoft AI) Google DeepMind
发布时间 2026 年 6 月 2026 年 4 月(Public Preview)
语言支持 15+ 种语言,含代码切换(印地-英、西-英) 70+ 种语言,覆盖更广
预置声音 未明确公布数量,侧重品牌自定义 30 个命名声音(Kore、Puck、Charon 等)
情感控制 细粒度 SSML 标签(悲伤、耳语、兴奋、困惑等) 200+ 内联音频标签([sigh]、[laughing]、[whispering] 等),支持自然语言提示
语音克隆 ✅ 5–60 秒零样本,全语言支持 ❌ 不支持
多说话人 未明确支持 ✅ 单次 API 调用原生支持 2 人对话
长文本稳定性 针对有声书、播客、讲座优化,说话人高度稳定 几分钟以上质量可能漂移,建议分块处理
安全与合规 系统级强制 consent,未授权声音无法生产使用 所有输出带 SynthID 水印,依赖服务条款
音质排名 72% 偏好于 MAI-Voice-1,与真人难区分 Artificial Analysis TTS 排行榜 Elo 1211(第二)

MAI-Voice-2的应用场景

  • 智能助手:为 Copilot、应用、设备和客服中心提供品牌专属声音。
  • 娱乐内容:为游戏、播客、有声书、AR/VR 创造角色声音和旁白。
  • 无障碍辅助:为视障用户提供文本朗读,为言语障碍者提供语音替代方案。
  • 教育培训:为在线课程和模拟场景提供讲师和虚拟角色声音。
  • 内容创作:创作者无需录音棚可将文本转为个人风格音频内容。
ReplaceAnything – 阿里推出的AI替换图片中物体的开源框架
阿里通义发布OmniAudio:从360°视频生成专业级空间音频,开启沉浸式体验新纪元
FLUX Tools – 黑森林实验室推出的模型工具套组
TIP-I2V – 超170万大规模真实文本和图像提示数据集
腾讯云重磅开源Cube Sandbox:AI Agent安全沙箱新标杆,60ms启动+硬件级隔离
分享
Email 复制链接 打印
Share
上一篇 JoyAI-Echo – 京东开源的长音视频生成框架
下一篇 PawBench – 阿里通义推出的通用智能体评测基准
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

美团开源LongCat-Flash-Omni:5600亿参数全模态大模型,实时音视频交互,重塑AI应用边界

站外新闻
LongCat-Flash-Omni 全模态大模型 实时交互 开源SOTA 美团
AIGC 资讯

OpenAI 用 80 万条消息拆穿职业边界:43.5% 的工作查询,早跨出了自己的工位

站外新闻
AIGC 资讯

TongGeometry – 北京通院联合北大AI研究院推出的几何模型

站外新闻
AIGC 资讯

Nemotron-CC – 英伟达推出的大型预训练数据集

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.