Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: SemanticAudio – 港中文等推出的音频生成与编辑框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > SemanticAudio – 港中文等推出的音频生成与编辑框架
AIGC 资讯

SemanticAudio – 港中文等推出的音频生成与编辑框架

站外新闻
最近更新: 2026年7月22日 下午9:34
SHARE

SemanticAudio是什么

SemanticAudio 是香港中文大学、LIGHTSPEED、上海交通大学联合推出的音频生成与编辑框架。框架将文本到音频生成拆分为”语义规划”与”声学合成”两阶段,在高层语义空间规划声音事件的身份、时序与结构,再渲染为高质量音频。框架支持无需训练的文本引导音频编辑,在 AudioCaps 和 TTABench 基准上均显著优于 TangoFlux 等主流方法,实现语义对齐与生成质量的双重提升。

阅读目录
  • SemanticAudio是什么
  • SemanticAudio的主要功能
  • SemanticAudio的技术原理
  • 如何使用SemanticAudio
  • SemanticAudio的核心优势
  • SemanticAudio的同类竞品对比
  • SemanticAudio的应用场景

SemanticAudio

SemanticAudio的主要功能

  • 文本到音频生成:输入自然语言描述,生成环境声、动作声、复杂声音场景等高质量音频。
  • 语义规划生成:在高层语义空间规划声音事件的全局布局,再合成声学细节。
  • 无需训练音频编辑:通过 FlowEdit ODE 机制,直接在语义空间中修改声音属性,支持替换、调整等操作。
  • 帧级语义嵌入:提取保留时间结构的语义表示,精准描述复杂音频中的事件顺序和局部变化。

SemanticAudio的技术原理

  • 两阶段 Flow Matching 架构:SemanticAudio 将音频生成拆分为语义规划与声学合成两阶段,Semantic Planner 先从文本生成紧凑语义表示,描绘声音事件的全局布局。Acoustic Synthesizer 再用该语义计划为条件,生成高质量声学潜变量并解码为音频。解耦使模型分工明确,避免单阶段模型在声学空间中同时处理语义理解与声学渲染的耦合问题。
  • 语义空间的构建与压缩:用 Perception Encoder 提取帧级语义嵌入以保留时间结构,再通过轻量 MLP 压缩至 128 维。低维语义空间既保留关键声音身份与时序信息,又能被 Flow Matching 模型高效学习,成为连接文本语义与声学细节的关键中间层。
  • FlowEdit ODE:用源文本与目标文本的速度场差异引导语义轨迹编辑,将源音频编码为语义潜变量,计算两文本的速度场差值确定编辑方向,执行 ODE 步进得到目标语义表示,再经声学合成器还原。编辑在高层语义空间进行,无需额外训练、反演或配对数据,即可实现属性级修改。
  • 语义-声学解耦的核心价值:显式解耦使模型先在语义空间规划多事件身份与时序,再合成声学细节,避免复杂提示词下的事件缺失与顺序错误。语义空间为编辑提供更清晰、可解释的操作对象,修改更接近”改变声音内容本身”,实现更稳定灵活的文本引导修改。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用SemanticAudio

  • 访问 Demo 页面:打开 https://semanticaudio1.github.io/ 体验在线演示。
  • 输入文本提示:描述目标声音场景,如”狗叫之后传来汽车鸣笛”。
  • 语义规划:Semantic Planner 生成紧凑语义表示,规划声音事件布局。
  • 声学合成:Acoustic Synthesizer 将语义计划渲染为高质量音频。
  • 音频编辑(可选):输入源音频和目标文本,用 FlowEdit ODE 在语义空间中修改声音属性。

SemanticAudio的核心优势

  • 语义对齐显著提升:通过先规划语义布局再合成声学细节,AudioCaps LAION-CLAP 达到 0.381,优于 TangoFlux 的 0.361,复杂提示词理解更准确。
  • 无需训练即可编辑:FlowEdit ODE 机制利用速度场差异在语义空间中引导轨迹,支持属性级修改,CLAP 提升 +0.094,优于同类方法且无需额外训练。
  • 生成质量与可控性兼顾:FD 19.1、MOS 3.72,在显著提升文本-音频语义对齐的同时保持高保真听感质量。
  • 复杂提示词处理强:显式规划多事件身份与时序关系,有效避免事件缺失、顺序错误和文本对齐不足等问题。
  • 更符合人类创作流程:采用先规划声音场景结构再补充声学细节的范式,实现想清楚再说出来的生成方式。

SemanticAudio的同类竞品对比

维度 SemanticAudio TangoFlux
架构 两阶段(语义规划+声学合成) 单阶段声学空间生成
语义对齐 LAION-CLAP 0.381 LAION-CLAP 0.361
编辑能力 无需训练,属性级修改 需 FlowEdit 适配,效果较弱
复杂提示词 显式规划时序,不易出错 易遗漏事件或混淆顺序
生成质量 FD 19.1,MOS 3.72 FD 22.6
核心差异 语义-声学解耦,先想后说 直接在声学空间建模

SemanticAudio的应用场景

  • 影视后期:根据剧本中的自然语言描述,SemanticAudio 可生成包含多个声音事件且时序精准的复杂音效场景,提升后期制作效率。
  • 游戏开发:针对不同游戏场景,开发者通过文本指令动态生成匹配的环境音与动作音效,实现音频内容的快速迭代。
  • 内容创作:短视频、播客等创作者输入描述即可快速获得定制化音频素材,降低专业音频制作门槛。
  • 虚拟现实:系统根据用户的自然语言指令实时生成沉浸式环境音,增强虚拟空间的临场感与交互体验。
  • 音频编辑工具:用户用自然语言直接修改现有音频的属性或替换声音事件,无需训练可完成专业级编辑。
可灵2.6重磅升级:快手AI视频生成模型实现音画同步,一键定制专属声线与复杂动作
苹果开源SHARP模型:1秒内将单张2D照片转为逼真3D场景,速度提升1000倍!
ComfyUI-Bxb – SD变现宝,一键把 ComfyUI 工作流转换成小程序
FineZip – AI驱动的无损文本压缩系统,实现快速和高压缩比
探索提示工程的多彩世界 [译]
分享
Email 复制链接 打印
Share
上一篇 Claude Sonnet 5 – Anthropic推出的最强智能体模型
下一篇 Mirawork – 桌面 AI 办公智能体,覆盖办公全场景创作
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

国产端侧大模型第一次登上全球旗舰:面壁 MiniCPM 装进三星 Galaxy Z Fold8 系列
AIGC 资讯
SenseNova U1 Pro – 商汤科技推出的旗舰图片创作模型
AIGC 资讯
全息流体渐变通用占位特色图
Claude语音模式即将升级:支持切换Opus和Sonnet更强模型,告别Haiku独撑局面
AIGC 资讯
特斯拉Grok覆盖全欧洲并进军更多亚洲国家,语音控制空调手套箱一步到位
AIGC 资讯

相关推荐

AIGC 资讯

谷歌发布 Gemini3.6Flash 等三款新模型,旗舰3.5Pro 延期发布

站外新闻
AI 工具AIGC 资讯最新趋势

GPT-5.6后端日志泄露:150万Token上下文窗口定义新基准,AI六月决战将重塑开发范式

站外新闻
AI开发 GPT-5.6 openai 上下文窗口
AI 工具AIGC 资讯

英伟达Nemotron 3开源模型系列发布:MoE架构助力4倍吞吐量,重塑多智能体AI开发范式

站外新闻
MoE Nemotron 3 多智能体AI 混合专家模型 英伟达
AIGC 资讯

Open-Sora 2.0 – 潞晨科技开源的AI视频生成模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt GPT Image 2 AI Agent 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai YouMind灵感 大语言模型 图像设计 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.