Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Sketch2Sound – Adobe 联合西北大学推出的AI音频生成技术
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Sketch2Sound – Adobe 联合西北大学推出的AI音频生成技术
AIGC 资讯

Sketch2Sound – Adobe 联合西北大学推出的AI音频生成技术

站外新闻
最近更新: 2026年7月8日 下午10:48
SHARE

Sketch2Sound是什么

Sketch2Sound是Adobe 研究院和西北大学推出的AI音频生成技术,能基于声音模仿和文本提示生成高品质音效。Sketch2Sound从声音模仿中提取响度、亮度和音高三个控制信号,将控制信号编码后用于条件文本到声音的生成系统。Sketch2Sound轻量级,只需少量微调步骤和单层线性适配,即可在多种文本到音频模型上实现。Sketch2Sound为声音设计师提供结合文本提示的语义灵活性和声音模仿的精确性的工具,增强了声音创作的表达力和可控性。

阅读目录
  • Sketch2Sound是什么
  • Sketch2Sound的主要功能
  • Sketch2Sound的技术原理
  • Sketch2Sound的项目地址
  • Sketch2Sound的应用场景

Sketch2Sound

Sketch2Sound的主要功能

  • 声音模仿与文本提示结合: Sketch2Sound能理解声音模仿(如口头模仿)和文本提示,生成与两者相符的高品质音效。
  • 提取控制信号: 从任何输入的声音模仿中提取三个关键的控制信号:响度(loudness)、亮度(spectral centroid)和音高概率(pitch probabilities)。
  • 生成任意声音: 用提取的控制信号和文本提示,合成任意声音,包括模仿特定声音或创造新的声音效果。
  • 轻量级实现: 能在任何文本到音频潜在扩散变换器(DiT)上实现,只需40,000步的微调和每个控制信号一个单独的线性层。

Sketch2Sound的技术原理

  • 控制信号提取: 用音频信号处理技术,从输入的声音模仿中提取响度、亮度和音高概率。
  • 潜在扩散模型: 基于预训练的文本到声音潜在扩散变换器(DiT),模型包含变分自编码器(VAE)和变换器解码器,将音频压缩成连续向量序列,然后生成新的潜在向量序列以合成音频。
  • 条件生成: 在潜在扩散模型中添加线性投影层,将控制信号直接添加到模型的噪声潜在变量中,实现对模型的条件化。
  • 微调与适配: 对预训练的文本到音频模型进行微调,使其能处理时间变化的控制信号,实现自监督微调。
  • 推理时控制: 在推理时,用户选择不同大小的中值滤波器调整控制信号的时间细节,从而在声音模仿的精确性和生成音频的质量之间进行权衡。
  • 语义灵活性与表达性: 结合文本提示的语义灵活性和声音模仿的表达性,为用户提供自然、直观的声音创作方法。

Sketch2Sound的项目地址

  • 项目官网:hugofloresgarcia.art/sketch2sound
  • arXiv技术论文:https://arxiv.org/pdf/2412.08550

Sketch2Sound的应用场景

  • 电影和视频制作: 在电影和视频后期制作中,生成与画面同步的音效,如模拟特定环境的声音效果(如森林、城市、战场等)。
  • 游戏开发: 为电子游戏设计逼真的音效和环境音,增强游戏的沉浸感和互动性。
  • 音乐制作: 音乐制作人创作新的音乐元素或模拟特定乐器的声音。
  • 声音设计教育: 在声音设计的教学中,作为工具帮助学生理解声音的构成和操控声音的基本方法。
  • 互动媒体和装置艺术: 在互动艺术项目中,根据观众的行为或输入生成相应的声音反馈。
Mistral AI开源Voxtral TTS:40亿参数语音克隆模型,90ms延迟碾压ElevenLabs
YouTube播客AI升级:自动调速专治说话慢,Premium用户收听体验大革新
目标过于激进?分析师指OpenAI百亿广告收入愿景恐难实现
AutoConsis – 美团联合复旦大学推出的UI内容一致性AI检测工具
红果短剧发布AI角色规范,专项整治“高频AI脸”与素材侵权
分享
Email 复制链接 打印
Share
上一篇 Matryoshka Diffusion Models – 苹果开源高清图像和视频生成的扩散模型
下一篇 NeMo – 英伟达推出的用于构建、定制和部署生成式AI模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

1100 多名 AI 员工联名呼吁美国政府踩刹车,奥尔特曼罕见表态支持
AIGC 资讯
Fresh Burst Sprite Ad Poster
AI 生图 Prompt
Taco Supreme Extreme Poster
AI 生图 Prompt
Toy Figure Character Transformation
AI 生图 Prompt

相关推荐

AIGC 资讯

DeepSeek-Coder-V2 – DeepSeek开源的代码语言模型,与GPT4-Turbo相媲美

站外新闻
AIGC 资讯

商汤开源SenseNova-Vision统一视觉大模型,单模型横扫四大核心视觉任务

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

三星杀回PC芯片战场:自研AI专用芯片GAIA已送测联想惠普, 2027 年量产

站外新闻
AIGC 资讯

Wall-OSS-0.5 – 自变量机器人开源的国产具身智能模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 写实人像 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.