Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MultiFoley – Adobe 联合密歇根大学推出的音效生成系统
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MultiFoley – Adobe 联合密歇根大学推出的音效生成系统
AIGC 资讯

MultiFoley – Adobe 联合密歇根大学推出的音效生成系统

站外新闻
最近更新: 2026年7月12日 上午4:18
SHARE

MultiFoley是什么

MultiFoley是Adobe Research和密歇根大学共同推出的音效生成系统,能基于文本、音频和视频的多模态控制生成Foley声音效果。系统支持用户根据文本提示、参考音频或部分视频来定制和生成与视频同步的声音,增强视频观看体验。MultiFoley联合训练互联网视频数据集和专业声音效果录音,实现高质量、全带宽(48kHz)的音频生成。MultiFoley能为视频制作提供灵活的声音设计控制,帮助用户创作出既干净又富有创意的音效。

阅读目录
  • MultiFoley是什么
  • MultiFoley的主要功能
  • MultiFoley的技术原理
  • MultiFoley的项目地址
  • MultiFoley的应用场景

MultiFoley

MultiFoley的主要功能

  • 文本控制的Foley生成:用文本提示引导和生成与视频同步的声音效果,是现实声音或创意声音。
  • 音频控制的Foley生成:支持用户从声音效果库中选择参考音频,将声音应用到无声视频中,并与视频同步。
  • Foley音频扩展:将部分音频轨道扩展,产生完整的Foley声音。
  • 质量控制:基于在文本中加入质量标签,生成高质量的全频带(48kHz)音频。
  • 多模态控制:结合文本、音频和视频的条件信号,提供细致的声音设计控制。

MultiFoley的技术原理

  • 联合训练:在互联网视频数据集(低质量音频)和专业声音效果(SFX)录音上进行训练,生成高质量的全频带音频。
  • 扩散变换器(Diffusion Transformer):基于扩散模型从随机噪声生成新样本,用在视频引导的Foley声音生成,并结合多模态控制。
  • 高质量音频自编码器(DAC-VAE):基于变分自编码器(VAE),将48kHz的音频波形编码成40Hz的潜在特征,用在音频-视频同步。
  • 冻结视频编码器:用在音频-视频同步,将视频编码成特征并与音频潜在编码一起使用。
  • 多条件训练策略:让模型灵活地支持下游任务,如音频扩展和文本驱动的声音设计。
  • 多头注意力机制:增强模型的表达能力,并行学习不同类型的特征或依赖关系。

MultiFoley的项目地址

  • 项目官网:ificl.github.io/MultiFoley
  • arXiv技术论文:https://arxiv.org/pdf/2411.17698

MultiFoley的应用场景

  • 电影和视频制作:在电影制作中,生成与画面动作同步的声音效果,如脚步声、关门声等,增强观众的沉浸感。
  • 游戏开发:在游戏中,为不同的游戏环境和动作生成逼真的声音,提升游戏体验。
  • 动画制作:对于动画,根据动画角色的动作生成相应的声音,让动画更加生动。
  • 广告制作:在广告行业中,根据广告创意生成吸引眼球的声音效果,增加广告的吸引力。
  • 虚拟现实(VR):在VR体验中,生成与虚拟环境同步的声音,提高用户的沉浸感和体验质量。
豆包视觉理解模型 – 豆包推出视觉理解模型,具备识别和推理能力
Granite 3.2 – IBM 开源的多模态系列 AI 模型
​MiniMax Code 2. 0 桌面端来了:长任务不再卡顿中断,远程操控和浏览器接管本月亮相
上海AI Lab开源Intern-S2-Preview:35B参数科学大模型,比肩万亿参数,首次实现晶体结构生成
Evo 2 – Acr研究所联合英伟达、斯坦福等推出的生物学AI模型
分享
Email 复制链接 打印
Share
上一篇 CAT4D – 谷歌和哥伦比亚大学等高校推出的单目视频创建4D场景方法
下一篇 NSFW Detector – 开源 AI 不适宜内容检测工具,支持识别图像、PDF、视频文件
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

Toonflow – 开源的一站式 AI 短剧创作工具

站外新闻
AIGC 资讯

LatentSync – 字节联合北交大开源的端到端唇形同步框架

站外新闻
AIGC 资讯

Audio-SDS – NVIDIA推出的扩展文本条件音频扩散模型

站外新闻
AIGC 资讯

DeepSeek Artifacts – Hugging Face推出的AI编程工具,基于DeepSeek V3

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney GPT Image 2 prompt AI Agent 写实人像 多模态大模型 EvoLink灵感 AI绘画 字节跳动 时尚大片 杂志排版 开源工具 开源模型 产品设计 商业海报 皮克斯风格 3D动画 色彩分析 AI生图 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 MoE架构 多模态AI
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.