Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MultiFoley – Adobe 联合密歇根大学推出的音效生成系统
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MultiFoley – Adobe 联合密歇根大学推出的音效生成系统
AIGC 资讯

MultiFoley – Adobe 联合密歇根大学推出的音效生成系统

站外新闻
最近更新: 2026年7月12日 上午4:18
SHARE

MultiFoley是什么

MultiFoley是Adobe Research和密歇根大学共同推出的音效生成系统,能基于文本、音频和视频的多模态控制生成Foley声音效果。系统支持用户根据文本提示、参考音频或部分视频来定制和生成与视频同步的声音,增强视频观看体验。MultiFoley联合训练互联网视频数据集和专业声音效果录音,实现高质量、全带宽(48kHz)的音频生成。MultiFoley能为视频制作提供灵活的声音设计控制,帮助用户创作出既干净又富有创意的音效。

阅读目录
  • MultiFoley是什么
  • MultiFoley的主要功能
  • MultiFoley的技术原理
  • MultiFoley的项目地址
  • MultiFoley的应用场景

MultiFoley

MultiFoley的主要功能

  • 文本控制的Foley生成:用文本提示引导和生成与视频同步的声音效果,是现实声音或创意声音。
  • 音频控制的Foley生成:支持用户从声音效果库中选择参考音频,将声音应用到无声视频中,并与视频同步。
  • Foley音频扩展:将部分音频轨道扩展,产生完整的Foley声音。
  • 质量控制:基于在文本中加入质量标签,生成高质量的全频带(48kHz)音频。
  • 多模态控制:结合文本、音频和视频的条件信号,提供细致的声音设计控制。

MultiFoley的技术原理

  • 联合训练:在互联网视频数据集(低质量音频)和专业声音效果(SFX)录音上进行训练,生成高质量的全频带音频。
  • 扩散变换器(Diffusion Transformer):基于扩散模型从随机噪声生成新样本,用在视频引导的Foley声音生成,并结合多模态控制。
  • 高质量音频自编码器(DAC-VAE):基于变分自编码器(VAE),将48kHz的音频波形编码成40Hz的潜在特征,用在音频-视频同步。
  • 冻结视频编码器:用在音频-视频同步,将视频编码成特征并与音频潜在编码一起使用。
  • 多条件训练策略:让模型灵活地支持下游任务,如音频扩展和文本驱动的声音设计。
  • 多头注意力机制:增强模型的表达能力,并行学习不同类型的特征或依赖关系。

MultiFoley的项目地址

  • 项目官网:ificl.github.io/MultiFoley
  • arXiv技术论文:https://arxiv.org/pdf/2411.17698

MultiFoley的应用场景

  • 电影和视频制作:在电影制作中,生成与画面动作同步的声音效果,如脚步声、关门声等,增强观众的沉浸感。
  • 游戏开发:在游戏中,为不同的游戏环境和动作生成逼真的声音,提升游戏体验。
  • 动画制作:对于动画,根据动画角色的动作生成相应的声音,让动画更加生动。
  • 广告制作:在广告行业中,根据广告创意生成吸引眼球的声音效果,增加广告的吸引力。
  • 虚拟现实(VR):在VR体验中,生成与虚拟环境同步的声音,提高用户的沉浸感和体验质量。
Lipsync-2 – Sync Labs 推出的首个零-shot 嘴型同步模型
智源研究院开源FLM-Audio:全双工音频对话模型,边听边说、低延迟、支持中英双语
VoltAgent – 开源的AI Agent构建和编排框架
字节跳动重磅发布 Doubao-Seed-Code:256K长上下文+视觉理解,AI编程模型成本直降国内最低
RepText – Liblib AI联合Shakker Labs推出的多语言视觉文本渲染框架
分享
Email 复制链接 打印
Share
上一篇 CAT4D – 谷歌和哥伦比亚大学等高校推出的单目视频创建4D场景方法
下一篇 NSFW Detector – 开源 AI 不适宜内容检测工具,支持识别图像、PDF、视频文件
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

SkyReels-V2 – 昆仑万维开源的无限时长电影生成模型

站外新闻
AIGC 资讯

I2V3D – 香港城市大学联合微软推出的图像到视频生成框架

站外新闻
AIGC 资讯

PP-DocBee – 百度飞桨推出的文档图像理解多模态大模型

站外新闻
AIGC 资讯

AI创作新高度:字节跳动发布Seedream 5.0 Pro,开启交互式精准编辑时代

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.