Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型
AIGC 资讯

Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型

站外新闻
最近更新: 2026年7月21日 下午5:41
SHARE

Audio-Visual Flamingo是什么

Audio-Visual Flamingo(简称 AV-Flamingo)是 NVIDIA 与马里兰大学联合推出的开源音频-视觉大语言模型,专为长视频与复杂真实世界音视频内容的联合理解与推理而设计。模型能同时处理视觉与听觉输入,还支持语音交互输出,在 15 项以上音视频、全模态及视觉基准测试中,用 7B 参数规模超越众多更大尺寸的开源与闭源模型。

阅读目录
  • Audio-Visual Flamingo是什么
  • Audio-Visual Flamingo的主要功能
  • Audio-Visual Flamingo的技术原理
  • 如何使用Audio-Visual Flamingo
  • Audio-Visual Flamingo的核心优势
  • Audio-Visual Flamingo的项目地址
  • Audio-Visual Flamingo的同类竞品对比
  • Audio-Visual Flamingo的应用场景

Audio-Visual Flamingo

Audio-Visual Flamingo的主要功能

  • 长视频音视频联合理解:支持最长 15 分钟的视频输入,同步解析画面、语音、环境声与音乐。
  • 跨模态推理:回答需同时结合视觉与听觉信息的问题(如”视频中某个声音对应什么画面”)。
  • 时间定位推理:通过 TAVIT 框架将推理步骤显式锚定到视频时间戳,提升时间对齐与可解释性。
  • 语音对话输出:集成流式 TTS,支持基于音视频内容的实时语音回复。
  • 多技能覆盖:涵盖关系推理、情绪变化追踪、因果推理、时空感知、幻觉检测、事件计数等 13 类能力。

Audio-Visual Flamingo的技术原理

  • 架构:采用 SigLip 视觉编码器 + AF-Whisper 音频编码器,分别提取图像/视频帧特征与音频特征;通过 2 层 MLP 投影器将两者映射到 LLM 嵌入空间。
  • 跨模态时序对齐:将视觉与音频 token 按时间窗口交错排列,并引入约束性旋转时间嵌入(CRTE),使模型能感知多模态事件的绝对时序与相对顺序。
  • 三阶段训练课程:(1) 预训练:使用 AV-Skills 短上下文数据;(2) 中训练:使用 AV-Skills 长上下文数据;(3) 后训练:用链式思维数据,逐步从短程感知过渡到长程多事件推理。
  • 数据集:Audio-Visual-Skills包含约 700 万条训练实例,覆盖 24 万小时视频,专门强调时序、组合与跨模态推理。
  • 基座模型:基于 Qwen2.5-7B,采用混合序列并行与全分片数据并行策略处理长上下文。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Audio-Visual Flamingo

  • 获取模型:访问 AV-Flamingo 的 GitHub 仓库或 Hugging Face 页面,下载开源的模型权重、推理代码及配置文件。
  • 环境配置:配置 Python 环境并安装项目依赖,确保 GPU 显存足以加载 7B 参数模型及其多模态编码器。
  • 准备输入:将待分析的图像、视频或音频文件作为输入,同时编写具体的文本问题或指令。
  • 视觉编码:视觉输入由 SigLip 编码器提取多尺度空间特征,经 Dynamic S² 模块压缩为紧凑的视觉 token 序列。
  • 音频编码:音频输入经重采样后由 AF-Whisper 编码器以 30 秒滑动窗口方式提取特征,支持任意长度的音频流。
  • 跨模态对齐:模型自动通过投影层将音视频特征映射到 LLM 嵌入空间,并按时间窗口交错排列,附加旋转时间嵌入保留绝对时序。
  • 推理生成:将处理后的多模态 token 与文本提示词拼接,输入 Qwen2.5-7B 进行自回归推理,生成文本回答。

Audio-Visual Flamingo的核心优势

  • 长视频专精:针对 1 分钟以上甚至 15 分钟的长视频优化,解决现有模型在长视频上性能骤降的问题。
  • 真正的联合推理:数据集与训练目标均针对跨模态设计,非简单拼接单模态能力。
  • 时序可解释性:TAVIT 让模型在回答长视频问题时,能显式引用”第 22 秒到 45 秒”等具体时间区间作为推理依据。
  • 完全开源:相比 GPT-4o、Gemini 等闭源方案,AV-Flamingo 在模型、数据、代码层面全面开放。

Audio-Visual Flamingo的项目地址

  • 项目官网:https://avflamingo.pages.dev/
  • GitHub仓库:https://github.com/NVIDIA/audio-flamingo
  • HuggingFace模型库:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
  • arXiv技术论文:https://arxiv.org/pdf/2607.16107

Audio-Visual Flamingo的同类竞品对比

对比维度 AV-Flamingo Qwen3.5-Omni
研发方 NVIDIA + 马里兰大学 阿里巴巴
开源程度 完全开源(权重、代码、数据方法均公开) 仅开源权重,训练数据与方法未公开
参数规模 7B 未公开(推测更大)
核心定位 长视频音视频联合理解与显式时序推理 全模态实时对话与生成
长视频优化 专门支持最长 15 分钟,三阶段课程训练 支持长序列,但无针对长视频的专门课程
时序推理 TAVIT 框架将推理步骤显式锚定到时间戳 无显式时间戳 grounding 机制
训练数据 AV-Skills(约 700 万实例、24 万小时、13 类技能) 未公开
语音输出 流式 TTS,基于文本 token 实时解码 支持语音输出,具体机制未公开
长视频基准 在 MMOU 长视频推理上超越更大模型 长视频性能随时长增加而下降

Audio-Visual Flamingo的应用场景

  • 影视内容分析:自动生成长电影/电视剧的带时间戳的详细解说,定位关键情节与音效。
  • 教育与在线课程:对长讲座视频进行跨模态问答,学生可询问”老师在第几分钟提到了某个公式”。
  • 体育与赛事复盘:结合画面与现场解说,分析战术变化、进球瞬间与评论员观点。
  • 播客与访谈处理:为纯音频或音视频播客生成结构化摘要,并支持基于时间戳的精确检索。
  • 安防与监控审查:在长时间监控录像中,通过声音(如玻璃破碎)+ 画面联合定位异常事件。
4秒生成百万面!Hyper3D Rodin Gen-2.5发布全球首个千万面级3D生成AI模型
DeepSeek-Prover-V1.5 – 70亿参数的开源数学大模型
MMedAgent – 专为医疗领域设计的多模态AI智能体,管理多种医疗任务
安全研究员揪出ChatGPT漏洞:提示词注入竟能绕过文件访问限制
Yuan3.0 Ultra 开源发布:浪潮信息万亿参数多模态大模型,LAEP 算法提速 49%,定义企业级 Agent 引擎
分享
Email 复制链接 打印
Share
上一篇 Hyra – 腾讯混元推出的科学发现智能体
下一篇 ​打破专用模型桎梏!谷歌 DeepMind 发布 GenCeption,一个 AI 搞定五大视觉任务
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

BettaFish开源舆情系统:多Agent自动采集分析,覆盖30+平台,一键部署预测舆论走向

站外新闻
品牌公关 多Agent协作 开源舆情系统 自然语言处理 舆情分析
AI 工具AIGC 资讯

AnyClaw 开源发布:专为AI Agent打造的「万能转接头」,一键将传统API、脚本转为MCP/Skills/CLI工具

站外新闻
AI Agent MCP协议 OpenCLI 开源工具 智能转接头
AIGC 资讯

Aria-UI – 港大联合 Rhymes AI 开源面向 GUI 智能交互的多模态模型

站外新闻
量子芯片科技感占位特色图
AI 工具AIGC 资讯

奔腾4惊现AI复活赛!2006年古董CPU硬扛Meta Llama 3大模型,每秒仅0.21 Token背后藏何玄机?

站外新闻
AI硬件兼容性 Llama 3 meta 奔腾4
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.