Audio-Visual Flamingo是什么
Audio-Visual Flamingo(简称 AV-Flamingo)是 NVIDIA 与马里兰大学联合推出的开源音频-视觉大语言模型,专为长视频与复杂真实世界音视频内容的联合理解与推理而设计。模型能同时处理视觉与听觉输入,还支持语音交互输出,在 15 项以上音视频、全模态及视觉基准测试中,用 7B 参数规模超越众多更大尺寸的开源与闭源模型。
阅读目录

Audio-Visual Flamingo的主要功能
-
长视频音视频联合理解:支持最长 15 分钟的视频输入,同步解析画面、语音、环境声与音乐。
-
跨模态推理:回答需同时结合视觉与听觉信息的问题(如”视频中某个声音对应什么画面”)。
-
时间定位推理:通过 TAVIT 框架将推理步骤显式锚定到视频时间戳,提升时间对齐与可解释性。
-
语音对话输出:集成流式 TTS,支持基于音视频内容的实时语音回复。
-
多技能覆盖:涵盖关系推理、情绪变化追踪、因果推理、时空感知、幻觉检测、事件计数等 13 类能力。
Audio-Visual Flamingo的技术原理
-
架构:采用 SigLip 视觉编码器 + AF-Whisper 音频编码器,分别提取图像/视频帧特征与音频特征;通过 2 层 MLP 投影器将两者映射到 LLM 嵌入空间。
-
跨模态时序对齐:将视觉与音频 token 按时间窗口交错排列,并引入约束性旋转时间嵌入(CRTE),使模型能感知多模态事件的绝对时序与相对顺序。
-
三阶段训练课程:(1) 预训练:使用 AV-Skills 短上下文数据;(2) 中训练:使用 AV-Skills 长上下文数据;(3) 后训练:用链式思维数据,逐步从短程感知过渡到长程多事件推理。
-
数据集:Audio-Visual-Skills包含约 700 万条训练实例,覆盖 24 万小时视频,专门强调时序、组合与跨模态推理。
-
基座模型:基于 Qwen2.5-7B,采用混合序列并行与全分片数据并行策略处理长上下文。

微信关注回复“开源”,加入AI开源项目交流群
如何使用Audio-Visual Flamingo
-
获取模型:访问 AV-Flamingo 的 GitHub 仓库或 Hugging Face 页面,下载开源的模型权重、推理代码及配置文件。
-
环境配置:配置 Python 环境并安装项目依赖,确保 GPU 显存足以加载 7B 参数模型及其多模态编码器。
-
准备输入:将待分析的图像、视频或音频文件作为输入,同时编写具体的文本问题或指令。
-
视觉编码:视觉输入由 SigLip 编码器提取多尺度空间特征,经 Dynamic S² 模块压缩为紧凑的视觉 token 序列。
-
音频编码:音频输入经重采样后由 AF-Whisper 编码器以 30 秒滑动窗口方式提取特征,支持任意长度的音频流。
-
跨模态对齐:模型自动通过投影层将音视频特征映射到 LLM 嵌入空间,并按时间窗口交错排列,附加旋转时间嵌入保留绝对时序。
-
推理生成:将处理后的多模态 token 与文本提示词拼接,输入 Qwen2.5-7B 进行自回归推理,生成文本回答。
Audio-Visual Flamingo的核心优势
-
长视频专精:针对 1 分钟以上甚至 15 分钟的长视频优化,解决现有模型在长视频上性能骤降的问题。
-
真正的联合推理:数据集与训练目标均针对跨模态设计,非简单拼接单模态能力。
-
时序可解释性:TAVIT 让模型在回答长视频问题时,能显式引用”第 22 秒到 45 秒”等具体时间区间作为推理依据。
-
完全开源:相比 GPT-4o、Gemini 等闭源方案,AV-Flamingo 在模型、数据、代码层面全面开放。
Audio-Visual Flamingo的项目地址
- 项目官网:https://avflamingo.pages.dev/
- GitHub仓库:https://github.com/NVIDIA/audio-flamingo
- HuggingFace模型库:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
- arXiv技术论文:https://arxiv.org/pdf/2607.16107
Audio-Visual Flamingo的同类竞品对比
| 对比维度 | AV-Flamingo | Qwen3.5-Omni |
|---|---|---|
| 研发方 | NVIDIA + 马里兰大学 | 阿里巴巴 |
| 开源程度 | 完全开源(权重、代码、数据方法均公开) | 仅开源权重,训练数据与方法未公开 |
| 参数规模 | 7B | 未公开(推测更大) |
| 核心定位 | 长视频音视频联合理解与显式时序推理 | 全模态实时对话与生成 |
| 长视频优化 | 专门支持最长 15 分钟,三阶段课程训练 | 支持长序列,但无针对长视频的专门课程 |
| 时序推理 | TAVIT 框架将推理步骤显式锚定到时间戳 | 无显式时间戳 grounding 机制 |
| 训练数据 | AV-Skills(约 700 万实例、24 万小时、13 类技能) | 未公开 |
| 语音输出 | 流式 TTS,基于文本 token 实时解码 | 支持语音输出,具体机制未公开 |
| 长视频基准 | 在 MMOU 长视频推理上超越更大模型 | 长视频性能随时长增加而下降 |
Audio-Visual Flamingo的应用场景
-
影视内容分析:自动生成长电影/电视剧的带时间戳的详细解说,定位关键情节与音效。
-
教育与在线课程:对长讲座视频进行跨模态问答,学生可询问”老师在第几分钟提到了某个公式”。
-
体育与赛事复盘:结合画面与现场解说,分析战术变化、进球瞬间与评论员观点。
-
播客与访谈处理:为纯音频或音视频播客生成结构化摘要,并支持基于时间戳的精确检索。
-
安防与监控审查:在长时间监控录像中,通过声音(如玻璃破碎)+ 画面联合定位异常事件。
