Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型
AIGC 资讯

Audio-Visual Flamingo – 英伟达等开源的音频视觉语言模型

站外新闻
最近更新: 2026年7月21日 下午5:41
SHARE

Audio-Visual Flamingo是什么

Audio-Visual Flamingo(简称 AV-Flamingo)是 NVIDIA 与马里兰大学联合推出的开源音频-视觉大语言模型,专为长视频与复杂真实世界音视频内容的联合理解与推理而设计。模型能同时处理视觉与听觉输入,还支持语音交互输出,在 15 项以上音视频、全模态及视觉基准测试中,用 7B 参数规模超越众多更大尺寸的开源与闭源模型。

阅读目录
  • Audio-Visual Flamingo是什么
  • Audio-Visual Flamingo的主要功能
  • Audio-Visual Flamingo的技术原理
  • 如何使用Audio-Visual Flamingo
  • Audio-Visual Flamingo的核心优势
  • Audio-Visual Flamingo的项目地址
  • Audio-Visual Flamingo的同类竞品对比
  • Audio-Visual Flamingo的应用场景

Audio-Visual Flamingo

Audio-Visual Flamingo的主要功能

  • 长视频音视频联合理解:支持最长 15 分钟的视频输入,同步解析画面、语音、环境声与音乐。
  • 跨模态推理:回答需同时结合视觉与听觉信息的问题(如”视频中某个声音对应什么画面”)。
  • 时间定位推理:通过 TAVIT 框架将推理步骤显式锚定到视频时间戳,提升时间对齐与可解释性。
  • 语音对话输出:集成流式 TTS,支持基于音视频内容的实时语音回复。
  • 多技能覆盖:涵盖关系推理、情绪变化追踪、因果推理、时空感知、幻觉检测、事件计数等 13 类能力。

Audio-Visual Flamingo的技术原理

  • 架构:采用 SigLip 视觉编码器 + AF-Whisper 音频编码器,分别提取图像/视频帧特征与音频特征;通过 2 层 MLP 投影器将两者映射到 LLM 嵌入空间。
  • 跨模态时序对齐:将视觉与音频 token 按时间窗口交错排列,并引入约束性旋转时间嵌入(CRTE),使模型能感知多模态事件的绝对时序与相对顺序。
  • 三阶段训练课程:(1) 预训练:使用 AV-Skills 短上下文数据;(2) 中训练:使用 AV-Skills 长上下文数据;(3) 后训练:用链式思维数据,逐步从短程感知过渡到长程多事件推理。
  • 数据集:Audio-Visual-Skills包含约 700 万条训练实例,覆盖 24 万小时视频,专门强调时序、组合与跨模态推理。
  • 基座模型:基于 Qwen2.5-7B,采用混合序列并行与全分片数据并行策略处理长上下文。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Audio-Visual Flamingo

  • 获取模型:访问 AV-Flamingo 的 GitHub 仓库或 Hugging Face 页面,下载开源的模型权重、推理代码及配置文件。
  • 环境配置:配置 Python 环境并安装项目依赖,确保 GPU 显存足以加载 7B 参数模型及其多模态编码器。
  • 准备输入:将待分析的图像、视频或音频文件作为输入,同时编写具体的文本问题或指令。
  • 视觉编码:视觉输入由 SigLip 编码器提取多尺度空间特征,经 Dynamic S² 模块压缩为紧凑的视觉 token 序列。
  • 音频编码:音频输入经重采样后由 AF-Whisper 编码器以 30 秒滑动窗口方式提取特征,支持任意长度的音频流。
  • 跨模态对齐:模型自动通过投影层将音视频特征映射到 LLM 嵌入空间,并按时间窗口交错排列,附加旋转时间嵌入保留绝对时序。
  • 推理生成:将处理后的多模态 token 与文本提示词拼接,输入 Qwen2.5-7B 进行自回归推理,生成文本回答。

Audio-Visual Flamingo的核心优势

  • 长视频专精:针对 1 分钟以上甚至 15 分钟的长视频优化,解决现有模型在长视频上性能骤降的问题。
  • 真正的联合推理:数据集与训练目标均针对跨模态设计,非简单拼接单模态能力。
  • 时序可解释性:TAVIT 让模型在回答长视频问题时,能显式引用”第 22 秒到 45 秒”等具体时间区间作为推理依据。
  • 完全开源:相比 GPT-4o、Gemini 等闭源方案,AV-Flamingo 在模型、数据、代码层面全面开放。

Audio-Visual Flamingo的项目地址

  • 项目官网:https://avflamingo.pages.dev/
  • GitHub仓库:https://github.com/NVIDIA/audio-flamingo
  • HuggingFace模型库:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
  • arXiv技术论文:https://arxiv.org/pdf/2607.16107

Audio-Visual Flamingo的同类竞品对比

对比维度 AV-Flamingo Qwen3.5-Omni
研发方 NVIDIA + 马里兰大学 阿里巴巴
开源程度 完全开源(权重、代码、数据方法均公开) 仅开源权重,训练数据与方法未公开
参数规模 7B 未公开(推测更大)
核心定位 长视频音视频联合理解与显式时序推理 全模态实时对话与生成
长视频优化 专门支持最长 15 分钟,三阶段课程训练 支持长序列,但无针对长视频的专门课程
时序推理 TAVIT 框架将推理步骤显式锚定到时间戳 无显式时间戳 grounding 机制
训练数据 AV-Skills(约 700 万实例、24 万小时、13 类技能) 未公开
语音输出 流式 TTS,基于文本 token 实时解码 支持语音输出,具体机制未公开
长视频基准 在 MMOU 长视频推理上超越更大模型 长视频性能随时长增加而下降

Audio-Visual Flamingo的应用场景

  • 影视内容分析:自动生成长电影/电视剧的带时间戳的详细解说,定位关键情节与音效。
  • 教育与在线课程:对长讲座视频进行跨模态问答,学生可询问”老师在第几分钟提到了某个公式”。
  • 体育与赛事复盘:结合画面与现场解说,分析战术变化、进球瞬间与评论员观点。
  • 播客与访谈处理:为纯音频或音视频播客生成结构化摘要,并支持基于时间戳的精确检索。
  • 安防与监控审查:在长时间监控录像中,通过声音(如玻璃破碎)+ 画面联合定位异常事件。
SuperEdit – 字节跳动等机构推出的图像编辑方法
HoloDreamer – AI文本驱动3D场景生成框架
MOFA-Video – 腾讯开源的可控性AI图生视频模型
Supertonic:66M参数167倍实时速度!开源离线TTS系统,隐私安全与极速合成兼得
昆仑万维重磅开源Skywork-Reward-V2:8款奖励模型横扫七大榜单,4000万数据集驱动AI对齐新突破
分享
Email 复制链接 打印
Share
上一篇 Hyra – 腾讯混元推出的科学发现智能体
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Hyra – 腾讯混元推出的科学发现智能体
AIGC 资讯
全息流体渐变通用占位特色图
消息称智元机器人据悉冲刺IPO,目标估值200亿美元
AIGC 资讯
全息流体渐变通用占位特色图
美国大模型抄了DeepSeek作业:性能没赢、价格更贵,却精准卡住了美国企业的合规刚需
AIGC 资讯
GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
AIGC 资讯

相关推荐

AIGC 资讯

Excalidraw – 开源的在线白板工具,手绘风格实时协作

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

英伟达营收逼近千亿大关,黄仁勋亲自回应架构延期传闻

站外新闻
AIGC 资讯

​Claude Code再进化!内置浏览器让AI自主“刷网页”

站外新闻
AIGC 资讯

MemU开源记忆框架:让AI情感陪伴更懂你,92%准确率+50ms检索速度

站外新闻
AI记忆框架 MemU 情感陪伴 知识图谱
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.