Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: StreamBridge – 苹果联合复旦推出的端侧视频大语言模型框架
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > StreamBridge – 苹果联合复旦推出的端侧视频大语言模型框架
AIGC 资讯

StreamBridge – 苹果联合复旦推出的端侧视频大语言模型框架

站外新闻
最近更新: 2026年6月7日 下午8:03
SHARE

StreamBridge是什么

StreamBridge 是苹果公司与复旦大学联合推出的端侧视频大语言模型(Video-LLMs)框架,能帮助 AI 实时理解直播流视频。框架基于内存缓冲区和轮次衰减压缩策略支持长上下文交互,引入轻量级激活模型实现主动响应功能。研究团队推出包含约 60 万个样本的 Stream-IT 数据集,提升流式视频理解能力。在主流离线模型如 LLaVA-OV-7B、Qwen2-VL-7B 和 Oryx-1.5-7B 上的测试显示,StreamBridge 显著提升模型在多轮实时理解和主动响应方面的能力,在流式视频理解领域展现出强大潜力。

阅读目录
  • StreamBridge是什么
  • StreamBridge的主要功能
  • StreamBridge的技术原理
  • StreamBridge的项目地址
  • StreamBridge的应用场景

StreamBridge

StreamBridge的主要功能

  • 多轮实时理解:支持长上下文的多轮交互,在处理最新视频片段时保留历史视觉和对话上下文。
  • 主动响应:模型能像人类一样主动监控视频流,在无明确指令的情况下及时输出反馈。
  • 灵活集成:支持无缝集成到现有的视频大语言模型中,无需对基础模型进行大规模修改。
  • 数据支持:提供大规模的流式视频理解数据集Stream-IT,包含约60万个样本,支持多样化的指令格式,用在训练和优化模型。

StreamBridge的技术原理

  • 记忆缓冲区:存储和检索视频帧的嵌入信息,支持多轮交互。每个新视频帧被独立编码追加到缓冲区中。当接收到用户查询时,缓冲区中的内容被扁平化为一个单一的输入嵌入序列,送入语言模型进行响应生成。
  • 轮次衰减压缩策略:在每次响应生成之前,如果输入嵌入的长度超过预定义的最大长度,模型从最早的对话轮次开始,逐帧合并视觉标记,直到总长度低于最大长度。合并操作基于平均池化实现,确保最近的视觉上下文被保留。
  • 轻量级激活模型:激活模型是独立的轻量级多模态大语言模型(MLLM),与主视频大语言模型并行运行。激活模型接收当前帧(及用户查询和可选的前几帧)作为输入,输出一个二进制信号,指示主模型是否生成响应。激活模型用一个得分头进行二分类(是否响应),在训练时引入一个可学习的激活标记<ACT>,监督激活时机。
  • Stream-IT数据集:基于从大规模视频字幕语料库中筛选语义相关的短片段,生成多轮问答序列,模拟真实的实时用户交互。数据集包含约60万个样本,支持多种任务格式,如密集视频字幕、顺序步骤识别、基于视频的问题回答等。

StreamBridge的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2505.05467

StreamBridge的应用场景

  • 实时视频交互:提升视频会议、在线教育等场景的实时互动体验。
  • 自动驾驶辅助:实时处理路况视频,辅助自动驾驶决策。
  • 智能监控:实时分析监控视频,快速发现异常行为。
  • 机器人视觉:助力机器人实时理解环境,实现自然交互。
  • 内容创作:辅助视频创作和编辑,提供实时内容分析。
Kairos 3.0: 大晓机器人开源商业级世界模型,用物理AI加速具身智能落地
国产算力新里程碑:美团LongCat-2. 0 大模型正式开源
阿里通义开源Mobile-Agent-v3.5:跨平台GUI Agent框架,从演示级迈向工程级
TeleChat3发布:中国电信千亿参数MoE大模型,全链路国产化训练,开源36B版本
Ultravox – 端到端多模态大模型,直接理解文本和人类语音
分享
Email 复制链接 打印
Share
上一篇 DeepEP – DeepSeek 开源的专家并行通信库,专为 MoE 训练和推理设计
下一篇 MiniRAG – 港大推出高效部署小语言模型的新型 RAG 系统
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

OpenAI扩大ChatGPT家长通知,青少年暴力违规将触发提醒
AIGC 资讯
GPT‑5.4 – OpenAI推出面向专业工作的旗舰AI模型
AIGC 资讯
​YouTube 收紧政策,严打低质 AI 内容
AIGC 资讯
小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后
AIGC 资讯

相关推荐

AIGC 资讯

AutoRAG – Cloudflare 推出的全托管检索增强生成服务

站外新闻
AIGC 资讯

QA-MDT – 中科大联合科大讯飞推出开源音乐生成模型

站外新闻
AI 工具AIGC 资讯

智谱GLM-4.5开源SOTA模型发布:MoE架构引领效率革命,价格仅Claude十分之一

站外新闻
GLM-4.5 MoE架构 开源大模型 智谱AI
AIGC 资讯

GLM-4-Plus – 智谱AI最新推出的旗舰大模型,性能全面提升

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.