Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Magma – 微软研究院联合华盛顿等高校推出的多模态AI基础模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • 强化 AI 学习
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • 社区
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Magma – 微软研究院联合华盛顿等高校推出的多模态AI基础模型
AIGC 资讯

Magma – 微软研究院联合华盛顿等高校推出的多模态AI基础模型

站外新闻
最近更新: 2026年6月9日 上午1:01
SHARE

Magma是什么

Magma 是微软研究院推出的新型多模态AI基础模型,能为多模态人工智能代理(AI agents)提供通用能力。Magma能理解和执行多模态输入的任务,覆盖数字和物理环境。Magma基于大规模的视觉-语言数据和动作数据进行预训练,Magma 结合了语言智能、空间智能和时间智能,能完成从 UI 导航到机器人操作的复杂任务。在实验中,Magma 在零样本和微调设置下均展现出卓越性能,在机器人操作和多模态理解任务中,超越了现有的专用模型。

阅读目录
  • Magma是什么
  • Magma的主要功能
  • Magma的技术原理
  • Magma的项目地址
  • Magma的应用场景

Magma

Magma的主要功能

  • 多模态理解:能处理图像、视频、文本等多种模态的数据,理解其语义、空间和时间信息。支持从简单的图像识别到复杂的视频理解任务。
  • 动作规划与执行:将复杂的任务分解为一系列可执行的动作序列。支持从 UI 导航(如网页操作、移动应用操作)到物理环境中的机器人操作(如抓取、放置、移动物体)。
  • 环境适应性:在零样本(zero-shot)的情况下适应多种下游任务,包括 UI 导航、机器人操作和多模态理解。

Magma的技术原理

  • 预训练架构:使用卷积网络(如 ConvNeXt)作为视觉编码器,处理图像和视频数据。将编码后的视觉信息与语言标记一起输入到一个大型语言模型(LLM)中,生成动作序列或语言描述。
  • Set-of-Mark (SoM):在图像中标注可操作的视觉对象(如 GUI 中的按钮、机器人手臂的目标位置)。基于预测这些标记的位置,帮助模型理解和执行动作落地(action grounding)。
  • Trace-of-Mark (ToM):在视频中标注物体的运动轨迹(如机器人手臂的运动路径)。基于预测未来轨迹,帮助模型理解和规划动作序列,增强时间动态的理解能力。
  • 多模态数据融合:预训练数据包括图像、视频、机器人操作数据和多模态理解任务的数据。基于 SoM 和 ToM 技术,将这些不同类型的数据统一到一个预训练框架中,提升模型的通用性和适应性。
  • 零样本和微调能力:预训练后的模型能直接应用于未见过的任务(零样本),表现出较强的泛化能力。在少量数据上进行微调后,能进一步提升性能,适应特定任务的需求。

Magma的项目地址

  • 项目官网:https://microsoft.github.io/Magma/
  • GitHub仓库:https://github.com/microsoft/Magma
  • arXiv技术论文:https://www.arxiv.org/pdf/2502.13130

Magma的应用场景

  • 网页和移动应用操作:自动完成搜索、安装应用、填写表单等任务。
  • 机器人操作:控制机器人完成抓取、放置和移动物体等任务。
  • 视频理解:分析视频内容,回答相关问题。
  • 智能助手:作为虚拟助手,理解指令并完成交互任务。
  • 教育与培训:辅助教学,提供操作指导和反馈。
华南理工与微信AI联手发布ComoRAG:模拟人脑推理的下一代RAG框架,长文本理解能力飙升
Open Deep Research – Deep Research开源复现版智能体,支持切换多种语言模型
阿里通义开源Mobile-Agent-v3.5:跨平台GUI Agent框架,从演示级迈向工程级
Spatial-RAG – 埃默里大学等机构推出的空间推理能力框架
GPT‑5.3‑Codex‑Spark – OpenAI推出的轻量级编程模型
分享
Email 复制链接 打印
Share
上一篇 NEXUS-O – 多模态AI模型,实现对语言、音频和视觉全方位感知与交互
下一篇 TIGER – 清华大学推出的轻量级语音分离模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

字节跳动发布SeedVR2:单步视频修复模型,以极低成本实现1080p高清画质革新
AI 工具 AIGC 资讯
北大微软联手突破:Next-Frame Diffusion实现30+FPS实时自回归视频生成,扩散模型与因果注意力新范式
AI 工具 AIGC 资讯
美团LLIA框架深度解析:实时音频驱动肖像视频生成,如何实现低延迟高保真交互?
AI 工具 AIGC 资讯
腾讯开源Hunyuan3D-2.1:工业级3D生成模型,支持PBR材质与多模态输入,1秒极速出图
AI 工具 AIGC 资讯

相关推荐

AI 工具AIGC 资讯

问小白o4并行思考模型发布:8路径同步推理,速度超DeepSeek R1 70%,性能碾压o3-mini

站外新闻
DeepSeek R1 OpenAI o3-mini 大模型推理 并行思考模型 问小白o4
AIGC 资讯

BlenderMCP – 基于 MCP 集成的 3D 建模工具

站外新闻
AIGC 资讯

GEN3C – NVIDIA 联合多伦多大学等推出的生成式视频模型

站外新闻
AIGC 资讯

AuraFusion360 – 三维场景修复技术,实现高质量物体去除和孔洞填充

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

Agent AI AI Agent AIGC AI大模型 AI安全 AI工具 AI智能体 AI模型 AI绘画 AI编程 AI编程助手 AI编程工具 AI视频生成 AI音乐生成 Anthropic Cerebras WSE-3 chatgpt Claude Claude Code DeepSeek Gemini GPT-5.3 Instant GPT-5.3-Codex-Spark GPT-5.4 MCP协议 meta Midjourney MiniMax Mistral AI MoE架构 openai prompt Qwen3 RAG SWE-Bench xAI 上海人工智能实验室 世界模型 人工智能 人物 代码生成 企业级AI 全模态大模型 具身智能 图像生成 图像生成模型 多智能体 多模态 多模态AI 多模态大模型 多模态模型 大模型 大模型应用 大语言模型 字节跳动 小红书 展台 开源 开源AI 开源AI工具 开源大模型 开源工具 开源平台 开源框架 开源模型 开源项目 强化学习 微软 扩散模型 推理模型 教程 数字人 文本转语音 早报 昆仑万维 智谱AI 月之暗面 本地部署 清华大学 生成式AI 美团 腾讯 腾讯混元 自然语言处理 英伟达 蚂蚁集团 视觉语言模型 视频生成 视频生成模型 语音合成 谷歌 谷歌AI 谷歌DeepMind 通义千问 阶跃星辰 阿里巴巴 阿里通义 面壁智能 香港大学
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.