Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: 小米全球首个开源跨领域具身大模型MiMo-Embodied发布:重塑自动驾驶与机器人智能
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AI 工具 > 小米全球首个开源跨领域具身大模型MiMo-Embodied发布:重塑自动驾驶与机器人智能
AI 工具

小米全球首个开源跨领域具身大模型MiMo-Embodied发布:重塑自动驾驶与机器人智能

站外新闻
最近更新: 2026年6月7日 下午8:12
MiMo-Embodied 具身大模型 多模态交互 开源AI 自动驾驶
SHARE

💡 站外导读:随着AI向物理世界深度渗透,具身智能与自动驾驶成为两大关键赛道,但传统模型常局限于单一领域,难以应对复杂动态环境。小米发布的MiMo-Embodied全球首个开源跨领域具身大模型,正瞄准这一行业痛点:它整合了自动驾驶的精准感知与具身智能的任务规划能力,通过统一架构和四阶段训练,实现了强大的跨领域泛化。这不仅提升了模型在真实场景中的可靠性,还为开发者提供了开箱即用的工具,加速智能系统从实验室走向应用。

MiMo-Embodied是什么

MiMo-Embodied 是小米发布的全球首个开源的跨领域具身大模型,整合了自动驾驶和具身智能两大领域的任务,实现了在环境感知、任务规划、空间理解等多方面的卓越性能。模型基于视觉语言模型(VLM)架构,通过四阶段训练策略,包括具身智能监督微调、自动驾驶监督微调、链式推理微调和强化学习微调,显著提升了跨领域的泛化能力。在自动驾驶领域,MiMo-Embodied 能精准感知交通场景、预测动态目标行为,并生成安全高效的驾驶规划;在具身智能领域,能理解自然语言指令,完成复杂的任务规划和空间推理。MiMo-Embodied 在多项基准测试中超越了现有的开源和专用模型,展现了强大的多模态交互能力。

阅读目录
  • MiMo-Embodied是什么
  • MiMo-Embodied的主要功能
  • MiMo-Embodied的技术原理
  • MiMo-Embodied的项目地址
  • MiMo-Embodied的应用场景
      • 📝 站长洞察 (Editor’s Insight)

MiMo-Embodied

MiMo-Embodied的主要功能

  • 跨领域整合能力:MiMo-Embodied 是首个成功整合自动驾驶与具身智能任务的模型,覆盖环境感知、任务规划、空间理解等核心能力,适用于复杂动态环境中的多模态交互。
  • 环境感知:在自动驾驶场景中,模型能精准理解交通场景,包括识别交通标志、车辆、行人等关键元素,并预测其动态行为,为安全驾驶提供支持。
  • 任务规划与执行:在具身智能领域,MiMo-Embodied 能根据自然语言指令生成可执行的动作序列,完成复杂的任务规划,如机器人导航与操作。
  • 空间理解与推理:模型具备强大的空间推理能力,能理解物体之间的空间关系,支持导航、交互和场景理解等任务,适用于机器人操作和自动驾驶中的路径规划。
  • 多模态交互:通过视觉和语言的深度融合,MiMo-Embodied 能处理图像、视频和文本输入,支持多模态任务,如视觉问答、指令遵循和场景描述。
  • 强化学习优化:采用强化学习微调,提升模型在复杂场景中的决策能力和任务执行的可靠性,确保在真实环境中的高效部署。
  • 开源与通用性:MiMo-Embodied 完全开源,代码和模型可在 Hugging Face 获取,为研究者和开发者提供了强大的工具,推动具身智能和自动驾驶领域的创新。

MiMo-Embodied的技术原理

  • 跨领域融合架构:MiMo-Embodied 采用统一的视觉语言模型(VLM)架构,将自动驾驶和具身智能任务整合到一个模型中,通过视觉编码器、投影器和大语言模型(LLM)实现视觉输入与文本理解的深度融合。
  • 多阶段训练策略:模型通过四阶段训练逐步提升性能,包括具身智能监督微调、自动驾驶监督微调、链式推理微调和强化学习微调,确保在不同任务和场景下的泛化能力。
  • 视觉输入处理:利用 Vision Transformer(ViT)对单图像、多图像和视频进行编码,提取视觉特征并通过多层感知机(MLP)映射到与 LLM 对齐的潜在空间,实现视觉与语言的无缝融合。
  • 数据驱动的跨领域学习:构建了涵盖通用视觉语言理解、具身智能和自动驾驶场景的多样化数据集,为模型提供丰富的多模态监督信号,支持从基础感知到复杂推理的学习。
  • 强化学习优化:在训练的最后阶段,采用 Group Relative Policy Optimization(GRPO)算法进行强化学习微调,针对复杂任务和边缘场景优化模型的决策质量和可靠性。
  • 推理与输出生成:通过 LLM 的推理能力,将视觉输入与语言指令结合,生成与任务相关的响应和决策,支持自动驾驶中的路径规划、具身智能中的任务执行等。

MiMo-Embodied的项目地址

  • Github仓库:https://github.com/XiaomiMiMo/MiMo-Embodied
  • HuggingFace模型库:https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B
  • arXiv技术论文:https://arxiv.org/pdf/2511.16518

MiMo-Embodied的应用场景

  • 自动驾驶:MiMo-Embodied 能处理复杂的交通场景,进行环境感知、状态预测和驾驶规划,适用于城市道路、高速公路等多种自动驾驶场景,为智能驾驶系统提供决策支持。
  • 机器人导航与操作:在具身智能领域,模型可以根据自然语言指令完成室内导航、物体操作等任务,支持机器人在家庭、工业等环境中的自主行动。
  • 视觉问答与交互:适用于视觉问答(VQA)任务,能理解图像或视频内容并回答相关问题,支持人机交互中的信息检索和解释。
  • 场景理解与描述:模型能对复杂场景进行语义理解并生成描述,适用于安防监控、智能交通等领域的场景分析。
  • 多模态任务执行:支持多模态输入,如图像、视频和文本,能处理跨模态任务,如指令遵循、图像标注等,适用于智能助手和自动化系统。
  • 复杂环境中的任务规划:在复杂环境中,MiMo-Embodied 能根据指令生成多步任务规划,支持机器人完成清洁、烹饪等复杂任务。

📝 站长洞察 (Editor’s Insight)

MiMo-Embodied的发布标志着具身智能进入‘跨域融合’新阶段。当前,行业正从孤立的算法模型向多模态、多任务统一的AGI路径演进,小米此举不仅展示了技术整合的工程实力,更体现了开源生态的战略思维——通过开源推动自动驾驶与机器人领域的协同创新,降低研发门槛。从趋势看,这类模型将成为智能终端(如汽车、机器人)的‘大脑核心’,未来在泛在智能、人机共融场景中潜力巨大。小米作为硬件巨头切入软硬结合领域,其数据闭环和场景落地优势可能重塑竞争格局,值得关注其后续生态布局。

Press Hook AI Press Release Generator
Babbl
腾讯混元 Hy-MT2 开源翻译大模型:7B 参数性能碾压 Gemini,440MB 量化版让手机变身离线翻译机
OpenAI重磅发布ChatGPT for PowerPoint插件:一句话生成PPT,智能分析揪出逻辑Bug,彻底重塑职场效率
Brain.fm
TAGGED:MiMo-Embodied具身大模型多模态交互开源AI自动驾驶
分享
Email 复制链接 打印
Share
上一篇 Supertonic:66M参数167倍实时速度!开源离线TTS系统,隐私安全与极速合成兼得
下一篇 腾讯HunyuanVideo 1.5开源:8.3B参数模型,14G显存流畅生成高清视频
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

字节跳动Seeduplex全双工语音模型上线:边听边说、误打断率降50%,豆包App亿级用户体验实时AI对话

站外新闻
AI语音交互 全双工语音模型 大模型 字节跳动 豆包App
AI 工具AIGC 资讯

4秒生成百万面!Hyper3D Rodin Gen-2.5发布全球首个千万面级3D生成AI模型

站外新闻
3D生成AI AIGC Hyper3D Rodin Gen-2.5 SIGGRAPH 2025
AI 工具AIGC 资讯

清华字节联手开源HuMo:多模态视频生成框架,一键定制虚拟人物

站外新闻
AIGC HuMo 多模态视频生成 字节跳动 视频生成模型
AI 工具AIGC 资讯

破解AI记忆三周魔咒!腾讯混元Hy-Memory发布:记忆密度提升45%、Token消耗降低35%,定义Agent长期协作新范式

站外新闻
AI Agent Hy-Memory 智能插件 腾讯混元 长期记忆
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.