Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型
AIGC 资讯

Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型

站外新闻
最近更新: 2026年7月15日 下午6:14
SHARE

Xiaomi-Robotics-U0是什么

Xiaomi-Robotics-U0 是小米推出的 380 亿参数统一具身合成模型,基于世界基础模型持续训练,联合优化文生图、图像编辑、具身场景生成、具身迁移及具身视频生成五大任务。Xiaomi-Robotics-U0 是首个支持跨多种机器人形态的高质量多视角场景生成模型,在具身场景生成与迁移的人工评估中超越 GPT-Image-2.0,在 World Arena 具身视频生成榜单排名第一,将 π0.5 在真实世界操控任务的分布外成功率从 36.9% 提升至 63.2%。

阅读目录
  • Xiaomi-Robotics-U0是什么
  • Xiaomi-Robotics-U0的主要功能
  • Xiaomi-Robotics-U0的技术原理
  • 如何使用Xiaomi-Robotics-U0
  • Xiaomi-Robotics-U0的核心优势
  • Xiaomi-Robotics-U0的项目地址
  • Xiaomi-Robotics-U0的同类竞品对比
  • Xiaomi-Robotics-U0的应用场景

Xiaomi-Robotics-U0

Xiaomi-Robotics-U0的主要功能

  • 文生图生成:支持高质量文本到图像合成,保留基础世界模型的视觉知识。
  • 图像编辑:支持 Any-to-Image 编辑,包括相机控制、时间控制、结构提取等细粒度操作。
  • 具身场景生成:根据机器人形态和场景描述,生成多视角一致的初始观察画面。
  • 具身迁移:在保持多视角一致性和交互动态的前提下,实现跨场景的结构化可控迁移。
  • 具身视频生成:支持零样本多视角具身视频生成,将静态场景合成为时序连贯的操作视频。

Xiaomi-Robotics-U0的技术原理

  • 统一自回归框架:基于 EMU3.5初始化,采用 IBQ Tokenizer 进行 16×16 空间压缩,所有模态统一为离散词表进行 next-token 预测。
  • 联合持续训练:在通用域和具身数据集上统一自回归目标进行持续训练,避免用有限机器人数据导致的泛化能力损失。
  • FlashAR+ 推理加速:引入反对角线并行解码的垂直预测头,结合 vLLM 优化,1024×1024 分辨率图像生成速度提升 82.9 倍。
  • 结构化控制分解:将场景解耦为工作空间、任务对象、无关对象、光照、背景五个独立控制维度,支持可扩展的具身视频增强。
  • 子任务-子目标交错学习:通过 HDBSCAN 聚类对机器人轨迹进行子任务分解,生成交错的图像-文本序列,捕捉长程任务进展和细粒度交互动态。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Xiaomi-Robotics-U0

  • 环境配置:访问小米机器人官网下载模型权重与推理代码,配置支持 CUDA 和 vLLM 的高性能 GPU 环境。
  • 模型加载:基于 EMU3.5 架构初始化并加载 Xiaomi-Robotics-U0 的 380 亿参数检查点,统一调用 IBQ Tokenizer 处理多模态输入序列。
  • 文生图生成:输入文本描述,通过标准自回归 next-token 预测直接生成 1024×1024 分辨率的高质量图像。
  • 图像编辑:提供一至三张参考图像配合文本指令,模型基于 Any-to-Image 能力执行相机控制、时间控制或结构提取等细粒度编辑。
  • 具身场景生成:输入机器人形态描述与结构化场景文本,模型输出严格满足多视角一致性和几何连贯性的初始观察画面。
  • 具身迁移:给定当前多视角观察与目标场景描述,模型在保持交互动态的前提下生成迁移后的多视角 RGB 图像。
  • 具身视频生成:提供初始观察帧与任务指令,模型通过自回归展开生成 15 至 25 帧时序连贯的机器人操作视频。
  • 推理加速:启用 FlashAR+ 垂直预测头与 vLLM 优化,实现 1024×1024 分辨率下图像生成速度提升 82.9 倍。
  • 数据引擎应用:将生成的具身场景或视频序列直接输入下游机器人策略网络,用于提升真实世界操控任务的分布外泛化能力。

Xiaomi-Robotics-U0的核心优势

  • 统一性:首个将基础图像/视频生成与具身生成统一在单一框架内的模型,避免后训练导致的视觉知识遗忘。
  • 多视角一致性:支持跨多种机器人形态的高质量多视角场景生成,严格满足几何连贯性和相机标定约束。
  • 可控迁移:引入结构化控制机制,可在保持交互动态的前提下对工作空间、背景、光照等维度进行细粒度编辑。
  • 数据引擎能力:生成的具身场景可直接展开为时序连贯的操作视频,为下游策略学习提供可扩展的合成轨迹。
  • SOTA 性能:在具身场景生成与迁移上超越 GPT-Image-2.0,在 World Arena 具身视频生成排名第一。

Xiaomi-Robotics-U0的项目地址

  • 项目官网:https://robotics.xiaomi.com/xiaomi-robotics-u0.html
  • HuggingFace模型库:https://huggingface.co/collections/XiaomiRobotics/xiaomi-robotics-u0
  • arXiv技术论文:https://arxiv.org/pdf/2607.11643

Xiaomi-Robotics-U0的同类竞品对比

维度 Xiaomi-Robotics-U0 π0.5
定位 统一具身合成世界模型,专注生成可控数据与场景 端到端视觉-语言-动作策略模型,专注直接控制机器人
参数规模 380 亿参数自回归 Transformer 采用 VLM 主干 + Action Expert 分层架构
核心能力 多视角场景生成、具身迁移、视频生成、图像编辑 端到端机器人控制、家庭泛化任务执行
架构 基于 EMU3.5 初始化,统一 next-token 预测 预训练离散动作 token,后训练流匹配生成连续动作
数据引擎 可直接生成具身场景与视频,将 π0.5 分布外成功率从 36.9% 提升至 63.2% 本身不具备数据生成能力,依赖真实世界采集
多视角一致性 原生支持跨多种机器人形态的多视角场景生成与几何连贯迁移 作为单视角策略模型,不直接处理多视角合成
视觉知识保留 联合训练通用生成与具身任务,VLM 基准保持高分(ERQA 40.8、SEED 78.6) VLM 基准得分较低(ERQA 0.0、SEED 21.5),视觉理解受损

Xiaomi-Robotics-U0的应用场景

  • 机器人数据合成:为真实机器人训练生成大规模、多样化的合成操作轨迹,解决真实数据收集成本高、场景受限的问题。
  • 跨形态场景迁移:将同一操作任务从一种机器人形态(如单臂)迁移到另一种形态(如双臂),保持场景一致性。
  • 仿真环境构建:快速生成高质量多视角机器人操作场景,用于仿真平台训练和策略验证。
  • 操作策略增强:利用生成的分布外数据提升机器人策略的泛化能力,如将 π0.5 的成功率提升 26.3%。
  • 具身智能研究:作为世界基础模型,支持长程任务规划、子任务分解和交互动态预测等基础研究。
​ 蚂蚁集团周俊:万亿参数模型从“追求数量”迈向“深耕密度”
GLM-Z1-32B – 智谱开源的新一代推理模型
SoulChat2.0 – 华南理工大学推出的心理咨询师数字孪生大语言模型
Prompt Manager(PromptX):开源AI提示词管理神器,智能分类+版本控制,解锁AIGC工作流效率革命
发布仅三天就踩下刹车:Kimi K3 用户请求爆表,月之暗面算力顶到天花板
分享
Email 复制链接 打印
Share
上一篇 努比亚率先完成智能体大模型备案,全球首款AI智能体手机即亮相
下一篇 MoneyPrinterTurbo – 开源的AI短视频生成工具
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

英伟达发布NitroGen:斯坦福联合打造开源通用游戏AI模型,泛化能力飙升52%

站外新闻
NitroGen 开源模型 斯坦福大学 游戏AI 英伟达
AI 工具AIGC 资讯

UniWorld V2发布:北大兔展智能联合推出强化学习驱动图像编辑模型,精准中文渲染与空间控制领先行业

站外新闻
UniWorld V2 中文字体渲染 图像编辑模型 多模态大语言模型 强化学习
全息流体渐变通用占位特色图
AIGC 资讯

​Kimi K3 权重正式落地:全球首个 3 万亿开源模型,颠覆的不只是技术排位

站外新闻
AIGC 资讯

打破终端壁垒!支付宝 AI 开放平台上线,“阿宝”一键连接手机车机

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.