Cosmos 3 Edge是什么
Cosmos 3 Edge 是 NVIDIA 推出的 4B 参数开源世界模型,专为机器人和边缘 AI 实时推理设计。模型基于 Nemotron 架构,融合自回归与扩散双 Transformer 塔,共享多模态注意力层,可在 Jetson Thor、RTX GPU 及 DGX 等设备上本地运行,实现 15 Hz 实时控制。开发者可在约一天内将模型适配至特定机器人或环境,无需依赖云端即可感知、推理并生成动作策略。
阅读目录

Cosmos 3 Edge的主要功能
-
世界状态理解:通过自回归塔处理视觉与文本 token,实时解析边缘环境中的物体、空间关系与场景语义,为后续推理提供共享世界表征。
-
未来状态预测:基于扩散塔对视觉、音频与动作 token 进行去噪生成,模拟执行某动作后的视觉结果。
-
动作策略生成:将机械臂、车辆、摄像头等不同具身形态统一编码为平移、旋转与操作状态的紧凑几何向量,每次推理生成 32 个连续动作,用 15 Hz 频率输出控制指令。
-
端侧实时推理:在 Jetson Thor、RTX PRO、Jetson T2000/T3000 等内存受限设备上实现内存高效的高吞吐量推理,无需云端即可闭环运行。
-
快速领域适配:提供完整后训练脚本与 DROID 数据集策略检查点,开发者可在约一天内将基础模型微调至特定机器人或环境。
Cosmos 3 Edge的技术原理
- 双塔共享架构:模型由自回归塔与扩散塔组成。自回归塔采用因果注意力处理视觉和文本 token,用于场景理解与推理;扩散塔采用双向注意力处理视觉、音频和动作 token,用于预测、生成与神经模拟。两塔各自拥有独立的 LayerNorm 与 MLP,共享多模态注意力层,将语言、视频、音频和动作信息对齐到统一表征空间。
- 通用动作表征:将不同物理系统的动作映射为紧凑的几何向量,统一编码平移、旋转与操作状态,建立像素变化与物理运动、空间关系及控制输入之间的直接联系。
- 世界动作模型(WAM):作为策略使用时,模型接收当前观测状态,同时输出应执行的动作及其预期视觉结果,将世界建模与机器人策略训练直接关联。动作在模型中可双向流动:能预测某动作的效果,从效果反推动作。
- 边缘优化推理:基于 Nemotron 架构的 4B 参数紧凑设计,结合 4 步知识蒸馏与 vLLM 优化框架,在保持输出质量的同时实现高达 25 倍推理加速,适配 Jetson 系列等边缘计算平台的内存与算力约束。

微信关注回复“开源”,加入AI开源项目交流群
如何使用Cosmos 3 Edge
- 环境准备:安装 NVIDIA Container Toolkit 并拉取官方 Docker 镜像,或配置 Conda 环境安装 PyTorch、Diffusers、Transformers 等依赖。
- 下载模型:从 Hugging Face 下载
nvidia/Cosmos3-Edge权重,同时获取后训练脚本与 DROID 数据集策略检查点。 - 后训练微调:用小型 H100 集群或 DGX Station,基于开源 Cosmos Framework 对特定机器人、传感器或环境进行约一天的适配微调。
- 部署推理:将微调后的模型部署至 Jetson T2000/T3000、RTX PRO 或 DGX 等边缘设备,通过 vLLM 或 NIM 微服务实现 15 Hz 实时动作生成。
Cosmos 3 Edge的核心优势
- 端侧实时推理:40 亿参数轻量化设计,在 Jetson Thor 上实现 15 Hz 实时控制,消除云端延迟。
- 快速适配:开发者可在约一天内将基础模型微调至特定机器人或环境,大幅降低部署周期。
- 统一多模态架构:自回归塔与扩散塔共享注意力层,统一处理语言、视频、音频与动作,实现”理解→模拟→行动”闭环。
- 开放生态:模型权重、训练脚本、后训练方案及 4 步知识蒸馏检查点全部开源,支持 Hugging Face Diffusers 与 vLLM 部署。
- 基准领先:在同规模(4B)模型中,VANTAGE-Bench 视觉分析排名第一,机器人策略学习达业界领先水平。
Cosmos 3 Edge的项目对比
- 项目官网:https://huggingface.co/blog/nvidia/cosmos3edge
- HuggingFace模型库:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos 3 Edge的同类竞品对比
| 维度 | Cosmos 3 Edge | SmolVLA |
|---|---|---|
| 发布方 | NVIDIA | HuggingFace / 社区 |
| 参数规模 | 4B | 450M |
| 架构类型 | 世界动作模型(WAM)双塔架构 | 视觉-语言-动作(VLA)模型 |
| 核心机制 | 自回归塔+扩散塔共享注意力,统一世界理解与动作生成 | SigLIP+DinoV2 双视觉编码器,分块动作预测 |
| 开源程度 | 完全开源(权重+训练脚本+后训练方案) | 完全开源(权重+代码+评估脚本) |
| 边缘部署 | Jetson Thor / RTX PRO / T2000 / T3000,15 Hz 实时控制 | 单张 RTX 4090,15–30 Hz 推理 |
| 微调成本 | 小型 H100 集群或 DGX Station,约一天 | 单张 A100 或消费级 GPU,数小时 |
| 动作输出 | 每次推理生成 32 个动作,通用几何向量表征 | 每次预测 50 步动作块,减少 50 倍计算调用 |
| 世界建模 | 内置世界模型,可预测动作的视觉结果 | 无内置世界模型,直接从观测映射到动作 |
| 适用场景 | 需因果推理与模拟的复杂操作、动态环境 | 结构化环境下的快速反应式抓取与放置 |
Cosmos 3 Edge的应用场景
-
工业机械臂控制:在工厂产线上实时感知工件位置,生成抓取与装配动作,无需云端往返。
-
仓储物流机器人:自主导航仓库通道,实时避障并规划最优拣货路径,支持 15 Hz 动态决策。
-
自动驾驶边缘感知:在车载 Jetson 平台上实时推理路况,预测他车轨迹并生成自车控制策略。
-
医疗辅助机器人:在医院环境中理解场景变化,实时调整机械臂动作以辅助手术或护理。
-
农业自动化:在田间边缘设备上实时识别作物状态,生成采摘或喷洒动作,适应户外弱网环境。
