Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Cosmos 3 Edge – 英伟达开源的 4B 参数世界模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Cosmos 3 Edge – 英伟达开源的 4B 参数世界模型
AIGC 资讯

Cosmos 3 Edge – 英伟达开源的 4B 参数世界模型

站外新闻
最近更新: 2026年7月24日 下午7:57
SHARE

Cosmos 3 Edge是什么

Cosmos 3 Edge 是 NVIDIA 推出的 4B 参数开源世界模型,专为机器人和边缘 AI 实时推理设计。模型基于 Nemotron 架构,融合自回归与扩散双 Transformer 塔,共享多模态注意力层,可在 Jetson Thor、RTX GPU 及 DGX 等设备上本地运行,实现 15 Hz 实时控制。开发者可在约一天内将模型适配至特定机器人或环境,无需依赖云端即可感知、推理并生成动作策略。

阅读目录
  • Cosmos 3 Edge是什么
  • Cosmos 3 Edge的主要功能
  • Cosmos 3 Edge的技术原理
  • 如何使用Cosmos 3 Edge
  • Cosmos 3 Edge的核心优势
  • Cosmos 3 Edge的项目对比
  • Cosmos 3 Edge的同类竞品对比
  • Cosmos 3 Edge的应用场景

Cosmos 3 Edge

Cosmos 3 Edge的主要功能

  • 世界状态理解:通过自回归塔处理视觉与文本 token,实时解析边缘环境中的物体、空间关系与场景语义,为后续推理提供共享世界表征。
  • 未来状态预测:基于扩散塔对视觉、音频与动作 token 进行去噪生成,模拟执行某动作后的视觉结果。
  • 动作策略生成:将机械臂、车辆、摄像头等不同具身形态统一编码为平移、旋转与操作状态的紧凑几何向量,每次推理生成 32 个连续动作,用 15 Hz 频率输出控制指令。
  • 端侧实时推理:在 Jetson Thor、RTX PRO、Jetson T2000/T3000 等内存受限设备上实现内存高效的高吞吐量推理,无需云端即可闭环运行。
  • 快速领域适配:提供完整后训练脚本与 DROID 数据集策略检查点,开发者可在约一天内将基础模型微调至特定机器人或环境。

Cosmos 3 Edge的技术原理

  • 双塔共享架构:模型由自回归塔与扩散塔组成。自回归塔采用因果注意力处理视觉和文本 token,用于场景理解与推理;扩散塔采用双向注意力处理视觉、音频和动作 token,用于预测、生成与神经模拟。两塔各自拥有独立的 LayerNorm 与 MLP,共享多模态注意力层,将语言、视频、音频和动作信息对齐到统一表征空间。
  • 通用动作表征:将不同物理系统的动作映射为紧凑的几何向量,统一编码平移、旋转与操作状态,建立像素变化与物理运动、空间关系及控制输入之间的直接联系。
  • 世界动作模型(WAM):作为策略使用时,模型接收当前观测状态,同时输出应执行的动作及其预期视觉结果,将世界建模与机器人策略训练直接关联。动作在模型中可双向流动:能预测某动作的效果,从效果反推动作。
  • 边缘优化推理:基于 Nemotron 架构的 4B 参数紧凑设计,结合 4 步知识蒸馏与 vLLM 优化框架,在保持输出质量的同时实现高达 25 倍推理加速,适配 Jetson 系列等边缘计算平台的内存与算力约束。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用Cosmos 3 Edge

  • 环境准备:安装 NVIDIA Container Toolkit 并拉取官方 Docker 镜像,或配置 Conda 环境安装 PyTorch、Diffusers、Transformers 等依赖。
  • 下载模型:从 Hugging Face 下载 nvidia/Cosmos3-Edge 权重,同时获取后训练脚本与 DROID 数据集策略检查点。
  • 后训练微调:用小型 H100 集群或 DGX Station,基于开源 Cosmos Framework 对特定机器人、传感器或环境进行约一天的适配微调。
  • 部署推理:将微调后的模型部署至 Jetson T2000/T3000、RTX PRO 或 DGX 等边缘设备,通过 vLLM 或 NIM 微服务实现 15 Hz 实时动作生成。

Cosmos 3 Edge的核心优势

  • 端侧实时推理:40 亿参数轻量化设计,在 Jetson Thor 上实现 15 Hz 实时控制,消除云端延迟。
  • 快速适配:开发者可在约一天内将基础模型微调至特定机器人或环境,大幅降低部署周期。
  • 统一多模态架构:自回归塔与扩散塔共享注意力层,统一处理语言、视频、音频与动作,实现”理解→模拟→行动”闭环。
  • 开放生态:模型权重、训练脚本、后训练方案及 4 步知识蒸馏检查点全部开源,支持 Hugging Face Diffusers 与 vLLM 部署。
  • 基准领先:在同规模(4B)模型中,VANTAGE-Bench 视觉分析排名第一,机器人策略学习达业界领先水平。

Cosmos 3 Edge的项目对比

  • 项目官网:https://huggingface.co/blog/nvidia/cosmos3edge
  • HuggingFace模型库:https://huggingface.co/nvidia/Cosmos3-Edge

Cosmos 3 Edge的同类竞品对比

维度 Cosmos 3 Edge SmolVLA
发布方 NVIDIA HuggingFace / 社区
参数规模 4B 450M
架构类型 世界动作模型(WAM)双塔架构 视觉-语言-动作(VLA)模型
核心机制 自回归塔+扩散塔共享注意力,统一世界理解与动作生成 SigLIP+DinoV2 双视觉编码器,分块动作预测
开源程度 完全开源(权重+训练脚本+后训练方案) 完全开源(权重+代码+评估脚本)
边缘部署 Jetson Thor / RTX PRO / T2000 / T3000,15 Hz 实时控制 单张 RTX 4090,15–30 Hz 推理
微调成本 小型 H100 集群或 DGX Station,约一天 单张 A100 或消费级 GPU,数小时
动作输出 每次推理生成 32 个动作,通用几何向量表征 每次预测 50 步动作块,减少 50 倍计算调用
世界建模 内置世界模型,可预测动作的视觉结果 无内置世界模型,直接从观测映射到动作
适用场景 需因果推理与模拟的复杂操作、动态环境 结构化环境下的快速反应式抓取与放置

Cosmos 3 Edge的应用场景

  • 工业机械臂控制:在工厂产线上实时感知工件位置,生成抓取与装配动作,无需云端往返。
  • 仓储物流机器人:自主导航仓库通道,实时避障并规划最优拣货路径,支持 15 Hz 动态决策。
  • 自动驾驶边缘感知:在车载 Jetson 平台上实时推理路况,预测他车轨迹并生成自车控制策略。
  • 医疗辅助机器人:在医院环境中理解场景变化,实时调整机械臂动作以辅助手术或护理。
  • 农业自动化:在田间边缘设备上实时识别作物状态,生成采摘或喷洒动作,适应户外弱网环境。
Cursor发布Composer 2.5:自研Agentic编程模型,性能比肩Opus 4.7、成本仅1/10
Meta超级智能实验室首发图像模型Muse Image:对话即可生成,Instagram和WhatsApp免费用
Dify – 开源的生成式AI应用开发平台
OpenMontage: 全球首个开源Agentic视频制作系统,12条生产线+52工具,零成本AI全流程自动成片
豆包1.5·UI-TARS – 字节豆包推出的 GUI Agent 模型
分享
Email 复制链接 打印
Share
上一篇 BigMac – 小红书开源的多模态大模型流水并行训练框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

BigMac – 小红书开源的多模态大模型流水并行训练框架
AIGC 资讯
Kimi K3 攻防考卷翻车:漏洞利用只到美国前沿模型四成,蒸馏疑云被安全机构摆上台
AIGC 资讯
全息流体渐变通用占位特色图
红果短剧发布AI角色规范,专项整治“高频AI脸”与素材侵权
AIGC 资讯
黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance
AIGC 资讯

相关推荐

AIGC 资讯

xGen-MM – Salesforce推出的开源多模态AI模型

站外新闻
AI 工具AIGC 资讯

阿里通义开源 Wan2.2-S2V:一张图+一段音频,分钟级生成电影级数字人视频的多模态大模型

站外新闻
AIGC 多模态模型 数字人 视频生成 通义万相
AIGC 资讯

Grok-2 – xAI公司推出的新一代AI模型

站外新闻
AI 工具AIGC 资讯

Mini-o3开源:字节+港大联手,视觉推理模型实现数十轮深度交互

站外新闻
多轮交互 字节跳动 开源模型 强化学习 视觉推理模型
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.