Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: VLN-R1:港大联合上海AI Lab发布具身智能框架,用视觉语言模型实现3D连续导航
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AI 工具 > VLN-R1:港大联合上海AI Lab发布具身智能框架,用视觉语言模型实现3D连续导航
AI 工具AIGC 资讯

VLN-R1:港大联合上海AI Lab发布具身智能框架,用视觉语言模型实现3D连续导航

站外新闻
最近更新: 2026年6月7日 下午8:25
VLN-R1 具身智能 强化微调 港大上海AI Lab 视觉语言模型
SHARE

💡 站外导读:当前具身智能领域面临核心瓶颈:如何让机器人真正理解自然语言指令并在复杂3D环境中连续自主导航?传统方案依赖离散节点图或专用模块堆叠,泛化能力差、数据需求高。港大与上海AI Lab联合推出的VLN-R1框架,首次用大型视觉语言模型直接将第一人称视频流转为连续动作序列,配合长短期记忆采样和两阶段训练策略,在数据有限条件下显著提升导航性能,为家庭服务、工业自动化等场景落地提供新范式。

VLN-R1是什么

VLN-R1是香港大学和上海人工智能实验室联合推出的全新具身智能框架,基于大型视觉语言模型(LVLM)直接将第一人称视频流转换为连续的导航动作。框架基于Habitat 3D模拟器构建VLN-Ego数据集,用长短期记忆采样策略平衡历史和当前观测。框架训练分为两阶段,监督微调(SFT)让模型动作序列文本预测与专家演示对齐,强化微调(RFT)基于时间衰减奖励(TDR)机制优化多步未来动作。VLN-R1在VLN-CE基准测试中表现强劲,证明LVLM在具身导航中的有效性,提升任务特定推理能力,且数据效率高。

阅读目录
  • VLN-R1是什么
  • VLN-R1的主要功能
  • VLN-R1的技术原理
  • VLN-R1的项目地址
  • VLN-R1的应用场景
      • 📝 站长洞察 (Editor’s Insight)

VLN-R1

VLN-R1的主要功能

  • 连续环境导航:直接处理第一人称视频流,让智能体在连续的3D环境中自由移动,不仅仅局限于预定义的节点。
  • 动作生成:生成四种基本动作命令(FORWARD、TURN-LEFT、TURN-RIGHT、STOP),实现精确的导航控制。
  • 数据高效训练:基于监督微调(SFT)和强化微调(RFT),用有限的数据实现高效的模型训练,提升导航性能。
  • 跨领域适应:基于强化微调(RFT),模型能快速适应新的导航任务和环境,即使只有少量数据。
  • 任务特定推理:基于时间衰减奖励(TDR)机制,优化多步未来动作的预测,增强长期导航性能。

VLN-R1的技术原理

  • 数据集构建:VLN-Ego数据集基于Habitat 3D模拟器生成,包含第一人称视频流和对应的未来动作预测,为模型训练提供丰富的数据。
  • 长短期记忆采样:在处理视频输入时,用长短期记忆采样策略,动态平衡历史帧的重要性与实时输入的敏感性,确保模型在导航过程中既考虑短期相关性,又不丢失长期上下文信息。
  • 监督微调(SFT):基于最小化模型预测文本与专家演示文本之间的交叉熵损失,让模型的动作序列预测与真实动作对齐,确保模型能准确理解语言指令生成相应的动作。
  • 强化微调(RFT):基于组相对策略优化(GRPO)的强化学习方法,用时间衰减奖励(TDR)机制评估和优化多步未来动作的预测,增强模型在长期导航任务中的性能。
  • 大型视觉语言模型(LVLM):基于先进的LVLM(如Qwen2-VL)处理视觉和语言输入,实现从第一人称视频流到导航动作的直接映射,提升模型的泛化能力和适应性。

VLN-R1的项目地址

  • 项目官网:https://vlnr1.github.io/
  • GitHub仓库:https://github.com/Qi-Zhangyang/GPT4Scene-and-VLN-R1
  • arXiv技术论文:https://arxiv.org/pdf/2506.17221

VLN-R1的应用场景

  • 家庭服务机器人:让家庭服务机器人根据主人的自然语言指令在家中自由导航,完成打扫卫生、取物等任务,提升生活便利性。
  • 工业自动化:在工厂车间助力机器人按操作员指令灵活导航,完成物料搬运和设备维护,提高生产效率。
  • 智能仓储:让仓库机器人依据指令在货架间精准导航,高效完成货物存储与检索,优化仓储管理。
  • 医疗保健:支持医院或养老院机器人按医护人员或患者指令导航,完成送药、送餐等任务,减轻医护负担。
  • 智能交通:帮助自动驾驶车辆在复杂城市环境中按交通信号和指令导航,增强行驶安全性和灵活性。

📝 站长洞察 (Editor’s Insight)

具身智能正从实验室走向产业深水区,VLN-R1的发布标志着一个关键拐点:视觉语言大模型不再只是“看图说话”,而是成为机器人在物理世界行动的“大脑”。其核心创新在于用SFT对齐专家演示、用RFT强化长期决策,配合时间衰减奖励机制,让模型既学得快又记得远。更值得关注的是,项目已开源代码与数据集,这将大幅降低研究与产业门槛。从趋势看,具身智能的竞争焦点正从“感知精度”转向“决策智能”,谁能让大模型在真实环境中高效行动,谁就握住了下一代AI落地的钥匙。VLN-R1为这条赛道提供了极具参考价值的技术路线。

开源神器opcode:为Claude Code量身打造的AI开发图形界面工具,可视化管理项目、智能Agent与API成本
CodeFormer – AI照片修复工具,轻松去除图片和视频马赛克
谷歌AI搜索频现拼写错误引用户流失,DuckDuckGo下载量飙升:AI准确性危机何解?
微软测试月之暗面 Kimi K3,或将引入 Copilot 与 Azure 平台
开源本地AI笔记工具Tolaria深度评测:Notion+Obsidian的终极融合体,数据主权+Git版本控制+MCP协议,重塑AI时代知识管理
TAGGED:VLN-R1具身智能强化微调港大上海AI Lab视觉语言模型
分享
Email 复制链接 打印
Share
上一篇 Nanonets-OCR-s:终极文档OCR模型,支持LaTeX、签名、表格等复杂元素识别与Markdown转换
下一篇 Twocast:AI双人播客自动生成器,一键产出专业级多人对话播客
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

腾讯Hunyuan-GameCraft:实时交互式游戏视频生成框架,键盘鼠标精准控制,支持百万级AAA游戏场景

站外新闻
交互式AI 实时推理 模型蒸馏 游戏视频生成 腾讯混元
量子芯片科技感占位特色图
AI 工具AIGC 资讯最新趋势

AI赋能“一人公司”革命:漳州“单人成军”模式如何颠覆数字贸易创业?

站外新闻
AI+OPC 一人公司 数字贸易 超级个体
AIGC 资讯

Unbounded – 谷歌推出的首款AI生成式无限人生模拟游戏

站外新闻
AIGC 资讯

Symphony Creative Studio – TikTok推出的AI广告创意视频生成工具

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.