Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: EMMA – Waymo推出的端到端自动驾驶多模态模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > EMMA – Waymo推出的端到端自动驾驶多模态模型
AIGC 资讯

EMMA – Waymo推出的端到端自动驾驶多模态模型

站外新闻
最近更新: 2026年7月17日 上午7:48
SHARE

EMMA是什么

EMMA是Waymo基于Gemini模型推出的端到端自动驾驶多模态模型,能将原始相机传感器数据直接映射到驾驶特定输出,如规划轨迹、感知对象和道路图元素。EMMA将非传感器输入和输出表示为自然语言文本,用预训练大型语言模型的世界知识,在统一的语言空间中联合处理多种驾驶任务。EMMA在nuScenes运动规划和Waymo开放数据集上展现了先进性能,但存在局限性,如处理图像帧数量有限、缺少精确3D传感方式集成和高计算成本。模型能推动自动驾驶模型架构的发展,提高自动驾驶系统在复杂场景中的泛化和推理能力。

阅读目录
  • EMMA是什么
  • EMMA的主要功能
  • EMMA的技术原理
  • EMMA的项目地址
  • EMMA的应用场景

EMMA

EMMA的主要功能

  • 端到端运动规划:
    • 直接从原始相机传感器数据生成自动驾驶车辆的未来轨迹。
    • 将轨迹转化为车辆特定的控制动作,如加速和转向。
  • 3D对象检测:用摄像头为主要传感器,检测和识别周围的物体,如车辆、行人和骑行者。
  • 道路图元素识别:识别和构建道路图,包括车道线、交通标志等关键道路元素。
  • 场景理解:理解整个场景的上下文,包括临时道路阻塞和其他影响驾驶的情况。
  • 多任务处理:在统一的语言空间中联合处理多种驾驶任务,用任务特定的提示生成输出。
  • 链式思维推理:基于链式思维推理提升模型的决策能力和可解释性,让模型在预测未来轨迹时能阐述其决策理由。

EMMA的技术原理

  • 多模态大型语言模型(MLLMs):基于预训练的MLLMs,如Gemini,模型在广泛的互联网规模数据上训练,拥有丰富的“世界知识”。
  • 自然语言表示:所有非传感器输入和输出(如导航指令、车辆状态、轨迹和3D位置)表示为自然语言文本。
  • 视觉问题回答(VQA):将驾驶任务重新构想为VQA问题,基于Gemini的预训练能力,保留广泛的世界知识。
  • 自回归模型:用自回归Gemini模型处理交错的文本和视觉输入,生成文本输出。
  • 端到端训练:基于端到端训练,直接从传感器数据生成驾驶动作,消除模块间符号化接口的需求。

EMMA的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2410.23262

EMMA的应用场景

  • 城市和郊区驾驶:EMMA能处理复杂的城市交通环境及郊区道路条件,提供实时的驾驶决策和轨迹规划。
  • 交通拥堵和复杂路口:在交通拥堵或多路口场景中,EMMA能进行有效的路径规划和决策,确保安全高效的导航。
  • 特殊天气和光照条件:EMMA能适应不同的天气和光照条件,如雨、雾或夜间驾驶,保持稳定的驾驶性能。
  • 施工区域和临时道路封闭:基于场景理解能力,EMMA能识别施工区域和临时道路封闭情况,做出相应的驾驶调整。
  • 紧急情况响应:在遇到紧急情况,如突然出现的障碍物或动物时,EMMA能迅速做出反应,采取避让或减速等措施。
NVIDIA发布OmniVinci:全模态大模型实现音视频精准同步,性能碾压Qwen2.5仅需0.2T tokens
阶跃星辰StepAudio 2.5 Realtime重磅发布:端到端实时语音大模型,实现真人级对话、千万人设自定义与行业评测全面领先
3DV-TON – 阿里达摩院联合浙大等推出的视频虚拟试穿框架
AI生成内容反超人类:互联网‘信息污染’时代,你的思维能力正在被悄悄吞噬?
DreamOmni – 港中文、字节等机构共同推出的统一图像生成和编辑模型
分享
Email 复制链接 打印
Share
上一篇 DreamVideo-2 – 复旦和阿里联合多机构推出的零样本视频定制生成框架
下一篇 TimeSuite – 上海AI Lab推出的提升MLLMs在长视频理解处理的设计框架
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AI 工具AIGC 资讯

清华IDEA联合突破:HRAvatar单目视频秒级生成可重光照3D头像,实时渲染达155FPS

站外新闻
3D数字人 AIGC 单目视频重建 可重光照头像 实时渲染
AIGC 资讯

日日新SenseNova V6 – 商汤推出的多模态融合模型系列

站外新闻
AIGC 资讯

AlphaGeometry2 – 谷歌 DeepMind 推出解决复杂几何问题的AI系统

站外新闻
AIGC 资讯

Similarweb报告:谷歌AI概览出现率一年升至43%,AI搜索成为主流入口

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.