Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MM1.5 – 苹果推出的升级版多模态大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MM1.5 – 苹果推出的升级版多模态大模型
AIGC 资讯

MM1.5 – 苹果推出的升级版多模态大模型

站外新闻
最近更新: 2026年7月9日 上午7:05
SHARE

MM1.5是什么

MM1.5是苹果公司推出的多模态大型语言模型,旨在增强文本丰富图像理解、视觉指代和定位以及多图像推理能力。模型基于数据为中心的训练方法,在大规模预训练、高分辨率OCR数据持续预训练及优化的视觉指令微调,实现从1B到30B参数规模的高性能。MM1.5包括密集型和MoE变体,展现小规模模型通过精细数据策划和训练策略达到强大性能。MM1.5推出针对视频理解和移动UI理解优化的专门变体MM1.5-Video和MM1.5-UI,基于实证研究提供训练过程和决策的深入见解,为多模态AI技术的未来发展提供指导。

阅读目录
  • MM1.5是什么
  • MM1.5的主要功能
  • MM1.5的技术原理
  • MM1.5的项目地址
  • MM1.5的应用场景

MM1.5

MM1.5的主要功能

  • 文本丰富的图像理解:MM1.5能理解图像中的文本内容以及文本与图像内容之间的关系。
  • 视觉指代和定位:模型识别图像中的特定对象,理解文本中对对象的引用,如“那个红色的球”。
  • 多图像推理:MM1.5能分析多张图像,理解图像之间的联系,进行逻辑推理。
  • 视频理解:基于MM1.5-Video变体,模型能理解视频内容,包括动作、事件和时间序列。
  • 移动UI理解:MM1.5-UI变体专门针对移动应用界面的理解,识别和操作界面元素。

MM1.5的技术原理

  • 深度学习和自然语言处理:结合深度学习的视觉模型和自然语言处理技术,模型能理解和生成与图像内容相关的文本。
  • 坐标token和视觉注意力机制:用坐标token定位图像中的对象,基于视觉注意力机制关注图像的特定区域。
  • 图像分割和多模态融合:将图像分割成多个部分,与文本信息融合,支持多图像推理。
  • 视频帧采样和时序分析:对视频帧进行采样,分析帧之间的时序关系,理解视频内容。
  • 界面元素识别:用图像识别技术识别移动界面上的元素,如按钮和图标。

MM1.5的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2409.20566v1

MM1.5的应用场景

  • 图像和视频理解:MM1.5能理解和分析图像及视频内容,应用于图像标注、视频内容分析、安防监控等领域。
  • 视觉搜索:在电子商务或数字图书馆中,MM1.5帮助用户基于描述或查询图像来搜索特定的产品或文档。
  • 辅助驾驶和自动驾驶:在汽车行业,MM1.5用在理解和分析道路情况,辅助驾驶决策。
  • 智能助手:在智能手机和智能家居设备中,MM1.5提供更自然、直观的交互方式,理解用户的语音或文本指令。
  • 教育和培训:MM1.5作为教育工具,帮助学生理解复杂的概念,提供个性化的学习体验。
小米MiMo-V2-TTS重磅发布:上亿小时数据训练,Agent时代的语音合成革命
阿里Qwen3.6-Plus发布:百万上下文+超低参数量,编码智能体性能直逼Claude 4.5 Opus
NMT – 阿里联合 UC Berkeley 推出的多任务学习框架
上海AI实验室重磅开源VLAC:具身智能奖励大模型,让机器人在真实世界实现自主学习与快速适应
ArenaRL:通义&高德开源对比式强化学习,破解开放域AI智能体判别崩溃难题
分享
Email 复制链接 打印
Share
上一篇 RegionDrag – 港大和牛津联合开发的基于区域的图像编辑技术
下一篇 VFusion3D – Meta联合牛津大学推出的AI生成3D模型项目
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

Migician – 北交大联合清华、华中科大推出的多模态视觉定位模型

站外新闻
AI 工具AIGC 资讯

Mistral AI发布Magistral推理模型:开源与企业版双线出击,透明推理引领多语言AI新范式

站外新闻
Mistral AI 多语言AI 推理模型 透明推理
AIGC 资讯

xAR – 字节联合霍普金斯大学推出的自回归视觉生成框架

站外新闻
AIGC 资讯

MoshiVis – Kyutai 开源的多模态实时语音模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.