Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MM1.5 – 苹果推出的升级版多模态大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MM1.5 – 苹果推出的升级版多模态大模型
AIGC 资讯

MM1.5 – 苹果推出的升级版多模态大模型

站外新闻
最近更新: 2026年7月9日 上午7:05
SHARE

MM1.5是什么

MM1.5是苹果公司推出的多模态大型语言模型,旨在增强文本丰富图像理解、视觉指代和定位以及多图像推理能力。模型基于数据为中心的训练方法,在大规模预训练、高分辨率OCR数据持续预训练及优化的视觉指令微调,实现从1B到30B参数规模的高性能。MM1.5包括密集型和MoE变体,展现小规模模型通过精细数据策划和训练策略达到强大性能。MM1.5推出针对视频理解和移动UI理解优化的专门变体MM1.5-Video和MM1.5-UI,基于实证研究提供训练过程和决策的深入见解,为多模态AI技术的未来发展提供指导。

阅读目录
  • MM1.5是什么
  • MM1.5的主要功能
  • MM1.5的技术原理
  • MM1.5的项目地址
  • MM1.5的应用场景

MM1.5

MM1.5的主要功能

  • 文本丰富的图像理解:MM1.5能理解图像中的文本内容以及文本与图像内容之间的关系。
  • 视觉指代和定位:模型识别图像中的特定对象,理解文本中对对象的引用,如“那个红色的球”。
  • 多图像推理:MM1.5能分析多张图像,理解图像之间的联系,进行逻辑推理。
  • 视频理解:基于MM1.5-Video变体,模型能理解视频内容,包括动作、事件和时间序列。
  • 移动UI理解:MM1.5-UI变体专门针对移动应用界面的理解,识别和操作界面元素。

MM1.5的技术原理

  • 深度学习和自然语言处理:结合深度学习的视觉模型和自然语言处理技术,模型能理解和生成与图像内容相关的文本。
  • 坐标token和视觉注意力机制:用坐标token定位图像中的对象,基于视觉注意力机制关注图像的特定区域。
  • 图像分割和多模态融合:将图像分割成多个部分,与文本信息融合,支持多图像推理。
  • 视频帧采样和时序分析:对视频帧进行采样,分析帧之间的时序关系,理解视频内容。
  • 界面元素识别:用图像识别技术识别移动界面上的元素,如按钮和图标。

MM1.5的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2409.20566v1

MM1.5的应用场景

  • 图像和视频理解:MM1.5能理解和分析图像及视频内容,应用于图像标注、视频内容分析、安防监控等领域。
  • 视觉搜索:在电子商务或数字图书馆中,MM1.5帮助用户基于描述或查询图像来搜索特定的产品或文档。
  • 辅助驾驶和自动驾驶:在汽车行业,MM1.5用在理解和分析道路情况,辅助驾驶决策。
  • 智能助手:在智能手机和智能家居设备中,MM1.5提供更自然、直观的交互方式,理解用户的语音或文本指令。
  • 教育和培训:MM1.5作为教育工具,帮助学生理解复杂的概念,提供个性化的学习体验。
阿里通义ThinkSound:首个CoT音频生成模型,让AI为视频自动配音,音画同步超越6大主流方案
BestBlogs:开源AI内容聚合平台,400+ RSS源智能筛选编程/设计/商业科技资讯
阿里达摩院开源RynnVLA-001:VLA模型如何重塑机器人智能?
Pollinations.AI – 开源AI内容生成平台,提供免费文本和图像生成API
清华&面壁智能开源ChatDev 2.0:零代码拖拽构建多智能体协作系统,支持软件开发/3D建模等场景
分享
Email 复制链接 打印
Share
上一篇 RegionDrag – 港大和牛津联合开发的基于区域的图像编辑技术
下一篇 VFusion3D – Meta联合牛津大学推出的AI生成3D模型项目
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

1100 多名 AI 员工联名呼吁美国政府踩刹车,奥尔特曼罕见表态支持
AIGC 资讯
Fresh Burst Sprite Ad Poster
AI 生图 Prompt
Taco Supreme Extreme Poster
AI 生图 Prompt
Toy Figure Character Transformation
AI 生图 Prompt

相关推荐

AIGC 资讯

Miras – 谷歌推出的深度学习架构设计通用框架

站外新闻
全息流体渐变通用占位特色图
AIGC 资讯

《第九区》导演震撼发布首部AI短片 字节Seedance 2.0 助力科幻巨制

站外新闻
AI 工具AIGC 资讯

Skywork R1V4-Lite:昆仑万维开源轻量级多模态智能体,单图驱动视觉推理新范式

站外新闻
AIGC 多模态智能体 昆仑万维 视觉推理 轻量级模型
AIGC 资讯

Markdown-to-Image – 开源的在线 Markdown 转海报编辑器

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 写实人像 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.