Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: MM1.5 – 苹果推出的升级版多模态大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > MM1.5 – 苹果推出的升级版多模态大模型
AIGC 资讯

MM1.5 – 苹果推出的升级版多模态大模型

站外新闻
最近更新: 2026年7月9日 上午7:05
SHARE

MM1.5是什么

MM1.5是苹果公司推出的多模态大型语言模型,旨在增强文本丰富图像理解、视觉指代和定位以及多图像推理能力。模型基于数据为中心的训练方法,在大规模预训练、高分辨率OCR数据持续预训练及优化的视觉指令微调,实现从1B到30B参数规模的高性能。MM1.5包括密集型和MoE变体,展现小规模模型通过精细数据策划和训练策略达到强大性能。MM1.5推出针对视频理解和移动UI理解优化的专门变体MM1.5-Video和MM1.5-UI,基于实证研究提供训练过程和决策的深入见解,为多模态AI技术的未来发展提供指导。

阅读目录
  • MM1.5是什么
  • MM1.5的主要功能
  • MM1.5的技术原理
  • MM1.5的项目地址
  • MM1.5的应用场景

MM1.5

MM1.5的主要功能

  • 文本丰富的图像理解:MM1.5能理解图像中的文本内容以及文本与图像内容之间的关系。
  • 视觉指代和定位:模型识别图像中的特定对象,理解文本中对对象的引用,如“那个红色的球”。
  • 多图像推理:MM1.5能分析多张图像,理解图像之间的联系,进行逻辑推理。
  • 视频理解:基于MM1.5-Video变体,模型能理解视频内容,包括动作、事件和时间序列。
  • 移动UI理解:MM1.5-UI变体专门针对移动应用界面的理解,识别和操作界面元素。

MM1.5的技术原理

  • 深度学习和自然语言处理:结合深度学习的视觉模型和自然语言处理技术,模型能理解和生成与图像内容相关的文本。
  • 坐标token和视觉注意力机制:用坐标token定位图像中的对象,基于视觉注意力机制关注图像的特定区域。
  • 图像分割和多模态融合:将图像分割成多个部分,与文本信息融合,支持多图像推理。
  • 视频帧采样和时序分析:对视频帧进行采样,分析帧之间的时序关系,理解视频内容。
  • 界面元素识别:用图像识别技术识别移动界面上的元素,如按钮和图标。

MM1.5的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2409.20566v1

MM1.5的应用场景

  • 图像和视频理解:MM1.5能理解和分析图像及视频内容,应用于图像标注、视频内容分析、安防监控等领域。
  • 视觉搜索:在电子商务或数字图书馆中,MM1.5帮助用户基于描述或查询图像来搜索特定的产品或文档。
  • 辅助驾驶和自动驾驶:在汽车行业,MM1.5用在理解和分析道路情况,辅助驾驶决策。
  • 智能助手:在智能手机和智能家居设备中,MM1.5提供更自然、直观的交互方式,理解用户的语音或文本指令。
  • 教育和培训:MM1.5作为教育工具,帮助学生理解复杂的概念,提供个性化的学习体验。
FLUX-Text – 阿里推出的多语言场景文本编辑框架
RD-Agent – 微软亚洲研究院推出开源的自动化研究与开发工具
腾讯云发布音视频 AI 品牌 WAND:内置六大自研模型与60+项AI能力
LingBot-Depth 2.0 – 蚂蚁灵波科技推出的深度补全模型
太空数据砸进AI!马斯克掏出SpaceX家底, 2 万亿参数Grok大模型即刻炼成
分享
Email 复制链接 打印
Share
上一篇 RegionDrag – 港大和牛津联合开发的基于区域的图像编辑技术
下一篇 VFusion3D – Meta联合牛津大学推出的AI生成3D模型项目
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

VideoPoet – 谷歌推出的AI视频生成模型

站外新闻
AIGC 资讯

努比亚AI宠物机器人iMoochi定档 7 月 17 日上线,主打情感陪伴与拟生命交互

站外新闻
AI 工具AIGC 资讯

育碧AI队友项目Teammates:用生成式AI重新定义游戏沉浸感与玩家交互体验

站外新闻
AI队友 Teammates 游戏AI 生成式AI 育碧
AIGC 资讯

PP-DocBee – 百度飞桨推出的文档图像理解多模态大模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.