Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Migician – 北交大联合清华、华中科大推出的多模态视觉定位模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Migician – 北交大联合清华、华中科大推出的多模态视觉定位模型
AIGC 资讯

Migician – 北交大联合清华、华中科大推出的多模态视觉定位模型

站外新闻
最近更新: 2026年6月8日 下午5:01
SHARE

Migician是什么

Migician是北京交通大学、华中科技大学和清华大学的研究团队联合推出的多模态大语言模型(MLLM),专门用在自由形式的多图像定位(Multi-Image Grounding, MIG)任务,设计了大规模训练数据集MGrounding-630k。根据自由形式的查询(如文本描述、图像或两者的组合)在多幅图像中识别精确定位相关的视觉区域。Migician基于大规模的指令调优数据集MGrounding-630k进行训练,用两阶段训练方法,结合多图像理解和单图像定位能力,实现端到端的多图像定位功能。Migician的设计和训练方法为多模态模型在复杂视觉场景中的应用提供新的思路,推动多图像理解与细粒度视觉定位的融合。

阅读目录
  • Migician是什么
  • Migician的主要功能
  • Migician的技术原理
  • Migician的项目地址
  • Migician的应用场景

Migician

Migician的主要功能

  • 跨图像定位:在多幅图像中找到与查询相关的对象或区域,给出其精确位置(如坐标框)。
  • 灵活的输入形式:支持文本、图像或两者的组合作为查询,例如“在图2中找到与图1相似的物体,但颜色不同”。
  • 多任务支持:处理多种与多图像相关的任务,如对象跟踪、差异识别、共同对象定位等。
  • 高效推理:基于端到端的模型设计,直接在多图像场景中进行推理,避免传统方法中的多步推理和错误传播问题。

Migician的技术原理

  • 端到端的多图像定位框架:基于端到端的模型架构直接处理多图像定位任务,避免传统方法中将任务分解为多个子任务(如先生成文本描述再定位)的复杂性和效率问题。同时理解多幅图像的内容,根据查询直接输出目标对象的位置。
  • 大规模指令调优数据集(MGrounding-630k):包含超过63万条多图像定位任务的数据。数据集涵盖多种任务类型(如静态差异定位、共同对象定位、对象跟踪等),结合自由形式的指令,模型学习到多样化的定位能力。
  • 两阶段训练方法:
    • 第一阶段:模型在多种多图像任务上进行训练,学习基本的多图像理解和定位能力。
    • 第二阶段:基于自由形式的指令调优,提升模型在复杂查询下的定位能力,保持对多样化任务的适应性。
  • 多模态融合与推理:结合视觉和语言模态的信息,基于多模态融合实现对复杂查询的理解和定位,处理抽象的视觉语义信息,例如通过对比、相似性或功能关联定位目标对象。
  • 模型合并技术:基于模型合并技术,将不同训练阶段的权重进行平均,优化整体性能。

Migician的项目地址

  • 项目官网:https://migician-vg.github.io/
  • GitHub仓库:https://github.com/thunlp/Migician
  • HuggingFace模型库:https://huggingface.co/Michael4933/Migician
  • arXiv技术论文:https://arxiv.org/pdf/2501.05767

Migician的应用场景

  • 自动驾驶:快速定位车辆周围目标(如行人、障碍物),支持多视角感知和动态目标跟踪。
  • 安防监控:多摄像头联动识别异常行为或目标,分析人群聚集、快速移动等异常情况。
  • 机器人交互:精准定位目标物体,支持机器人在复杂环境中完成抓取、导航等任务。
  • 图像编辑:分析多幅图像内容,实现对象替换、删除或创意内容生成。
  • 医疗影像:融合多模态影像,快速定位病变区域或异常组织,支持动态监测。
IBM季度业绩失利遭股价暴跌,高层坚称人工智能不会消灭大型机
AvatarGO – 南洋理工联合上海 AI Lab 等推出的4D人体与物体交互生成框架
AI生成内容反超人类:互联网一半文章已非人造,我们正面临‘精神断粮’危机
Ferret-UI 2 – 苹果推出的跨平台UI理解多模态大语言模型
VideoGigaGAN – Adobe推出的AI视频分辨率提升模型
分享
Email 复制链接 打印
Share
上一篇 Heygem – 硅基智能推出的开源数字人模型
下一篇 Neural4D 2o – DreamTech 推出支持多模态交互的 3D 模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

流光脑波AI大脑占位特色图
AIGC 资讯最新趋势

Anthropic王者归来:曾因‘过于危险’被封印的Mythos级AI模型重磅解禁,几周内全量上线

站外新闻
AI安全 Anthropic Claude Opus 4.8 Mythos模型
AI 工具AIGC 资讯

DeepSpeed-MII深度解析:微软开源高性能大模型推理库,3.7万模型一键部署

站外新闻
CUDA内核 DeepSpeed-MII LLM部署 大模型推理 微软开源
AI 工具AIGC 资讯

工作性价比计算器:薪资、福利、通勤全衡量,190+国薪资对比秒出结果

站外新闻
工作价值评估 工作性价比 职业规划工具 薪资计算器 购买力平价
AIGC 资讯

TryOffDiff – AI虚拟试穿技术,单张穿着者图片生成标准化服装图像

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.