Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: Mini-InternVL – 上海AI Lab联合清华等机构推出的轻量级多模态大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > Mini-InternVL – 上海AI Lab联合清华等机构推出的轻量级多模态大模型
AIGC 资讯

Mini-InternVL – 上海AI Lab联合清华等机构推出的轻量级多模态大模型

站外新闻
最近更新: 2026年6月9日 上午11:18
SHARE

Mini-InternVL是什么

Mini-InternVL是“迷你版”书生·万象大模型,是上海AI实验室与清华大学、南京大学等机构联合推出的轻量级多模态大型语言模型系列,包含1B、2B和4B三个参数版本,用较小的参数量实现较高的性能,其中Mini-InternVL-4B仅用5%的参数量达到InternVL2-76B约九成的性能。Mini-InternVL用InternViT-300M作为视觉编码器,与不同的预训练语言模型结合,基于动态分辨率输入策略和像素洗牌操作来减少视觉标记数量,提高处理效率。Mini-InternVL在多个一般多模态基准测试中表现出色,且能用简单的转移学习框架适应特定领域的下游任务。

阅读目录
  • Mini-InternVL是什么
  • Mini-InternVL的主要功能
  • Mini-InternVL的技术原理
  • Mini-InternVL的项目地址
  • Mini-InternVL的应用场景

Mini-InternVL

Mini-InternVL的主要功能

  • 多模态理解与推理:在给定图像和文本输入的情况下,理解和推理其中的语义关系。
  • 跨领域适应性:基于知识蒸馏和转移学习技术,适应不同的领域和任务。
  • 轻量级与高效性:Mini-InternVL在保持较小模型参数量(1亿至40亿)的同时,实现与大型模型相近的性能。使得在资源受限的环境中(如消费级GPU或边缘设备)高效运行,降低部署成本和计算资源需求。
  • 视觉指令调优:具备根据视觉指令进行调优的能力,更好地理解和执行用户基于图像的指令。
  • 动态分辨率输入:支持动态分辨率输入策略,根据图像的长宽比将其分割成不同大小的瓦片,并进行相应的处理。

Mini-InternVL的技术原理

  • 视觉编码器(InternViT-300M):作为模型的核心部分,视觉编码器负责将输入图像转换为模型能理解的特征表示。InternViT-300M是轻量级的视觉模型,基于知识蒸馏从更强大的InternViT-6B模型中继承丰富的视觉知识。蒸馏过程使得InternViT-300M能在多个视觉领域中表现出色,同时保持较小的模型参数量。
  • 知识蒸馏:将大型教师模型的知识转移到小型学生模型中,让学生模型能继承教师模型的性能。在Mini-InternVL中,InternViT-6B作为教师模型,基于计算负余弦相似性损失,将隐藏状态的知识传递给InternViT-300M。
  • MLP投影器:MLP(多层感知器)投影器用在连接视觉编码器和语言模型。将视觉编码器输出的特征向量投影到一个适合语言模型处理的空间中,使得视觉信息和文本信息能有效地融合和交互。
  • 预训练语言模型(LLMs):Mini-InternVL结合不同的预训练语言模型,如Qwen2-0.5B、InternLM2-1.8B和Phi-3mini。
  • 动态分辨率输入策略:基于动态分辨率输入策略。该策略根据图像的长宽比将其分割成448×448大小的瓦片,将瓦片组合成固定序列,最终生成一个2688×896分辨率的图像表示。且模型为每个瓦片添加一个缩略图,提供全局上下文信息。
  • 像素洗牌操作:基于像素洗牌操作,模型将图像的分辨率降低到原来的四分之一,减少视觉标记的数量。

Mini-InternVL的项目地址

  • GitHub仓库:https://github.com/OpenGVLab/InternVL
  • HuggingFace模型库:https://huggingface.co/collections/OpenGVLab/internvl-adaptation
  • arXiv技术论文:https://arxiv.org/pdf/2410.16261

Mini-InternVL的应用场景

  • 自动驾驶:用在环境感知、行为预测和路径规划,处理多视角图像,识别和预测交通参与者的行为,生成安全高效的行驶路径。
  • 医学图像处理:辅助疾病诊断、图像标注和治疗方案建议,分析医学影像,提供诊断支持和治疗建议。
  • 遥感:进行土地利用分类、灾害监测和环境监测,识别不同类型的土地利用情况,评估自然灾害影响,监测环境变化。
  • 文档和图表理解:提取文档内容、解析表格和图表,生成文档摘要和图表解释,支持数据可视化和分析。
  • 视频理解:提取视频关键帧和内容,识别视频中的人物行为和事件,生成视频摘要和回答视频相关问题。
Inverse Painting – 华盛顿大学推出逆向重现绘画过程的AI技术
DynamicCity – 上海 AI Lab 推出的4D动态场景生成框架
阿里重磅开源通义万相Wan2.2:270亿参数MoE架构,消费级显卡畅享电影级AI视频生成
SleepFM – 斯坦福大学开源的多模态睡眠分析模型
CineMaster – 快手推出的文本到视频生成框架,具备3D感知能力
分享
Email 复制链接 打印
Share
上一篇 HoloDrive – 商汤联合上海AI Lab等机构推出的2D-3D多模态街道场景生成框架
下一篇 EMO2 – 阿里研究院推出的音频驱动头像视频生成技术
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

Ming‑Flash‑Omni 2.0 – 蚂蚁开源的全模态大模型
AIGC 资讯
全息流体渐变通用占位特色图
Gartner最新预测:全球AI模型与平台市场高速增长, 2026 年规模将达 640 亿美元
AIGC 资讯
全息流体渐变通用占位特色图
千问甩出语音合成大模型Qwen-Audio-3.0-TTS:自然语言直接指挥,实时版首包延迟压进 300 毫秒
AIGC 资讯
全息流体渐变通用占位特色图
算力飙升 10 倍!谷歌秘密研发Frozen芯片,Gemini大模型硬核升级
AIGC 资讯

相关推荐

AIGC 资讯

IterComp – 清北、牛津等多所高校联合推出的文本到图像生成框架

站外新闻
AIGC 资讯

MindLLM – 耶鲁联合剑桥等机构推出的医疗领域 AI 模型

站外新闻
AIGC 资讯

解法都市孤独感,努比亚拟生命AI陪伴机器人iMoochi即将开

站外新闻
AI 工具AIGC 资讯

美团发布VitaBench:首个生活场景大模型Agent评测基准,66个工具与跨场景任务重新定义AI评测

站外新闻
VitaBench 美团 评测基准
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent openai 多模态大模型 AI绘画 字节跳动 开源模型 开源工具 早报 具身智能 大语言模型 MoE架构 开源大模型 强化学习 阿里通义 Anthropic 腾讯混元 多模态AI 大模型 开源框架 AI智能体 教程 chatgpt AI工具 扩散模型 AI视频生成 蚂蚁集团 开源
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.