Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: mPLUG-DocOwl2 – 阿里推出多页文档理解的多模态大模型,单页仅需324个token
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > mPLUG-DocOwl2 – 阿里推出多页文档理解的多模态大模型,单页仅需324个token
AIGC 资讯

mPLUG-DocOwl2 – 阿里推出多页文档理解的多模态大模型,单页仅需324个token

站外新闻
最近更新: 2026年7月9日 下午2:15
SHARE

mPLUG-DocOwl2是什么

mPLUG-DocOwl 2是由阿里巴巴通义实验室mPLUG团队推出的用于多页文档理解的多模态大型语言模型。在不依赖光学字符识别(OCR)技术的情况下,通过高分辨率文档图像压缩技术,实现对文档图片的高效理解和处理。mPLUG-DocOwl 2在多页文档理解基准测试中达到了新的最高标准(SOTA),每页文档图像消耗324个token,降低显存占用和首包时间,提高处理速度。模型的训练分为三个阶段:单页预训练、多页预训练和多任务指令微调。mPLUG-DocOwl 2支持理解单页文档,还能处理多页文档中的复杂问题,如跨页内容关联和结构解析。

阅读目录
  • mPLUG-DocOwl2是什么
  • mPLUG-DocOwl2的主要功能
  • mPLUG-DocOwl2的技术原理
  • mPLUG-DocOwl2的项目地址
  • mPLUG-DocOwl2的应用场景

mPLUG-DocOwl2

mPLUG-DocOwl2的主要功能

  • 多页文档理解:在不依赖OCR技术的情况下,直接从多页文档图像中提取和理解信息。
  • 高分辨率图像处理:通过高分辨率文档图像压缩模块,将每页文档图像压缩成324个视觉token,减少显存占用和首包时间。
  • 多页问答能力:回答有关多页文档内容的问题,提供详细的解释以及相关页码。
  • 文档结构解析:解析并表示多页文档的层级结构,以JSON格式输出,便于进一步的数据处理和分析。
  • 跨页内容关联:理解和关联多页文档中跨页的内容,提供跨页结构理解。
  • 高效处理:在单个A100-80G GPU上,同时处理多达60页的高清文档图片,提高处理效率。

mPLUG-DocOwl2的技术原理

  • 高分辨率文档图像压缩(High-resolution DocCompressor):基于低分辨率全局视觉特征作为指导,通过cross-attention机制将高分辨率文档图像压缩成较少的视觉token。
  • Shape-adaptive Cropping:自适应裁剪模块根据文档的形状和大小进行切割,来适应不同页面的布局。
  • 视觉特征提取:使用视觉编码器(如ViT)提取每个切片的视觉特征,并通过H-Reducer模块进行特征合并和维度对齐。
  • 跨注意力机制:在压缩过程中,使用全局图特征作为查询,切片特征作为键值对,通过cross-attention层实现特征压缩。
  • 全局与局部视觉特征结合:结合全局视觉特征(捕捉布局信息)和局部视觉特征(保留文本和图像细节),实现更准确的文档理解。

mPLUG-DocOwl2的项目地址

  • GitHub仓库:https://github.com/X-PLUG/mPLUG-DocOwl/tree/main/DocOwl2
  • arXiv技术论文:https://arxiv.org/pdf/2409.03420v2

mPLUG-DocOwl2的应用场景

  • 法律文件分析:自动化解析法律文件和案例,提取关键信息,支持法律研究和案件准备。
  • 医疗记录管理:从医疗记录和报告中提取重要数据,支持病人护理、研究和行政管理。
  • 学术研究:帮助研究人员快速理解和总结大量文献,加速科学发现和知识创新。
  • 金融报告分析:自动化处理年度报告、财务报表和其他金融文档,提取关键财务指标和趋势。
  • 政府文档处理:自动化处理政府发布的公告、法规和政策文件,提高政府服务效率。
NVILA – 英伟达推出的视觉语言大模型
DramaClaw – 工业级 AI 视频制作工具,提供一站式流水线
Suno接入iMessage:iPhone用户可直接在聊天中用AI生成歌曲,日产量超 700 万首
Chirp 3 – 谷歌云推出的高清语音合成模型
DynVFX – AI视频增强技术,将新动态内容与原始视频无缝融合
分享
Email 复制链接 打印
Share
上一篇 VoiceCraft – 开源的语音编辑和文本转语音模型
下一篇 CogView3 – 智谱AI推出的开源AI图像生成模型
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

1100 多名 AI 员工联名呼吁美国政府踩刹车,奥尔特曼罕见表态支持
AIGC 资讯
Fresh Burst Sprite Ad Poster
AI 生图 Prompt
Taco Supreme Extreme Poster
AI 生图 Prompt
Toy Figure Character Transformation
AI 生图 Prompt

相关推荐

AI 工具AIGC 资讯

Step 3.7 Flash 重磅开源发布:198B MoE架构实现400TPS推理,Agent效率与可靠性新时代已至

站外新闻
Agent MoE架构 Step 3.7 Flash 开源模型
AI 工具AIGC 资讯

微软重磅开源!Agent Lightning:基于强化学习的AI Agent训练框架,无缝集成LangChain、AutoGen等主流平台

站外新闻
AI Agent LangChain 强化学习 微软
AIGC 资讯

Evolving Agents – 开源的AI Agent管理与进化框架

站外新闻
AIGC 资讯

Spirit LM – Meta推出多模态语言模型,无缝集成语音和文本

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 写实人像 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.