Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: CogVLM2 – 智谱AI推出的新一代多模态大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > CogVLM2 – 智谱AI推出的新一代多模态大模型
AIGC 资讯

CogVLM2 – 智谱AI推出的新一代多模态大模型

站外新闻
最近更新: 2026年7月9日 下午10:01
SHARE

CogVLM2是什么

CogVLM2是由智谱AI推出的新一代多模态大模型,在视觉和语言理解方面实现了显著的性能提升,支持高达8K的文本长度和1344*1344分辨率的图像输入,具备强大的文档图像理解能力。该模型采用50亿参数的视觉编码器与70亿参数的视觉专家模块,通过深度融合策略,优化了视觉与语言模态的交互,确保了在增强视觉理解的同时,语言处理能力也得到保持。CogVLM2的开源版本支持中英文双语,模型大小为19亿参数,但实际推理时激活的参数量约为120亿,展现了在多模态任务中的高效性能。

阅读目录
  • CogVLM2是什么
  • CogVLM2的改进点
  • CogVLM2的模型信息
  • CogVLM2的模型架构
  • CogVLM2的模型性能

CogVLM2

CogVLM2的改进点

CogVLM2模型相比前代的改进点主要包括以下几个方面:

  • 性能提升:在OCRbench和TextVQA等多个关键基准测试上,CogVLM2的性能有了显著提升,例如在OCRbench上性能提升了32%,在TextVQA上性能提升了21.9%。
  • 文档图像理解:CogVLM2增强了对文档图像的理解和问答能力,特别是在DocVQA基准测试中表现出色。
  • 支持高分辨率图像:模型支持高达1344*1344像素的图像分辨率,能够处理更高清晰度的图像。
  • 支持长文本:CogVLM2支持长达8K的文本输入,这使得模型能够处理更长的文档和更复杂的语言任务。
  • 双语支持:CogVLM2提供了支持中英文双语的开源模型版本,增强了模型的多语言能力。

CogVLM2的模型信息

CogVLM2开源了两款以Meta-Llama-3-8B-Instruct为语言基座模型的CogVLM2,分别是cogvlm2-llama3-chat-19B和cogvlm2-llama3-chinese-chat-19B,感兴趣的用户可以前往GitHub、Hugging Face或魔搭社区进行下载或在线体验。

模型名称
cogvlm2-llama3-chat-19B
cogvlm2-llama3-chinese-chat-19B
基座模型
Meta-Llama-3-8B-Instruct
Meta-Llama-3-8B-Instruct
语言
英文
中文、英文
模型大小
19B
19B
任务
图像理解,对话模型
图像理解,对话模型
模型链接
🤗 Huggingface 🤖 ModelScope 💫 始智AI 🐙GitHub
🤗 Huggingface 🤖 ModelScope 💫 始智AI
体验链接
📙 官方页面
📙 官方页面 🤖 ModelScope
Int4模型
暂未推出
暂未推出
文本长度
8K
8K
图片分辨率
1344 * 1344
1344 * 1344

CogVLM2的模型架构

CogVLM2的模型架构在继承上一代模型的基础上进行了优化和创新,具体特点如下:

  1. 视觉编码器:CogVLM2采用了一个拥有50亿参数的视觉编码器,负责对输入图像进行特征提取和编码。
  2. 视觉专家模块:在大语言模型中整合了一个70亿参数的视觉专家模块,这一模块通过独特的参数设置,精细地建模了视觉与语言序列的交互。
  3. 深度融合策略:CogVLM2采用了深度融合策略,使得视觉模态与语言模态能够更加紧密地结合,从而增强了模型在视觉理解能力的同时,保持了在语言处理上的优势。
  4. MLP Adapter:模型中使用了MLP(多层感知器)Adapter,用于调整和适配不同模态之间的特征。
  5. 降采样模块:为了更好地处理和理解高分辨率的文档或网页图片,CogVLM2在视觉编码器后引入了一个专门的降采样模块,有效提取关键信息,减少输入到语言模型中的序列长度。
  6. Word Embedding:模型包含了Word Embedding层,用于将文本转换为模型可以理解的数值型向量。
  7. 多专家模块结构:CogVLM2设计了多专家模块结构,使得在进行推理时,实际激活的参数量仅约120亿,这种设计既保证了模型的性能,又提高了推理效率。
  8. 语言基座模型:CogVLM2使用了Meta-Llama-3-8B-Instruct作为语言基座模型,为模型提供了强大的语言理解和生成能力。

CogVLM2的架构

CogVLM2的模型性能

CogVLM2的团队在一系列多模态基准上进行了定量评估,这些基准包括 TextVQA、DocVQA、ChartQA、OCRbench、MMMU、MMVet、MMBench等。从下表可以看出CogVLM2 的两个模型,尽管具有较小的模型尺寸,但在多个基准中取得 SOTA性能;而在其他性能上,也能达到与闭源模型(例如GPT-4V、Gemini Pro等)接近的水平。
CogVLM2的基准测试得分

模型 是否开源 模型规模 TextVQA DocVQA ChartQA OCRbench MMMU MMVet MMBench
LLaVA-1.5 ✅ 13B 61.3 – – 337 37.0 35.4 67.7
Mini-Gemini ✅ 34B 74.1 – – – 48.0 59.3 80.6
LLaVA-NeXT-LLaMA3 ✅ 8B – 78.2 69.5 – 41.7 – 72.1
LLaVA-NeXT-110B ✅ 110B – 85.7 79.7 – 49.1 – 80.5
InternVL-1.5 ✅ 20B 80.6 90.9 83.8 720 46.8 55.4 82.3
QwenVL-Plus ❌ – 78.9 91.4 78.1 726 51.4 55.7 67.0
Claude3-Opus ❌ – – 89.3 80.8 694 59.4 51.7 63.3
Gemini Pro 1.5 ❌ – 73.5 86.5 81.3 – 58.5 – –
GPT-4V ❌ – 78.0 88.4 78.5 656 56.8 67.7 75.0
CogVLM1.1 (Ours) ✅ 7B 69.7 – 68.3 590 37.3 52.0 65.8
CogVLM2-LLaMA3 (Ours) ✅ 8B 84.2 92.3 81.0 756 44.3 60.4 80.5
CogVLM2-LLaMA3-Chinese (Ours) ✅ 8B 85.0 88.4 74.7 780 42.8 60.5 78.9
OmniSQL – 开源文本到 SQL 模型,自然语言转换为 SQL 查询语句
Cosmos – 英伟达推出的生成式世界基础模型平台
OpenAI 紧急修复 ChatGPT 与 API 高延迟故障:服务已恢复,部分功能仍待优化
DeepSeek-R1-0528开源发布:660B参数模型,编程能力超越Claude 4与Gemini 2.5 Pro
unsloth – 开源的大语言模型微调工具
分享
Email 复制链接 打印
Share
上一篇 Real-ESRGAN:腾讯推出的开源图像分辨率提升模型
下一篇 NextChat – 一键搭建私人ChatGPT网页应用的开源项目
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

AIGC 资讯

Dify – 开源的生成式AI应用开发平台

站外新闻
AIGC 资讯

ACE-Ego – 大晓机器人联合港中文开源的具身操作 VLA 模型

站外新闻
AI 工具AIGC 资讯

OpenAI广告平台全面开放:免费ChatGPT用户成精准流量池,CPC定价与投放策略全解析

站外新闻
chatgpt CPC openai 商业化 广告平台
AI 工具AIGC 资讯

阿里通义开源 Wan2.2-S2V:一张图+一段音频,分钟级生成电影级数字人视频的多模态大模型

站外新闻
AIGC 多模态模型 数字人 视频生成 通义万相
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.