Prompt 语宙Prompt 语宙
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
Search
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2024 Prompt 语宙. HalfPX. All Rights Reserved.
阅读: HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型
Share
登陆
通知 阅读更多
Font Resizer字体
Font Resizer字体
Prompt 语宙Prompt 语宙
Search
  • 首页
  • 语宙 AI 导航
  • AIGC 资讯
    • AIGC 早报Hot
    • 最新趋势
    • AI 工具
    • 热门资源
    • 强化 AI 学习
  • AI 绘图
    • Prompt 实战
    • AI 绘画教程
    • 模型精选
  • AI 图库
    • 人物
    • 展台场景
    • Banner
    • 游戏
    • 动物
    • 食物
    • 自然
    • 背景
    • 海报
    • 建筑
    • 室内设计
  • 出海数字营销宝典
  • AI 生图 Prompt
    • 写实人像
    • 产品与广告
    • 游戏资产与 3D
    • 界面与图标
    • 建筑与室内
    • 动漫与插画
    • 风景与自然
已有帐户? 登陆
  • Contact
  • Blog
  • Complaint
  • Advertise
© 2023 Prompt 语宙. Paooo.com. All Rights Reserved.
Prompt 语宙 > AIGC 资讯 > HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型
AIGC 资讯

HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型

站外新闻
最近更新: 2026年7月14日 上午12:05
SHARE

HyOCR-1.5是什么

HyOCR-1.5 是腾讯混元开源的轻量级端到端 OCR 专家大模型,仅 1B 参数能实现文档解析、文本识别、信息抽取、拍照翻译、图表解析、古文字识别、视频字幕提取与多页文档问答等全栈能力。模型基于 DFlash 投机解码,长结构化输出推理最高提速 6.37 倍;OmniDocBench v1.6 以 94.74 分位居端到端第一。

阅读目录
  • HyOCR-1.5是什么
  • HyOCR-1.5的主要功能
  • HyOCR-1.5的技术原理
  • 如何使用HyOCR-1.5
  • HyOCR-1.5的核心优势
  • HyOCR-1.5的项目地址
  • HyOCR-1.5的同类竞品对比
  • HyOCR-1.5的应用场景

HyOCR-1.5

HyOCR-1.5的主要功能

  • 文档解析:将密集文档、多栏版面、表格与公式一键转为结构化文本(Markdown/HTML/LaTeX)。
  • 文本检测识别:输出图片中全部文字内容及对应坐标,覆盖文档、街景、手写、广告、游戏、视频等场景。
  • 信息抽取:从票据、证件、收据中提取指定字段并按 JSON 格式返回。
  • 拍照翻译:提取图中文字并翻译为多种语言,保留文档版式与公式格式。
  • 图表解析:将流程图、统计图表解析为 Mermaid 或 Markdown 格式。
  • 古文字识别:支持汉字七体(甲骨、金文、篆、隶、楷、行、草)识别。
  • 视频字幕提取:从视频帧中精准提取字幕文本。
  • 多页文档问答:基于多页 PDF 进行跨页检索、比对与证据聚合问答。

HyOCR-1.5的技术原理

  • 轻量端到端架构:沿用 HyOCR-1.0 验证过的紧凑设计,由原生分辨率视觉编码器 Hunyuan-ViT、自适应 MLP 连接器与轻量语言模型 Hunyuan-0.5B 组成,直接将多模态输入映射为 Markdown、HTML、LaTeX 等结构化输出,无需任何任务级后处理模块。
  • 4K 原生分辨率视觉编码:视觉编码器基于 Hunyuan-ViT 构建,最大输入分辨率从 2K 扩展至 4K,保持原始宽高比与空间布局,使模型能捕捉高密度文档、超大表格及复杂版面的细粒度结构细节。
  • DFlash 投机解码:引入约 90.7M 参数的 block-diffusion 草稿模型,一次并行前向即可预测整块候选 token,再由目标模型单次验证并接受最长正确前缀;严格保持目标模型输出分布的同时,将长结构化 OCR 生成的解码延迟大幅降低。
  • Agentic Data Flow:智能体驱动数据生产闭环,将模型短板转化为可执行数据需求,自主完成素材搜索、工具辅助清洗、难例挖掘与数据管线开发,并与算法工程师持续迭代。
  • 三阶段训练配方:预训练阶段重规划 Stage 3,注入新能力数据并扩展至 4K 分辨率与 128K 上下文;SFT 阶段彻底清洗数据、统一 prompt 接口;RL 阶段采用 IcePop(GRPO 风格)优化,通过事实性、一致性评判与退化抑制三类互补奖励提升输出质量。

挖挖GitHub

微信关注回复“开源”,加入AI开源项目交流群

如何使用HyOCR-1.5

  • 环境准备:安装 Python 3.12+、CUDA 12.9、PyTorch 2.7.1 与 vLLM(≥0.12.0)。
  • 模型启动:执行 vllm serve tencent/HunyuanOCR 启动服务,或加载 Hugging Face 权重。
  • 图片输入:使用 PIL 读取图片并构建含 image 与 text 的 messages 对话结构。
  • 任务指令:按场景选择 Prompt,如文档解析、文字检测、信息抽取、翻译等。
  • 调用推理:通过 vLLM 或 Transformers 生成结果,设置 temperature=0 与 max_tokens=16384。
  • 结果清洗:使用内置去重函数清理可能的重复子串,获取最终结构化输出。
  • 本地部署:通过 llama.cpp 在 CPU 或消费级 GPU 上运行,无需服务器。

HyOCR-1.5的核心优势

  • 极速推理:DFlash 投机解码让长文档生成在 Transformers 下提速 6.37 倍、vLLM 下提速 2.14 倍,端到端每页仅 1.4 秒。
  • 轻量可部署:1B 参数可通过 llama.cpp 在 CPU、消费级显卡及笔记本本地运行。
  • SOTA 精度:OmniDocBench v1.6 端到端第一(94.74),表格 TEDS 93.67,复杂表格与阅读顺序表现突出。
  • 全栈开源:训练配方、推理框架、模型权重完整公开,可复现、可微调、可扩展。
  • 长尾能力:Agentic Data Flow 补齐 331 种低资源语种、古文字、多图问答等稀缺能力。
  • 高分辨率长上下文:支持 4K 图像分辨率与 128K 上下文,适配高密度长文档。
  • 幻觉抑制:CHAOS-Bench 页均召回率 14.15,优于现有模型,输出更忠于所见。

HyOCR-1.5的项目地址

  • GitHub仓库:https://github.com/Tencent-Hunyuan/HunyuanOCR
  • HuggingFace模型库:https://huggingface.co/tencent/HunyuanOCR
  • arXiv技术论文:https://arxiv.org/pdf/2607.04884

HyOCR-1.5的同类竞品对比

维度 HyOCR-1.5 DeepSeek-OCR-2
参数规模 1B(轻量) 3B(大 3 倍)
OmniDocBench 94.74 87.01
端到端延迟 1.408s / 页 5.460s / 页(慢 3.9 倍)
表格解析 TEDS 93.67 约 84.97
推理加速 DFlash 投机解码,Transformers 6.37× 提速 无专用加速,纯自回归解码
部署成本 可跑在 CPU / 笔记本 需服务器级 GPU

HyOCR-1.5的应用场景

  • 密集文档数字化:一键将合同、论文、报告等高密度多栏版面转为 Markdown / HTML / LaTeX 结构化文本,保留阅读顺序与版式。
  • 复杂表格与公式解析:精准还原财务报表、学术论文中的超大表格与数学公式,支持 HTML 表格与 LaTeX 公式输出。
  • 多语种跨国文档处理:覆盖 331 种语言,自动识别并解析混合语种文档,适用于外贸、法务、出版等全球化业务场景。
  • 古文字研究与保护:识别甲骨、金文、篆书、隶书等汉字七体,辅助博物馆、考古机构对历史文献进行数字化存档与研究。
阿里通义开源WebResearcher:迭代式深度研究Agent,自主拆解复杂问题的AI研究助手
混元图像2.0 – 腾讯推出的实时AI图片生成大模型
MiniMax Music 2.6深度评测:20秒极速生成、14种结构控制,AI音乐创作进入可控时代
LangBot – 多模态即时聊天机器人构建与管理的开源平台
Spotify与环球音乐联手:AI翻唱混音工具上线,正版版权终结Suno野蛮生长
分享
Email 复制链接 打印
Share
上一篇 DreamPolish – 智谱AI、清华、北大联合推出的文本到3D生成模型
下一篇 The Matrix – 阿里联合港大等多所机构推出的AI基础世界模拟器
发表评价

发表评价 取消回复

您的邮箱地址不会被公开。 必填项已用 * 标注

Please select a rating!

Ad image
- 入群领取知识星球折扣卷, 仅剩99份 -
Ad imageAd image

最近更新

FeyNoBg – Feyn Labs 开源的自动背景去除模型
AIGC 资讯
Qwen-Audio-3.0-ASR-Flash – 阿里千问推出的语音识别大模型
AIGC 资讯
全息流体渐变通用占位特色图
微软云端隐忧:千亿营收背后的增速换挡与杠杆风险
AIGC 资讯
全息流体渐变通用占位特色图
微信公众号推出 AI”一键排版”:自动分段、生成小标题、匹配配图三步到位
AIGC 资讯

相关推荐

全息流体渐变通用占位特色图
AIGC 资讯

​MiniMax Code 2. 0 桌面端来了:长任务不再卡顿中断,远程操控和浏览器接管本月亮相

站外新闻
AI 工具AIGC 资讯

乐鑫 ESP-Claw 开源:用自然语言对话定义物联网设备行为的 AI Agent 框架

站外新闻
AI Agent ESP32 物联网 自然语言处理 边缘计算
AIGC 资讯

OThink-MR1 – OPPO联合港科大推出的多模态语言模型优化框架

站外新闻
AIGC 资讯

Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型

站外新闻
/ Prompt 语宙 /

Experience the limitless creative possibilities of generative AI and unlock new levels of innovation.

Quick Link

  • Remaker AI
  • BGRemaker 抠图Hot
  • AIGC 工具
  • Prompt 咒语生成器
  • 去水印工具

Support

  • Contact
  • Blog
  • Complaint
  • Advertise

标签

AIGC Midjourney prompt AI Agent GPT Image 2 多模态大模型 EvoLink灵感 AI绘画 字节跳动 开源工具 开源模型 早报 具身智能 openai 大语言模型 开源大模型 阿里通义 强化学习 腾讯混元 Anthropic MoE架构 多模态AI 开源框架 AI智能体 教程 AI工具 扩散模型 AI视频生成 chatgpt 大模型
Prompt 语宙Prompt 语宙
Follow US
© 2009-2026 Prompt 语宙. Paooo.com. All Rights Reserved.