热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >HyOCR-1.5 - 腾讯混元开源的轻量级端到端 OCR 专家大模型

HyOCR-1.5 - 腾讯混元开源的轻量级端到端 OCR 专家大模型

来源:互联网 更新时间:2026-07-14 14:57

HyOCR-1.0是什么

先说说一个有意思的新东西——HyOCR-1.0。这是腾讯混元开源的一款轻量级端到端OCR专家大模型,虽然只有1B参数,但能干的事可不少:文档解析、文本识别、信息抽取、拍照翻译、图表解析,甚至古文字识别、视频字幕提取和多页文档问答,一应俱全。更厉害的是,它基于DFlash投机解码,长结构化输出推理最高能提速6.37倍。在OmniDocBench v1.6上,它以94.74分位居端到端第一,这个成绩相当抢眼。

HyOCR-1.0的主要功能

  • 文档解析

    :能一键把密集文档、多栏版面、表格还有公式,直接转成Markdown、HTML或LaTeX这样的结构化文本。
  • 文本检测识别

    :输出图片中全部文字及对应坐标,不管是文档、街景、手写、广告、游戏还是视频,都能搞定。
  • 信息抽取

    :从票据、证件、收据里提取指定字段,按JSON格式返回,干净利落。
  • 拍照翻译

    :提取图中文字并翻译成多种语言,还能保留原来的版式和公式格式。
  • 图表解析

    :流程图、统计图表,都能解析成Mermaid或Markdown格式。
  • 古文字识别

    :支持汉字七体——甲骨、金文、篆、隶、楷、行、草,一个都不少。
  • 视频字幕提取

    :从视频帧里精准提取字幕文本。
  • 多页文档问答

    :基于多页PDF进行跨页检索、比对和证据聚合问答。

HyOCR-1.0的技术原理

轻量端到端架构

延续了HyOCR-1.0验证过的紧凑设计,由原生分辨率视觉编码器Hunyuan-ViT、自适应MLP连接器和轻量语言模型Hunyuan-0.5B组成。直接把多模态输入映射成Markdown、HTML、LaTeX等结构化输出,不需要任何任务级后处理模块。这才是真正的端到端——不需要任何后处理模块。

4K原生分辨率视觉编码

视觉编码器基于Hunyuan-ViT,最大输入分辨率从2K扩展到了4K,保持原始宽高比和空间布局。这样一来,高密度文档、超大表格和复杂版面的细粒度结构细节,都能被模型精准捕捉。

DFlash投机解码

引入了一个约90.7M参数的block-diffusion草稿模型,一次并行前向就能预测整块候选token,再由目标模型单次验证并接受最长正确前缀。在严格保持目标模型输出分布的同时,大幅降低了长结构化OCR生成的解码延迟。

Agentic Data Flow

智能体驱动数据生产闭环,把模型短板转化为可执行数据需求,自主完成素材搜索、工具辅助清洗、难例挖掘和数据管线开发,再和算法工程师持续迭代。这个机制让模型能持续进化。

三阶段训练配方

预训练阶段重规划了Stage 3,注入新能力数据并扩展到4K分辨率和128K上下文;SFT阶段彻底清洗数据、统一prompt接口;RL阶段采用IcePop(GRPO风格)优化,通过事实性、一致性评判和退化抑制三类互补奖励,提升输出质量。

如何使用HyOCR-1.0

  • 环境准备

    :安装Python 3.12+、CUDA 12.9、PyTorch 2.7.1和vLLM(≥0.12.0)。
  • 模型启动

    :执行vllm serve tencent/HunyuanOCR启动服务,或者加载Hugging Face权重。
  • 图片输入

    :用PIL读取图片,构建含image和text的messages对话结构。
  • 任务指令

    :按场景选择Prompt,比如文档解析、文字检测、信息抽取、翻译等。
  • 调用推理

    :通过vLLM或Transformers生成结果,设置temperature=0和max_tokens=16384。
  • 结果清洗

    :用内置去重函数清理可能的重复子串,得到最终结构化输出。
  • 本地部署

    :通过llama.cpp在CPU或消费级GPU上运行,不需要服务器。

HyOCR-1.0的核心优势

  • 极速推理

    :DFlash投机解码让长文档生成在Transformers下提速6.37倍、vLLM下提速2.14倍,端到端每页只要1.4秒。
  • 轻量可部署

    :1B参数,通过llama.cpp就能在CPU、消费级显卡甚至笔记本上本地运行。
  • SOTA精度

    :OmniDocBench v1.6端到端第一(94.74),表格TEDS 93.67,复杂表格和阅读顺序表现尤其突出。
  • 全栈开源

    :训练配方、推理框架、模型权重全部公开,可复现、可微调、可扩展。
  • 长尾能力

    :Agentic Data Flow补齐了331种低资源语种、古文字、多图问答等稀缺能力。
  • 高分辨率长上下文

    :支持4K图像分辨率和128K上下文,适配高密度长文档。
  • 幻觉抑制

    :CHAOS-Bench页均召回率14.15,优于现有模型,输出更忠于所见。

HyOCR-1.0的项目地址

  • GitHub仓库

    :https://github.com/Tencent-Hunyuan/HunyuanOCR
  • HuggingFace模型库

    :https://huggingface.co/tencent/HunyuanOCR
  • arXiv技术论文

    :https://arxiv.org/pdf/2607.04884

HyOCR-1.0的同类竞品对比

维度 HyOCR-1.0 DeepSeek-OCR-2

参数规模

1B(轻量) 3B(大3倍)

OmniDocBench

94.74 87.01

端到端延迟

1.408s / 页 5.460s / 页(慢3.9倍)

表格解析TEDS

93.67 约84.97

推理加速

DFlash投机解码,Transformers 6.37×提速 无专用加速,纯自回归解码

部署成本

可跑在CPU / 笔记本 需服务器级GPU

HyOCR-1.0的应用场景

  • 密集文档数字化

    :一键将合同、论文、报告等高密度多栏版面转为Markdown、HTML或LaTeX结构化文本,保留阅读顺序和版式。
  • 复杂表格与公式解析

    :精准还原财务报表、学术论文中的超大表格和数学公式,支持HTML表格和LaTeX公式输出。
  • 多语种跨国文档处理

    :覆盖331种语言,自动识别并解析混合语种文档,适用于外贸、法务、出版等全球化业务场景。
  • 古文字研究与保护

    :识别甲骨、金文、篆书、隶书等汉字七体,辅助博物馆、考古机构对历史文献进行数字化存档和研究。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc