热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >一款优秀的开源项目,PDF扫描件识别也超容易

一款优秀的开源项目,PDF扫描件识别也超容易

来源:互联网 更新时间:2026-08-27 14:31

图片和扫描件,几乎是所有文本处理场景里绕不开的一道坎。无论是业界还是学术界,这都算得上是个老难题,同时也是当前优化的大热门。今天要聊的这个开源项目,恰好就是冲着这个痛点来的——它在 GitHub 上已经拿到了 24.9k 的 star,而且涨势相当猛。简单说,它把多种 OCR 能力打包在了一起,用起来很高效。

项目特点

  • 免费

    :代码全部开源,没有任何隐藏费用。

  • 方便

    :解压即用,离线运行,不依赖网络。

  • 高效

    :自带高速离线 OCR 引擎,内置多语言识别库。

  • 灵活

    :支持命令行、HTTP 接口等外部调用方式。

  • 功能全面

    :截图 OCR、批量 OCR、PDF 识别、二维码识别、公式识别,一次搞定。

安装使用

软件发布包是 .7z 压缩包或 .7z.exe 自解压包。自解压包的好处是,即使电脑没装解压软件也能直接解压。整个软件无需安装,解压后双击 Umi-OCR.exe 就能启动。

模块举例

文档识别

  • 支持格式:pdf, xps, epub, mobi, fb2, cbz

  • 对扫描件进行 OCR,或提取原有文本,可输出为双层可搜索 PDF。

  • 支持设定忽略区域,比如排除页眉页脚的文字干扰。

  • 可以设置任务完成后自动关机或休眠,省心省力。

公式识别

Umi-OCR 的公式识别能力基于 Pix2Text 实现。Pix2Text 本身也是一个开源 OCR 项目,专门处理文字和数学公式混排的图片。

截图OCR

打开这个功能后,用快捷键就能快速唤起截图,识别图中的文字。操作很直观:左侧的图片预览栏可以直接用鼠标划选复制,右侧的识别记录栏支持编辑文字,还可以划选多条记录批量复制。另外,从别处复制图片后,直接粘贴到 Umi-OCR 里也能识别。

文本后处理

关于 OCR 文本后处理中的排版解析方案,它能把识别结果的排版和顺序整理得更符合阅读习惯。预设方案包括:

  • 多栏-按自然段换行:适合大多数场景,自动识别多栏布局,按自然段规则换行。

  • 多栏-总是换行:每段语句都强制换行。

  • 多栏-无换行:把所有语句合并到同一行。

  • 单栏-按自然段换行 / 总是换行 / 无换行:与多栏类似,但不区分多栏布局。

  • 单栏-保留缩进:适合解析代码截图,能保留行首缩进和行中空格。

  • 不做处理:直接输出 OCR 引擎的原始结果,默认每段都换行。

以上方案均能自动处理横排和竖排(从右到左)的排版,兼容性很不错。

项目仍在持续迭代和优化中,后续还会有更多实用功能加入。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc