来源:互联网 更新时间:2026-08-27 14:31
图片和扫描件,几乎是所有文本处理场景里绕不开的一道坎。无论是业界还是学术界,这都算得上是个老难题,同时也是当前优化的大热门。今天要聊的这个开源项目,恰好就是冲着这个痛点来的——它在 GitHub 上已经拿到了 24.9k 的 star,而且涨势相当猛。简单说,它把多种 OCR 能力打包在了一起,用起来很高效。
软件发布包是 .7z 压缩包或 .7z.exe 自解压包。自解压包的好处是,即使电脑没装解压软件也能直接解压。整个软件无需安装,解压后双击 Umi-OCR.exe 就能启动。
支持格式:pdf, xps, epub, mobi, fb2, cbz。
对扫描件进行 OCR,或提取原有文本,可输出为双层可搜索 PDF。
支持设定忽略区域,比如排除页眉页脚的文字干扰。
可以设置任务完成后自动关机或休眠,省心省力。
Umi-OCR 的公式识别能力基于 Pix2Text 实现。Pix2Text 本身也是一个开源 OCR 项目,专门处理文字和数学公式混排的图片。
打开这个功能后,用快捷键就能快速唤起截图,识别图中的文字。操作很直观:左侧的图片预览栏可以直接用鼠标划选复制,右侧的识别记录栏支持编辑文字,还可以划选多条记录批量复制。另外,从别处复制图片后,直接粘贴到 Umi-OCR 里也能识别。

关于 OCR 文本后处理中的排版解析方案,它能把识别结果的排版和顺序整理得更符合阅读习惯。预设方案包括:
多栏-按自然段换行:适合大多数场景,自动识别多栏布局,按自然段规则换行。
多栏-总是换行:每段语句都强制换行。
多栏-无换行:把所有语句合并到同一行。
单栏-按自然段换行 / 总是换行 / 无换行:与多栏类似,但不区分多栏布局。
单栏-保留缩进:适合解析代码截图,能保留行首缩进和行中空格。
不做处理:直接输出 OCR 引擎的原始结果,默认每段都换行。
以上方案均能自动处理横排和竖排(从右到左)的排版,兼容性很不错。
项目仍在持续迭代和优化中,后续还会有更多实用功能加入。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
管线机怎么接云米净水器
Windy卫星云图怎么看?云层变化识别技巧
WorkBuddy积分怎么获得?
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc