Umi-OCR 批量识别指南:离线免费,一次导入几百张图片识别成文字
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
Umi-OCR 是一款免费、离线的 OCR 工具:截屏、批量图片导入、PDF 文档识别、二维码扫描都装在同一个软件里,全部识别过程在本地完成,不上传任何文件。如果你手头攒了一堆需要提取文字的图片,这篇指南带你把它跑起来。
💼 什么时候需要离线批量OCR
先对号入座,看看你是不是下面这三种情况之一。
- 档案室里的一沓扫描件。你把一批扫描文件转成了图片,想批量导出里面的文字,又不放心把合同、财务数据传到云端 OCR 服务。
- 代码截图进笔记。IDE 里的报错、终端里的日志,你想转成纯文本存进笔记软件,缩进结构还得保住。
- 几百张截图等处理。截图工具里堆了几百张带水印的截图,一张张手动识别不现实,需要排队一次性跑完。
Umi-OCR 的批量页没有数量上限,支持jpg、png、webp、bmp、tif等格式,还能给任务配"完成后自动关机"——夜里挂机识别,早上看结果。
⚡ 四步跑通批量识别流程
最短路径如下,全程不用配环境、不用装依赖。
- 下载解压。拿到
.7z压缩包后解压,双击Umi-OCR.exe启动(Windows)或umi-ocr.sh(Linux)。目的是得到一个解压即用的程序,不写注册表、不需要安装步骤。 - 导入图片。打开"批量OCR"标签页,点"选择图片",可多选文件或整个文件夹。目的是把待识别图片排进左侧任务列表。
- 选语言和排版方案。在右侧"设置"里选识别语言,再从 OCR 文本后处理里挑一个排版解析方案。目的是让输出顺序、换行符合文档类型,这一步直接决定结果好不好用。
- 开始任务并保存结果。点"开始任务",进度条走完,识别文本按你选的格式(txt、md、jsonl、csv)存入指定目录,支持每张图一个文件或多图合并。
💡 不想点按钮的话,Umi-OCR 也能被命令行驱动,把上面的步骤写进脚本里。
📷 核心功能:四个标签页各管一事
截图OCR:识别完还能整理排版
按快捷键截一块屏幕,右侧立刻出识别记录。左侧预览栏支持划选复制,右侧记录栏可以编辑、合并复制多条记录;在别处复制图片,也能直接粘贴进来识别。
识别只是第一步,"文本后处理"的排版解析方案会按文档结构重新排序文字:
- 多栏 / 单栏 × 自然段换行 / 总是换行 / 无换行,共六种预设;
- 代码截图用"单栏-保留缩进",行首空格原样保留;
- 以上方案都能自动处理横排和竖排(从右到左)的文字方向。
批量OCR:导入、排队、保存
批量页就是上面演示的流程:左侧列图片、耗时和状态,右侧看每张图的识别记录。除了格式齐全,它还有两个批量场景常用的设计——支持任务完成后自动关机或待机,以及下面的"忽略区域"。
⚠️ 注意:超长的长图默认会被压缩到边长上限以内再识别,像素超大的图记得先调高设置里的"限制图像边长"。
忽略区域:把水印从结果里抹掉
批量页设置里可以打开忽略区域编辑器:按住右键在预览图上画若干矩形框,框内出现的文字在整个任务中都会被跳过。
- 矩形框要画大一点,把水印可能出现的所有位置都包进去;
- 生效粒度是"整个文本块",不是单个字符:框内的文本块全部忽略,框外保留。
文档识别:PDF 扫描件变可搜索 PDF
支持pdf、xps、epub、mobi、fb2、cbz六种格式。对扫描版 PDF 做 OCR,对已有文本层的 PDF 直接提取原文,最后能输出双层可搜索 PDF——上层是原图,下层是可复制搜索的文字。它同样支持忽略区域,排除页眉页脚很方便。
界面与调用方式
- 界面语言:跟随系统自动切换,也可在"全局设置 → 语言"里手动改,内置繁中、英文、日文、俄语等。
- 命令行 / HTTP 接口:识别单图、整目录、二维码读写都能被外部程序调用,适合做自动化流程,细节见命令行手册和HTTP接口手册。
🎯 场景实战:输入、参数、输出怎么配
技巧散着记容易忘,按场景打包成"输入 → 参数 → 输出"的组合,照抄就行。
学术论文 PDF,按自然段还原文档
- 输入:300DPI 扫描件导出的 PDF,或页面截图。
- 参数:文档识别;识别语言选中文;排版方案选"多栏-按自然段换行";页眉页脚用忽略区域框掉。
- 输出:双层可搜索 PDF,段落和栏序与原文一致,方便复制和检索。
代码截图,缩进一个空格都不丢
- 输入:IDE 或终端截图。
- 参数:识别语言选英文;排版方案选"单栏-保留缩进"。
- 输出:带缩进的纯文本代码,直接粘回编辑器能跑。
超长截图,先调边长再识别
- 输入:几万像素高的整页长图。
- 参数:设置 → 文字识别 → "限制图像边长"调大数值。
- 输出:长图完整识别,不丢底部内容。
带水印的截图,画两个框就干净了
- 输入:四角带水印或 LOGO 的截图。
- 参数:批量页开启忽略区域编辑器,右键画矩形框包住水印区域。
- 输出:结果里没有水印文字,正文完整。
🧩 常见问题:现象、原因、解法
1. 批量任务跑得很慢。现象:一张图要几秒,几十个文件排到怀疑人生。 原因:离线引擎走的是 CPU 单线程处理,速度受硬件限制,这是离线方案换取不联网的代价。 解法:分批跑;任务排在空闲时段,并勾选完成后自动关机/待机;长任务交给命令行或HTTP接口后台执行,界面别盯着。
2. 大图识别后内容缺了、字也不全。现象:超长图只识别出一部分,或整行文字缺字。 原因:原图边长超过默认上限,被压缩后再送进引擎,细节丢了。 解法:在"设置 → 文字识别 → 限制图像边长"里调高数值再重跑。
3. 多栏文档的结果顺序是乱的。现象:左右两栏的文字被拼成了一行接一行的乱序段落。 原因:用的是"不做处理"或栏数不匹配的方案,原文顺序没被重排。 解法:按实际版式换方案——多栏排版选"多栏-按自然段换行",普通文档选"单栏-按自然段换行",换完立刻看记录页对比。
4. 竖排繁体文档识别不全。现象:从右往左排的繁体字,有的整列没被识别。 原因:识别语言库选的是简体中文,引擎本身不覆盖竖排繁体。 解法:识别语言改选繁体中文,配合排版解析方案的竖排方向自动处理。
写在最后
Umi-OCR 的价值很朴素:离线、免费、批量没有数量上限,截屏到 PDF 都在一个软件里。想继续深入,命令行手册和HTTP接口手册是入口。打开批量OCR标签页,先拿十个文件试一把,比读十篇教程都直接。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考