Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
图片里的文字,选不中、复制不了,一个字符一个字符敲进文档是折磨。Umi-OCR 是一款免费、完全离线的 OCR 工具:识别引擎整套装在你的电脑上,截个屏就能拿到文字,图片不离开硬盘,不注册、不上传。Windows 与 Linux x64 都支持。
从解压到认出第一段字
Umi-OCR 是解压即用的软件,三步跑起来:
- 从发布页拿
.7z压缩包;电脑没装压缩软件就拿.7z.exe自解压包,双击自动解开。 - 放到任意目录,例如
D:\Tools\Umi-OCR。 - Windows 双击Umi-OCR.exe,Linux 运行
umi-ocr.sh。
首次启动,界面语言按你的系统自动切换,想改随时去全局设置 → 语言/Language。主窗口由标签页组成:截图OCR、批量OCR、文档识别、二维码、全局设置,点哪个用哪个。打开截图OCR标签,用快捷键唤起截图框圈住几个字,识别出的文字立刻出现在右侧记录栏——这就是你的第一份产出。
提醒:如果你打算用命令行或 HTTP 接口,入口必须是主程序 Umi-OCR.exe,备用启动器 RUN_GUI.bat 不保证支持;HTTP 服务默认开启且只监听本地环回,一般不用动。
把屏幕上的字抓下来 📷
最高频的场景。打开截图OCR标签 → 快捷键唤起截图框 → 框住目标文字 → 结果落到右侧记录面板。两个容易漏掉的入口:
- 在别处复制一张图片(比如聊天窗口的图),回到 Umi-OCR 直接粘贴,照样识别。
- 记录面板里的文字可直接改错,还能划选多条记录一起复制(Ctrl+A选中全部),整理完直接拿走,不用跳去别的编辑器。
引擎吐出来的其实是"散装纸片"(文本块),你读到的顺序由排版解析后处理决定,像编辑把纸片归拢好再交给你。两栏、三栏的论文书籍选多栏-按自然段换行,覆盖面最广;代码截图切单栏-保留缩进,行首缩进和行中空格基本保住。竖排文字(从右到左)各方案都会自动处理,前提是识别语言库本身支持。
提醒:命令行里 截图、粘贴、路径 三类任务的参数都取"截图OCR"标签页的设置,如果你不希望命令行任务弹出主窗口,先在那个标签页关掉对应选项。
几百张图一次归档
切到批量OCR标签,把图片直接拖进窗口→ 点开始任务→ 右栏逐张给出耗时、置信度和结果。收 jpg、jpeg、png、webp、bmp、tif、tiff,数量没有上限,几百张一次进队。跑完可导出txt、jsonl、md、csv四种格式,csv 用 Excel 直接打开;跑整夜的任务可设任务完成后自动关机/待机,v2.1.2 起还支持暂停任务,不退出软件,待机后接着跑。
高频痛点是图片角落的水印、LOGO 每次都混进结果。忽略区域就是为此做的:从批量页右栏设置进入忽略区域编辑器,按住右键在图片上画多个矩形框,像贴条一样把不想被看到的位置盖住,这些区域的文字识别时自动排除。
避坑:只有"整个文本块完全落在框内"才会被忽略,不是按单个字符。框画小一圈,跨着框边的文字照样混进结果——宁可大一点,把水印可能出现的位置全包进去。
让扫描件 PDF 能搜到 📄
文档识别标签收pdf、xps、epub、mobi、fb2、cbz,典型输入就是扫描版 PDF。底层走三步:先把文档拆成"现成文本层"和"需要识别的图片层"(底层依赖 PyMuPDF),扫描页交给本地引擎逐页识别,最后按阅读顺序重组,输出你指定的格式。
两种产物按需选:
- 双层可搜索 PDF:底层是原图,上层是透明文字,外观和扫描件一模一样,文字却能搜索、复制、划线,适合归档旧合同、数字化论文。
- 单层纯文本 PDF(v2.1.2 起支持):不带图片,体积小、好编辑。
提取模式默认优先提取 PDF 自带文本层(快、零识别误差),纯扫描页才切 OCR;还能按页码范围设忽略区域排除页眉页脚,并设置任务完成后自动关机/休眠。
避坑:手里有旋转过方向的扫描件,请升到 v2.1.5 以上——修复过提取 PDF 自带文本时未考虑页面旋转导致的错位问题。
顺手:扫二维码和生成二维码
二维码标签干两件事:扫码和生成。截图、粘贴或拖入图片,读出其中的二维码、条形码,支持一图多码和 QRCode、Code128、EAN13 等 19 种协议;输入文本即可生成二维码图片,大小和纠错等级可选。
出状况时:症状 → 开关速查
| 症状 | 可能原因 | 往哪拧 |
|---|---|---|
| 长图、大图识别不全 | 默认"限制图像边长"为平衡速度内存做了压缩 | 标签页设置 →文字识别→限制图像边长调高 |
| 代码截图缩进全丢 | 排版解析方案不匹配 | 文本后处理 →单栏-保留缩进 |
| 水印文字还在混进结果 | 忽略区域框没包全 | 忽略区域编辑器里把矩形画大重画 |
| 截图时屏幕闪烁、UI 错位 | 显卡渲染兼容问题 | 全局设置 →界面和外观→渲染器,换方案或关硬件加速 |
| 内存占用偏高 | 引擎默认线程配置 | v2.1.4 起 PaddleOCR 已限在系统内存一半以内,插件配置里再调低线程数 |
| 几万个文件的文件夹加载卡 | 预览尚未加载完 | v2.1.5 起异步加载,等进度走完再操作 |
问答速查
识别与结果
- 识别日文/英文不准怎么办?识别语言库和界面语言是两回事,在各标签页"文字识别"设置里单独选,或下载对应语言库。
- 识别效果不理想?先在全局设置切换 OCR 插件试试:RapidOCR 兼容性好,PaddleOCR 速度稍快,往往比调别的参数见效快。
界面与语言
- 界面语言怎么换?全局设置 → 语言/Language,支持简中、繁中、英语、日语、俄语、葡萄牙语等,首启跟随系统。
- 怎么防止误关常用标签?标签栏右上角点击锁定标签页。
任务与调用
- 批量任务能中途暂停吗?v2.1.2 起支持暂停任务,只要不退出软件,待机/休眠后可恢复。
- 命令行没反应?确认全局设置里 HTTP 服务已开启(默认开启),且入口用的是 Umi-OCR.exe 而不是备用启动器。
进阶:把 Umi-OCR 挂到快捷键上 ⚡
命令行入口就是主程序,指令支持简写(--screenshot可写--sc),通信走本地 HTTP 服务,默认开启、只监听本地环回。三条可直接复制的例子:
umi-ocr --screenshot --clip umi-ocr --path "D:/扫描件.png" --output result.txt umi-ocr --qrcode_create "你好" "D:/qrcode.png" 256第一条截屏识别并把结果直接进剪贴板;第三条生成一张 256 像素的二维码。想写脚本的话,本地服务还开放了图片 OCR、文档识别、二维码三类接口,见 HTTP接口手册 与 文档识别接口;命令行全参数在 命令行手册 里。
免费、开源、完全离线,Umi-OCR 用截图、批量、文档识别三条主线,覆盖从随手摘抄到整夜归档的绝大多数场景。现在就可以下载解压,下次再遇到"复制不了"的字,先截个图,不用上传。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考