news 2026/8/31 10:27:42

Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法

Umi-OCR 离线 OCR 实战指南:屏幕、批量图片、扫描件 PDF 的取字方法

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

图片里的文字,选不中、复制不了,一个字符一个字符敲进文档是折磨。Umi-OCR 是一款免费、完全离线的 OCR 工具:识别引擎整套装在你的电脑上,截个屏就能拿到文字,图片不离开硬盘,不注册、不上传。Windows 与 Linux x64 都支持。

从解压到认出第一段字

Umi-OCR 是解压即用的软件,三步跑起来:

  1. 从发布页拿.7z压缩包;电脑没装压缩软件就拿.7z.exe自解压包,双击自动解开。
  2. 放到任意目录,例如D:\Tools\Umi-OCR
  3. Windows 双击Umi-OCR.exe,Linux 运行umi-ocr.sh

首次启动,界面语言按你的系统自动切换,想改随时去全局设置 → 语言/Language。主窗口由标签页组成:截图OCR批量OCR文档识别二维码全局设置,点哪个用哪个。打开截图OCR标签,用快捷键唤起截图框圈住几个字,识别出的文字立刻出现在右侧记录栏——这就是你的第一份产出。

提醒:如果你打算用命令行或 HTTP 接口,入口必须是主程序 Umi-OCR.exe,备用启动器 RUN_GUI.bat 不保证支持;HTTP 服务默认开启且只监听本地环回,一般不用动。

把屏幕上的字抓下来 📷

最高频的场景。打开截图OCR标签 → 快捷键唤起截图框 → 框住目标文字 → 结果落到右侧记录面板。两个容易漏掉的入口:

  • 在别处复制一张图片(比如聊天窗口的图),回到 Umi-OCR 直接粘贴,照样识别。
  • 记录面板里的文字可直接改错,还能划选多条记录一起复制(Ctrl+A选中全部),整理完直接拿走,不用跳去别的编辑器。

引擎吐出来的其实是"散装纸片"(文本块),你读到的顺序由排版解析后处理决定,像编辑把纸片归拢好再交给你。两栏、三栏的论文书籍选多栏-按自然段换行,覆盖面最广;代码截图切单栏-保留缩进,行首缩进和行中空格基本保住。竖排文字(从右到左)各方案都会自动处理,前提是识别语言库本身支持。

提醒:命令行里 截图、粘贴、路径 三类任务的参数都取"截图OCR"标签页的设置,如果你不希望命令行任务弹出主窗口,先在那个标签页关掉对应选项。

几百张图一次归档

切到批量OCR标签,把图片直接拖进窗口→ 点开始任务→ 右栏逐张给出耗时、置信度和结果。收 jpg、jpeg、png、webp、bmp、tif、tiff,数量没有上限,几百张一次进队。跑完可导出txt、jsonl、md、csv四种格式,csv 用 Excel 直接打开;跑整夜的任务可设任务完成后自动关机/待机,v2.1.2 起还支持暂停任务,不退出软件,待机后接着跑。

高频痛点是图片角落的水印、LOGO 每次都混进结果。忽略区域就是为此做的:从批量页右栏设置进入忽略区域编辑器按住右键在图片上画多个矩形框,像贴条一样把不想被看到的位置盖住,这些区域的文字识别时自动排除。

避坑:只有"整个文本块完全落在框内"才会被忽略,不是按单个字符。框画小一圈,跨着框边的文字照样混进结果——宁可大一点,把水印可能出现的位置全包进去。

让扫描件 PDF 能搜到 📄

文档识别标签收pdf、xps、epub、mobi、fb2、cbz,典型输入就是扫描版 PDF。底层走三步:先把文档拆成"现成文本层"和"需要识别的图片层"(底层依赖 PyMuPDF),扫描页交给本地引擎逐页识别,最后按阅读顺序重组,输出你指定的格式。

两种产物按需选:

  • 双层可搜索 PDF:底层是原图,上层是透明文字,外观和扫描件一模一样,文字却能搜索、复制、划线,适合归档旧合同、数字化论文。
  • 单层纯文本 PDF(v2.1.2 起支持):不带图片,体积小、好编辑。

提取模式默认优先提取 PDF 自带文本层(快、零识别误差),纯扫描页才切 OCR;还能按页码范围设忽略区域排除页眉页脚,并设置任务完成后自动关机/休眠。

避坑:手里有旋转过方向的扫描件,请升到 v2.1.5 以上——修复过提取 PDF 自带文本时未考虑页面旋转导致的错位问题。

顺手:扫二维码和生成二维码

二维码标签干两件事:扫码生成。截图、粘贴或拖入图片,读出其中的二维码、条形码,支持一图多码和 QRCode、Code128、EAN13 等 19 种协议;输入文本即可生成二维码图片,大小和纠错等级可选。

出状况时:症状 → 开关速查

症状可能原因往哪拧
长图、大图识别不全默认"限制图像边长"为平衡速度内存做了压缩标签页设置 →文字识别限制图像边长调高
代码截图缩进全丢排版解析方案不匹配文本后处理 →单栏-保留缩进
水印文字还在混进结果忽略区域框没包全忽略区域编辑器里把矩形画大重画
截图时屏幕闪烁、UI 错位显卡渲染兼容问题全局设置 →界面和外观渲染器,换方案或关硬件加速
内存占用偏高引擎默认线程配置v2.1.4 起 PaddleOCR 已限在系统内存一半以内,插件配置里再调低线程数
几万个文件的文件夹加载卡预览尚未加载完v2.1.5 起异步加载,等进度走完再操作

问答速查

识别与结果

  • 识别日文/英文不准怎么办?识别语言库和界面语言是两回事,在各标签页"文字识别"设置里单独选,或下载对应语言库。
  • 识别效果不理想?先在全局设置切换 OCR 插件试试:RapidOCR 兼容性好,PaddleOCR 速度稍快,往往比调别的参数见效快。

界面与语言

  • 界面语言怎么换?全局设置 → 语言/Language,支持简中、繁中、英语、日语、俄语、葡萄牙语等,首启跟随系统。
  • 怎么防止误关常用标签?标签栏右上角点击锁定标签页

任务与调用

  • 批量任务能中途暂停吗?v2.1.2 起支持暂停任务,只要不退出软件,待机/休眠后可恢复。
  • 命令行没反应?确认全局设置里 HTTP 服务已开启(默认开启),且入口用的是 Umi-OCR.exe 而不是备用启动器。

进阶:把 Umi-OCR 挂到快捷键上 ⚡

命令行入口就是主程序,指令支持简写(--screenshot可写--sc),通信走本地 HTTP 服务,默认开启、只监听本地环回。三条可直接复制的例子:

umi-ocr --screenshot --clip umi-ocr --path "D:/扫描件.png" --output result.txt umi-ocr --qrcode_create "你好" "D:/qrcode.png" 256

第一条截屏识别并把结果直接进剪贴板;第三条生成一张 256 像素的二维码。想写脚本的话,本地服务还开放了图片 OCR、文档识别、二维码三类接口,见 HTTP接口手册 与 文档识别接口;命令行全参数在 命令行手册 里。

免费、开源、完全离线,Umi-OCR 用截图、批量、文档识别三条主线,覆盖从随手摘抄到整夜归档的绝大多数场景。现在就可以下载解压,下次再遇到"复制不了"的字,先截个图,不用上传。

【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 10:27:22

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据

Firecrawl 完全指南:5 分钟把任意网页变成 LLM 就绪的数据 【免费下载链接】firecrawl The context API to search, scrape, and interact with the web at scale. 🔥 项目地址: https://gitcode.com/GitHub_Trending/fi/firecrawl 按这套流程走完…

作者头像 李华
网站建设 2026/8/31 10:27:17

408操作系统复习:抓住资源管理主线,攻克进程与内存高频考点

准备408统考的同学,操作系统这科很特别。它不像数据结构那样需要大量写代码,也不像组成原理那样细节密集,但它是四科里最容易让人“看懂了却做不对”的一门。很多人把操作系统知识点过了一遍,合上书发现脑子里只有进程、线程、页表…

作者头像 李华
网站建设 2026/8/31 10:27:14

NAJM 示例拆解:时尚品牌 editorial 排版与留白的 5 个关键细节

NAJM 示例拆解:时尚品牌 editorial 排版与留白的 5 个关键细节 【免费下载链接】hallmark Anti-AI-slop design skill for Claude Code, Cursor, and Codex. 项目地址: https://gitcode.com/GitHub_Trending/hal/hallmark NAJM 是 Hallmark 项目内置的一个时…

作者头像 李华
网站建设 2026/8/31 10:25:44

Agent Skills 实战:从提示词到可复用的大模型技能包

这次我们来看一个近期讨论度很高的方向:Agent Skills。很多人已经习惯用大模型写代码、写文档、做数据分析,但总觉得结果不稳定:同一个问题换一种问法,输出质量就明显波动。Agent Skills 要解决的问题,就是把这些“靠临…

作者头像 李华
网站建设 2026/8/31 10:23:07

llama.cpp AMD显卡快速部署完整指南

llama.cpp AMD显卡快速部署完整指南 【免费下载链接】llama.cpp LLM inference in C/C 项目地址: https://gitcode.com/GitHub_Trending/ll/llama.cpp 你第一次运行 llama-cli 做本地推理,进度条却在加载模型前停住,日志里一行 "no GPU"…

作者头像 李华
网站建设 2026/8/31 10:23:00

基于YOLO的安全带检测系统实战:从数据标注到边缘部署

简介:本资源是一个基于YOLO算法的实时安全带检测系统完整实现,面向深度学习初学者、计算机视觉开发者及智能交通安防领域实践者,解决车辆驾乘人员未系安全带行为的自动识别与预警问题,适用于车载终端、驾校监管、共享汽车安全审计…

作者头像 李华