扫描件只能看不能复制?用Umi-OCR双层PDF一键转可搜索文档
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
小李对着上百页的扫描版合同发愁:明明满纸是字,搜索却一无所获,想复制更是天方夜谭。这大概是所有资料整理者的共同噩梦。好在有 Umi-OCR——一款免费开源、可离线运行的OCR文字识别工具,能把扫描件一键转换成可搜索、可复制的双层PDF,让纸上文字真正为你所用。
它到底能干什么:Umi-OCR 核心能力速览
一句话概括,Umi-OCR 就是一个"把图片和扫描件里的文字变成真正的文字"的本地工具箱。它不联网、不收费、解压即用,把 OCR 最常用的场景全部装进同一个软件:
- 截图OCR:快捷键框选屏幕任意区域,立刻识别文字
- 批量OCR:一次拖入几百张图片,任务完成还能自动关机
- 文档识别:把 PDF、XPS、EPUB 等扫描件转成双层可搜索PDF
- 忽略区域:框掉水印、页眉页脚,识别结果更干净
- 二维码:支持扫码、生码,兼容 19 种码制
- 多语言:内置简繁中文、英、日、俄等多国语言库,界面同样可切换语言
它的核心价值可以浓缩成八个字:免费、离线、批量、可搜索。后面我们就沿着一条真实任务线,把它最大的亮点——双层PDF——完整走一遍。
实战主线:把档案室的扫描件变成可检索的电子档案
假设你手头有一批历史扫描件:合同、论文、古籍复印件,全是 PDF,页面上印着字,却既搜不到也复制不了。我们要做的,就是让它们"活"起来。
第一步:拿到软件,解压即用
Umi-OCR 不需要安装。下载压缩包后解压,双击Umi-OCR.exe(Linux 下运行umi-ocr.sh)就启动了。整个过程不联网、不注册,打开即是完整功能,这对处理涉密或敏感资料尤其友好——文字始终留在你自己的电脑里。
第二步:拖入扫描文档,让软件"读"一遍
在主界面点击"+"新建标签页,选择批量文档识别。把扫描 PDF 直接拖进窗口即可,它支持pdf, xps, epub, mobi, fb2, cbz等常见文档格式。这里值得留意的是:软件会先尝试提取文档自带的文字层,只有真正扫描成图片的页面才需要 OCR——能省的时间它绝不浪费。
第三步:输出设置里选"双层可搜索文档"
这是整个流程最关键的一步。在输出格式中选择双层可搜索PDF,它意味着生成的文件包含两个层:
| 层 | 内容 | 作用 |
|---|---|---|
| 底层 | 原始扫描图像 | 完整保留原文档的排版、图片、签章 |
| 顶层 | 透明的OCR文字层 | 支持搜索、复制、编辑 |
一句话理解:看起来还是原来的扫描件,但内核已经变成了可检索的文本。如果只是想要文字,也可以输出 txt、jsonl、md、csv 等纯文本格式。
第四步:让识别结果更干净的两个小设置
在开始前,建议顺手做两件事:一是按文档语言选对语言库(中文合同选简体中文,英文论文选英文),识别准确率立刻上一个台阶;二是在"忽略区域"里把页眉、页脚、水印框起来——这些干扰文字被排除后,正文识别会更清爽,搜索也不会被无关内容打扰。
第五步:点击开始,坐等收成
任务开始后,进度条、识别耗时、完成状态一目了然,几百页的文档也能一口气跑完,完成后还能设置自动关机。整个过程就跟批量处理图片一样顺滑:
第六步:验收成果
用任意 PDF 阅读器打开生成的双层PDF,按Ctrl+F输入关键词——那些当年只能靠肉眼翻找的文字,现在一键就能定位。复制粘贴出来的是干净文本,而不是乱码。扫描件的"只能看",到此变成了"可搜索、可复制、可引用"。
三个让识别更准的关键技巧
光会点按钮还不够,想让双层PDF里的文字"万无一失",下面三个技巧值得收藏。
技巧一:用"忽略区域"屏蔽水印和页眉页脚
扫描件往往带着页眉页码、机构水印甚至印章倒影。它们被识别进文字层后,既污染搜索结果,又浪费识别时间。在识别设置里打开忽略区域编辑器,按住右键把干扰区域框起来(框大一点、完全包裹),任务就会自动跳过这些区域。处理公司扫描件时,这是最实用的一招。
技巧二:开启"排版解析",多栏竖排都读得懂
很多扫描件是分栏排版,比如论文、报纸,如果按默认顺序识别,文字会左右穿插成一团乱麻。Umi-OCR 的排版解析功能就是为这种情况准备的:选择"多栏-按自然段换行",它会自动识别栏位、按正确顺序重组文本;识别代码截图还能用"保留缩进"方案,让空格和换行分毫不差。
技巧三:语言库选对,识别率翻倍
Umi-OCR 内置多种语言库,混合文档还能同时加载多个。中文文档用简体库、英文文档用英文库,比默认设置能明显减少错字。如果你的文档是繁体或日文,同样只需在设置里切换,界面语言和识别语言互不干扰。语言与主题等全局选项,都可以在"全局设置"页统一调整:
改造前后:同一份文档的两种命运
把效果放在一起看,差距一目了然:
| 对比项 | 改造前(扫描件) | 改造后(双层PDF) |
|---|---|---|
| 全文搜索 | ❌ 只能肉眼翻页 | ✅ 任意关键词秒定位 |
| 复制引用 | ❌ 复制即乱码 | ✅ 复制即干净文本 |
| 排版原貌 | ✅ 保留 | ✅ 同样保留 |
| 批量处理 | 逐页人工 | 一键成百上千页 |
Umi-OCR 的截图识别同样遵循"识别即所得"的逻辑:左边是原始截图,右边是识别出的文本,排版和顺序都对得上,你甚至可以右键直接复制代码、表格内容,这就是它能在日常工作中替代"手动打字"的原因:
高频问题快问快答
Q1:生成的双层PDF文件太大怎么办?原因:底层保留了高清扫描图,天然比纯文本大。 解决:处理前先压缩原始图片质量、降低输出分辨率,或用压缩工具对成品二次瘦身。
Q2:为什么有个别字搜不到?原因:OCR 识别率受原始图像清晰度影响,模糊、倾斜、光照不均都会造成误识。 解决:优先保证扫描清晰度;配合忽略区域排除干扰;必要时在"全局设置"中切换不同 OCR 引擎对比效果。
Q3:文档会被上传到服务器吗?不会。Umi-OCR 的识别引擎完全在本地运行,全程离线,断网也能用。这也是它适合处理合同、论文等敏感资料的底气所在。
Q4:几百页的大文件一次能处理完吗?能。批量文档识别没有页数上限,任务支持暂停与恢复,跑完还能自动关机,挂机一晚上也不怕。
进阶玩法:从"手动点按钮"到"自动化流水线"
学会了双击界面操作,还可以把 Umi-OCR 的能力接进自己的工作流:
- 命令行批处理:用命令行指令批量传入图片或文件夹,指定输出路径,适合脚本化定时任务。参见 docs/README_CLI.md
- HTTP 接口:把 OCR、二维码识别作为服务集成到自己的程序里,甚至支持远程调用。参见 docs/http/README.md 与 docs/http/api_doc.md
- 二维码两件套:截图即扫码、输入文字即生成二维码,19 种码制一次配齐
- 二次开发:项目完全开源,想研究引擎接入或改造界面,可执行
git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR获取源码,功能迭代动向可追踪 CHANGE_LOG.md
让每份"死文档"都有机会活过来
从 1967 年的第一张扫描件,到你的毕业论文、公司的陈年合同、图书馆里的古籍影像——它们不是没有价值,只是被锁在"只能看"的格式里。Umi-OCR 这个由社区用业余时间维护的开源项目,做的就是那把开锁的钥匙:免费,所以人人用得起;离线,所以数据永远属于自己;双层PDF,所以既留得住原貌,又接得住未来。
现在就打开一份你手头最头疼的扫描件试试吧。五分钟之后,你会惊讶于"能搜索"这三个字带来的踏实感——好的工具让工作更高效,而免费的好工具,让高效工作触手可及。
【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考