ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Umi-OCR 免费双层PDF转换:扫描文档批量变可搜索

Umi-OCR 免费双层PDF转换:扫描文档批量变可搜索 Umi-OCR 免费双层PDF转换扫描文档批量变可搜索【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR几十页的扫描版PDF翻着看没问题想复制一句话、搜索一个关键词却都做不到——文字以像素形式烙在图里搜不到也选不中。Umi-OCR 是免费、离线的 OCR 软件在文档识别页把扫描 PDF 批量转成双层可搜索文档原图保留底下垫一层透明文字复制搜索全解锁。十分钟跑通第一份双层可搜索 PDF先说结论解压即用没有安装向导。下载 v2.1.5 发布包仓库根目录就有Umi-OCR_Rapid_v2.1.5.7z解压后双击Umi-OCR.exe启动识别引擎装在本地断网也能跑。打开文档识别标签页把 PDF 拖进左侧文件列表一次拖几十个文件也没问题。右侧保存文件类型默认勾选layered.pdf 双层可搜索文档点开始任务单页通常一两秒。完成后打开输出文件用 CtrlF 搜一个文档里的词能命中就算成功。注意双层 PDF 的文字层不可编辑目标是可搜索、可复制不是可改字想要 Word 编辑稿那是另一个需求方向。三种输出格式怎么选保存文件类型里三个勾选框对应三种结果按需组合格式保留原图可搜索/复制体积适合双层可搜索 PDF是能较大档案、合同要原貌又要可检索单层纯文本 PDF否能最小只关心文字内容txt 标准格式否能最小文字进下游系统只勾 txt 时输出含识别文字和页数信息批量转几十份再拼接也方便。双栏论文和代码扫描件不乱行排版解析方案决定导出文本是能读还是好读。默认多栏-按自然段换行会自动识别分栏布局、还原阅读顺序双栏论文、报纸基本不用动它。特殊情况扫描版代码文档换单栏-保留缩进保留行首缩进和行中空格一行都不想断选多栏-无换行。识别语言要跟着文档走中英混排明确选含英文的配置准确率提升肉眼可见。页眉页脚怎么排除每页顶部的页眉、底部的页码会混进正文。文档识别页右侧点忽略区域按住右键在预览图上画矩形框框内的整块文字会被丢弃。框要画大一点把页眉可能出现的范围整个包住——只框到半个字的那一块文字会原样保留。配合忽略区域生效的页数范围负数表示倒数第 X 页超长文档可以只让排除规则在特定页生效。批量 OCR 图片页也有同样的忽略区域批量截图里的水印、LOGO 可以一并去掉。加密 PDF 的文档密码怎么填带密码的 PDF 不填密码任务会一直卡在等待状态。上传时填密码参数HTTP 接口里叫password填对之后一切正常。文件本身损坏、或插件缺失也会卡住排查见最后一节。批量转换整个文件夹HTTP 接口文件多到论批交给自动化。Umi-OCR 自带 HTTP 服务全局设置里默认允许、端口1224仅本地回环不经过网卡。文档识别流程四步上传 → 轮询状态 → 取下载链接 → 清理任务requests.post(f{SERVER}/api/doc/upload, files{file: f}) # 1 上传 requests.post(f{SERVER}/api/doc/result, json{id: task_no}) # 2 轮询至 is_done requests.post(f{SERVER}/api/doc/download, json{id: task_no, file_types: [pdfLayered]}) # 3 生成双层PDF完整参数见 docs/http/api_doc.md仓库里附了可直接跑的示例api_doc_demo.py和 Web 版api_doc_demo.html。get_options接口能查当前引擎的全部参数定义适合用它动态生成前端表单。命令行模式则覆盖截图 OCR、批量图片与二维码场景见 docs/README_CLI.md。转完效果不对先查版本和日志⚠️ 排查顺序固定先看版本号再看日志v2.1.5 起保存在UmiOCR-data/logs。文字和图像错位旋转页面的坐标问题在 v2.1.2、v2.1.5 集中修过#785旧版先升 v2.1.5 再试仍不对就把内容提取模式换成整页强制OCR。任务卡住加密 PDF 没填密码、文件损坏、文档识别插件缺失按这三样查。大批量吃满内存识别引擎默认把内存压在系统总量一半以内低配机器在全局设置里调低线程数和内存上限宁慢勿崩。截图闪烁、界面错位把渲染器从显卡加速换成其他方案一般就好。另外双层 PDF 就是可编辑文档这个误解值得再说一次它垫的是不可编辑的透明文字层能搜能抄不能改字。下一步下载 v2.1.5 解压挑一份最头疼的扫描 PDF 按上面的流程跑一遍用 CtrlF 验证搜索没问题后把最外层那个文件夹直接拖进文档识别页再开一个 HTTP 轮询脚本把剩下的排进队列。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进