ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Umi-OCR离线文字识别全攻略:一张截图开启的无网络OCR之旅

Umi-OCR离线文字识别全攻略:一张截图开启的无网络OCR之旅 Umi-OCR离线文字识别全攻略一张截图开启的无网络OCR之旅【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR你是否遇到过这样的场景开会时想把PPT里的文字快速记下来却发现会议室的电脑没联网在线OCR网站全部打不开或者手头有一批扫描版PDF合同要转成可编辑文本一个个手动敲键盘敲到怀疑人生。如果你有类似的经历那么这款名为Umi-OCR的开源免费离线OCR软件很可能会成为你电脑里离不开的小工具。它支持截屏识别、批量图片识别、PDF文档识别还能扫描和生成二维码全程无需联网解压就能用。从一个常见痛点说起为什么OCR工具需要离线先说个真实的小故事。有位做财务的朋友每月都要把几十张供应商发来的PDF扫描件里的金额和发票号录入系统。他之前用在线OCR网站结果遇到两次麻烦一次是网络抽风导致批量任务中途失败另一次是对方网站突然改版上传按钮都找不到了。后来他换成了Umi-OCR用一句话总结体验就是装在本地随叫随到。这正是这款软件最核心的定位——离线。所有识别都在你自己的电脑上完成不经过任何第三方服务器。这意味着三件事✅隐私安全合同、发票、论文等敏感材料不会上传到云端✅稳定可靠断网、弱网环境完全不受影响✅零成本软件完全免费也没有按次收费、会员加速等套路第一步3分钟跑通第一个识别任务Umi-OCR是绿色软件不需要安装。下载压缩包解压后双击Umi-OCR.exe就能启动。第一次打开时软件会根据你电脑的系统语言自动切换界面语言也可以在全局设置里手动调整。接下来完成你的第一次OCR只需要三步打开截图OCR标签页按下截图快捷键框选屏幕上要识别的区域松开鼠标文字立刻出现在右侧记录栏里就这么简单。识别结果可以点击复制也可以直接在记录面板里编辑修改。如果你习惯在其他地方复制图片也支持直接粘贴进来识别——从浏览器、聊天工具里复制的图片都能直接处理。 小技巧截图OCR页面支持重复上一次截图区域的快捷键处理同一位置反复出现的内容比如视频字幕时非常省事。识别完了还要排版聊聊文本后处理用过OCR的人都有体会识别准确率只是第一步文字顺序对不对才是能不能用的关键。尤其是多栏排版的论文、杂志如果识别结果东一句西一句还不如不识别。Umi-OCR内置了一套排版解析方案专门负责把识别出的文字块按阅读顺序重新排好。它就像一位排版员帮你把散落的文字碎片整理成通顺的段落。常用的几种方案包括方案适用场景多栏-按自然段换行论文、报刊等分栏排版大多数场景的首选多栏-总是换行 / 无换行需要每句换行或强制合并成一行单栏-保留缩进代码截图保留行首缩进和行中空格不做处理直接用OCR引擎的原始输出其中单栏-保留缩进是程序员朋友的最爱。把代码截图丢进去识别结果能保留缩进结构配合右侧预览对照几乎可以当文字版代码用。批量处理几百张图片一次搞定截图OCR适合随手识别而当你面对成百上千张图片时就该轮到批量OCR登场了。批量OCR标签页支持jpg、png、webp、bmp、tif等常见图片格式可以一次性拖入几百张图片没有数量上限。识别结果支持输出为txt、jsonl、md、csv等格式其中csv格式默认保存为ansi编码直接用Excel打开也不会乱码。这里有一个容易被忽略但非常好用的功能——忽略区域。举个例子你有一批截图每张图的右上角都有个水印logo。如果不处理每一页识别结果里都会混进水印文字后期清理麻烦得要命。这时候只需要在批量OCR页面的设置里打开忽略区域编辑器按住右键在水印可能出现的位置画一个矩形框启动任务框内的文字就会被自动跳过需要提醒的是忽略区域是按整个文本块生效的所以矩形框尽量画大一些把水印所有可能出现的位置都包进去。这个功能同样适用于排除页眉页脚、广告栏等重复元素处理扫描版论文时尤其实用。批量OCR还支持任务完成后自动关机/待机。晚上睡觉前把几百张图片丢进去第二天早上直接收结果电费都省了。PDF文档识别扫描件的转正之路如果说截图和批量识别解决的是图片问题那么文档识别解决的是更让人头疼的PDF问题。市面上很多PDF其实是假PDF——本质是一张张扫描图片里面的文字根本无法复制、搜索和编辑。Umi-OCR的文档识别功能正是为这类文件而生。它支持pdf、xps、epub、mobi、fb2、cbz等多种文档格式。针对每页文档既有图片又有文字的复杂情况提供了四种内容提取模式混合OCR/原文本默认能直接拷贝的文本就用原文本扫描图片区域才走OCR速度快、效果好整页强制OCR不管有没有原生文本全部重新识别适合需要统一处理风格的情况仅OCR图片只识别文档里的图片部分仅拷贝原有文本完全不识别只提取文档自带的文字层识别结果可以输出为多种格式其中最值得关注的是双层可搜索PDFpdfLayered。这种PDF的每一页由底层扫描图 顶层透明文字层组成用眼睛看还是原来的样子但文字可以搜索、可以复制、可以选中。一份几百页的扫描件转成双层PDF后就能像普通电子书一样全文检索了。当然遇到加密的PDF也可以填写密码后识别。配合忽略区域功能还能把每页的页眉页脚一次性排除掉保证输出文本的干净度。顺手一提二维码模块是个加分项Umi-OCR还内置了完整的二维码功能分为扫码和生成码两部分。扫码支持截图、粘贴、拖入图片等方式可以一次识别图片中的多个二维码或条形码兼容19种编码协议包括常见的QRCode、Code128、EAN13等。生成码则支持自定义文本内容和纠错等级参数调整后预览会自动刷新。对于普通用户这可能是个锦上添花的功能但对于需要批量处理条码的仓库管理、图书管理场景相当于白送了一个离线条码工具。进阶玩法让Umi-OCR帮你打工如果你只会点鼠标操作那Umi-OCR的使用率可能只发挥了三成。它还有两套自动化接口能让其他程序直接指挥它干活。命令行调用Umi-OCR支持命令行调用适合写脚本实现自动化。常用的指令包括# 弹出/隐藏主窗口 umi-ocr --show umi-ocr --hide # 鼠标截屏识别 umi-ocr --screenshot # 指定范围自动截屏无需鼠标划选 umi-ocr --screenshot screen0 rect50,100,300,200 # 识别指定图片或文件夹支持多个路径 umi-ocr --path D:/img1.png D:/image/test # 识别结果输出到文件 umi-ocr --path D:/img1.png --output result.txt所有指令都支持简写比如--screenshot可以写成--sc。配合其他工具还能实现更多骚操作比如用快捷键触发指定区域截图。对于开发者来说甚至可以通过--call_py、--call_qml等高级指令直接调用软件内部的模块函数——当然这需要阅读源码才能玩得转。HTTP接口如果你写的是Python、Web等应用更推荐用HTTP接口。Umi-OCR默认在本机127.0.0.1:1224端口提供HTTP服务仅本地回环不会暴露到外网。以PDF文档识别为例调用流程分为五步import requests, json # 1. 上传文件获取任务ID with open(document.pdf, rb) as f: resp requests.post( http://127.0.0.1:1224/api/doc/upload, files{file: f}, data{json: json.dumps({doc.extractionMode: mixed})} ) task_id resp.json()[data] # 2. 轮询任务状态 while True: result requests.post( http://127.0.0.1:1224/api/doc/result, json{id: task_id, is_data: True} ).json() if result.get(is_done): break # 3. 生成并下载双层PDF dl requests.post( http://127.0.0.1:1224/api/doc/download, json{id: task_id, file_types: [pdfLayered]} ).json()完整的接口文档可以在项目的 docs/http/api_doc.md 中找到包括参数查询、任务状态、结果下载、任务清理等各个环节的详细说明。硬件不同怎么调优一份参数参考Umi-OCR的几个关键参数直接影响识别速度和精度合理配置能明显提升体验参数作用低配(4GB)标准(8GB)高性能(16GB)limit_side_len 限制图像边长边长超过该值的图片会被压缩值越大精度越高、越慢96019202880并行任务数同时处理的图片数124方向纠正 cls识别倾斜/倒置文本会略微降低速度关闭开启开启识别长图或大图时如果提示图片太大记得在设置里调高限制图像边长的数值。另外如果截图时出现画面闪烁、UI错位的情况可以在全局设置→界面和外观→渲染器里切换渲染方案或关闭硬件加速。版本更新带来哪些值得关注的变化根据项目的 CHANGE_LOG.md 记录Umi-OCR近年来持续迭代几个关键版本引入了重要功能v2.1.0新增批量文档识别支持PDF、EPUB等格式v2.1.2支持输出单层纯文本PDF批量任务支持暂停/恢复v2.1.3兼容Linux平台新增HTTP文档识别接口v2.1.5新增日志机制支持--reload重新加载配置值得一提的是最新版优化了异步加载机制即使一个文件夹里躺着数万个子文件也能流畅加载并预览进度。软件还支持多国语言界面中、英、日、俄、葡等并提供了亮/暗多套主题。如果你对多语言界面感兴趣可以在全局设置里一键切换常见问题速查QUmi-OCR需要安装吗需要联网吗都不需要。解压后直接双击 exe 启动全程离线运行。Q识别结果不理想怎么办先看排版方案是否选对多栏内容选多栏方案代码选保留缩进。再检查限制图像边长是否过小以及是否开启了方向纠正。低分辨率图片可以适当放大后再识别。Q支持哪些语言识别内置多语言模型库包括简繁中文、英文、日文、韩文、俄文等可在设置中切换语言模型。Q能批量处理PDF吗可以。批量文档识别支持一次拖入多个PDF/EPUB等文件输出双层PDF、单层PDF、txt、csv等格式。Q开源吗怎么获取源码完全开源免费。想要研究或二次开发的开发者可以通过以下命令获取源码git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR写在最后回到开头那个财务朋友的故事。他现在的工作流是收到扫描件PDF → 拖进Umi-OCR → 批量转双层PDF → 全文搜索定位关键数据 → 复制录入。整个流程从原来的一整天缩短到半小时。工具的意义不在于功能列表有多长而在于它能否在你最需要的时候不添麻烦地帮你把事办了。Umi-OCR恰好就是这样一款工具免费、离线、解压即用功能覆盖截图、批量、PDF、二维码四大场景还能通过命令行和HTTP接口融入自动化流程。如果你也在为图片里的文字提取不出来而烦恼不妨下载一份试试——反正它不吃网络、不收钱试错成本几乎为零。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进