ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Umi-OCR离线OCR软件怎么用?从截图识别到扫描版PDF提取文字的完整实测

Umi-OCR离线OCR软件怎么用?从截图识别到扫描版PDF提取文字的完整实测 Umi-OCR离线OCR软件怎么用从截图识别到扫描版PDF提取文字的完整实测【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR上周我靠 Umi-OCR 这款免费离线OCR软件把 300 多张扫描书页照片和一本 500 多页的旧 PDF 全变成了能检索、能复制的文字全程没碰网络。这篇文章不罗列功能表只讲我把它用在屏幕截图、成堆照片、扫描版 PDF 三类真实材料上的完整过程以及踩过的坑。免费的离线OCR软件靠谱吗三条理由让我安心用下去先回答最现实的问题免费的会不会偷偷上传我的数据两周用下来它的离线是落到了实处的。第一识别全部在本地由内置离线引擎完成断网照常跑图片一张都不用出机器第二代码全部开源介意隐私的可以git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR自己翻源码验证第三内置多国语言识别库中文、英文、日文切换着识别不用联网下载任何额外模型。缺点当然也有。离线引擎对手写体和低清老照片的识别率确实比不了云端大厂。但对我这种资料见不得光的用户来说离线是刚需牺牲一点极限准确率完全可以接受。真人的痕迹来自我踩过的一个坑识别一张超长论文截图时后半段文字整段丢了。后来在设置里找到限制图像边长默认值卡住了超大尺寸图片把这个数值调高之后才正常——这类问题软件自带的说明里都能查到答案。离线OCR软件怎么安装解压即用5分钟跑通截图识别文字下载发行包时注意区分两种文件.7z需要解压软件.7z.exe是自解压包没装压缩工具的电脑也能直接双击。解压完进文件夹双击Umi-OCR.exe启动全程没有安装步骤。首次打开会按电脑系统语言自动显示对应界面我一行设置都没动。主界面是一排标签页截图OCR、批量OCR、文档识别、二维码、全局设置界面语言和主题都可以在全局设置里改。我的习惯是先把右上角的锁点上锁定标签页日常操作不会手滑关掉工作页。最短路径是打开截图OCR页按预设的截图快捷键唤起取景框框住目标松手右侧记录栏立刻出结果。我试过三种输入方式屏幕框选、复制图片直接粘贴、把本地图拖进窗口都能跑。真正拉开体验差距的是排版解析方案识别代码截图选单栏-保留缩进行首缩进和行内空格都照原样保留复制进编辑器不用重排读多栏论文选多栏-按自然段换行左右栏按阅读顺序输出不会交叉错乱。Umi-OCR能干什么三个真实场景跑一遍截图识别一块区域能出多少活单张截图只是热身。右侧记录栏支持划选多条记录一起复制左侧图片预览也能直接用鼠标划选文字两处都很顺手。识别一段带嵌套缩进的 Python 代码时右侧输出的缩进和空格跟原图一一对应直接粘进编辑器就能跑——这种细节多数在线OCR服务是不做的。批量图片文字识别300张照片一次跑完相册里 300 多张书页照片一张张截显然不现实。批量OCR页把图片全拖进任务列表点开始任务剩下的交给进度条。支持 jpg、png、webp、bmp、tif 等常见格式数量没有上限跑完能导出 txt、jsonl、md、csvExcel四种格式。我给同事整理资料时导过一次 Excel直接省掉一步人工录入。批量任务里有个容易被忽略的隐藏功能忽略区域。我的照片右上角总有拍摄时间水印不处理的话识别结果里会混进一堆2024-05-12。在忽略区域编辑器里按住右键把水印可能出现的位置框起来任务执行时这些区域整体被跳过结果干净多了。注意只有完全落在框内的文本块才会被忽略所以框要画得大一些把水印所有可能出现的位置都包进去。扫描版PDF提取文字500页变成可搜索的文档如果说批量是量大那扫描版 PDF 就是硬骨头。那本 500 多页的书没有文字层翻页等于看照片找一个术语只能一页页翻。文档识别页支持 pdf、xps、epub、mobi、fb2、cbz 等格式。对扫描件做完 OCR输出的是双层可搜索PDF——原图在底透明文字浮在上面。成品既能像原书一样翻页看又能全文搜索、划词复制。我把一个术语丢进搜索框几秒内相关段落全部跳出来。这里同样用得上忽略区域几百页的书每页页眉页脚都印着书名和页码不排除的话正文会被大量重复文字污染。提前画好忽略框输出立刻干净。几个大文件还能排队处理配合任务完成后的自动关机睡前挂上就行。用了两周才发现的 3 个细节想做自动化的人软件开放了命令行和 HTTP 接口umi-ocr --screenshot直接截屏识别umi-ocr --path传图片或文件夹批量处理HTTP 接口还能把 OCR 能力嵌进自己的小工具命令行手册和 HTTP接口手册 就放在项目的 docs 目录里。二维码页是双向的截图、粘贴、拖图都能扫码支持一图多码和 19 种码制协议反过来输入文本也能直接生成二维码图片纠错等级可调。界面本地化也用心简体中文、繁体中文、英文、日文等随系统自动切换也能在 全局设置 里手动改常看英文资料的人切过去毫无压力主题和文字大小可以一起调。适合谁、怎么上手写在最后的实测总结半个月用下来最打动我的三点完全离线资料全程不离开本机解压即用连安装步骤都省了批量能力扎实图片和 PDF 都能成批处理。免费的工具很多但能把离线、开源、批量三件事凑齐、还长期维护的确实不多。如果你手头也压着扫描件、课件截图或旧 PDF与其对着识别工具一张张折腾不如现在就花十分钟试试下载发行包→解压→打开截图OCR页按快捷键框一块区域。当第一段文字出现在右侧面板时你大概率会和我一样默默把收藏夹里那个在线OCR网站删掉。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进