
Umi-OCR免费离线文字识别的三种用法从截图到脚本集成【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源的离线 OCR 软件截个屏就能把屏幕上的文字变成可复制的文本也能把几百张扫描图片和 PDF 文档批量转成可搜索的文档。识别全程在本地完成图片不出你的电脑。软件围绕四个标签页组织功能截图 OCR、批量 OCR、文档识别PDF和二维码外加一个全局设置页负责语言、主题、引擎插件和 HTTP 服务开关。截图文字识别代码截图怎么保留缩进截图 OCR 页打开后按软件预设的快捷键可在界面中修改框选屏幕区域左侧显示图片预览右侧是识别记录支持直接编辑和划选多条记录批量复制。除了截屏你也可以在别处复制图片后粘贴进来识别。识别结果是否好用关键在排版解析方案它决定引擎吐出来的文字块按什么顺序、什么换行规则拼成最终文本。常用取值如下参数值tbpu.parser界面名称适用场景multi_para默认多栏-按自然段换行一般文档自动区分多栏布局multi_line多栏-总是换行清单、条目类内容single_code单栏-保留缩进代码截图保留行首缩进与行中空格none不做处理保留引擎原始输出提取代码片段时选single_codePython、Shell 这类对缩进敏感的代码能保持原样普通文章用默认的multi_para即可。以上方案都能自动处理横排和竖排竖排还需引擎本身支持。批量识别扫描件怎么配置水印页脚怎么排除批量 OCR 页用于一次性处理本地图片输入支持jpg、jpe、jpeg、jfif、png、webp、bmp、tif、tiff没有数量上限几百张一起丢进去也没问题结果可保存为txt、jsonl、md、csv(Excel)四种格式还能在任务完成后自动关机或待机。扫描件常带固定位置的水印或页眉逐张手动删太累。批量页提供了忽略区域编辑器按住右键在预览图上画矩形框任务执行时这些区域里的文字会被整体跳过。有两个细节要注意矩形框尽量画大把水印可能出现的所有位置都包进去被忽略的单位是整个文本块而不是单个字符——只有完整落在框内的文本块才会被丢掉。所有界面参数都会写入./UmiOCR-data/.settingsini 格式手动修改后可以用umi-ocr --reload重新加载v2.1.5 以上支持ocr.language models/config_chinese.txt ocr.limit_side_len 2880 tbpu.parser multi_para tbpu.ignoreArea []其中ocr.limit_side_len默认 960会把更大的图压缩后再识别以换取速度遇到像素超高的长图或大图把它调到 2880、4320 甚至无限制精度会更好。不打开界面也能跑批量任务主程序Umi-OCR.exe就是命令行入口需开启 HTTP 服务默认已开umi-ocr --path D:/scans -- result.txt--path后面可以跟多个图片或文件夹路径文件夹会递归搜索其中所有图片--表示追加输出换成--output result.txt则是覆盖写入。PDF 文档识别怎么生成可搜索的双层 PDF文档识别标签页处理的是文件而非图片支持pdf、xps、epub、mobi、fb2、cbz格式。它的作用是把扫描件 OCR 成文字或提取文档里原有的文本最终输出双层可搜索 PDF——保留原始版式的同时让内容可以被 CtrlF 搜到和选中。这一页同样支持忽略区域用来排除每页固定的页眉页脚文字任务结束后也可以设置自动关机/休眠适合夜里丢一整叠文档进去跑。脚本里怎么调用 OCR命令行与 HTTP 接口如果你要把识别能力嵌进自动化流程Umi-OCR 提供了两条通道命令行和 HTTP 接口二者共用同一个前提——全局设置中的 HTTP 服务保持开启默认开启主机选仅本地即可通信只在本地环回进行。命令行侧除了前面提到的--path还有几个常用指令--screenshot --clip截屏并把结果直接送进剪贴板--qrcode_read D:/xxx.png识别二维码--qrcode_create 文本 out.jpeg生成二维码图片。所有指令支持前缀简写比如--screenshot可写成--sc。注意多图识别耗时长一条命令结束前别输入下一条。HTTP 接口侧默认端口 1224全局设置可改。先用GET /api/ocr/get_options查询当前引擎支持的全部参数及默认值再向POST /api/ocr发送图片{ base64: iVBORw0KGgo...(图片的Base64无需前缀), options: { ocr.language: models/config_en.txt, tbpu.parser: single_code, data.format: text } }options可选项包括ocr.language语言模型默认简体中文、ocr.cls纠正文本方向默认关闭开启可能降低速度、tbpu.ignoreArea忽略区域格式为[[左上x,y],[右下x,y]]数组、data.formatdict带位置信息的原始字典或text纯文本。官方手册还提醒后端对并发支持较差尽量避免并发调用长时连续调用偶发ECONNREFUSED时重新发起请求即可。引擎怎么切换界面语言和主题在哪调软件自带两套离线引擎插件安装包默认内置 RapidOCR兼容性好PaddleOCR 版本速度稍快。两个安装包不要同时装快捷方式会互相覆盖装好后可以在全局设置里通过插件随时切换引擎。全局设置页还集中了这些选项一键添加快捷方式或开机自启、界面语言简中、繁中、英语、日语等、亮/暗主题、字体与字号。如果截屏时出现闪烁或 UI 错位多半是显卡加速渲染的问题在界面和外观 → 渲染器里换一个渲染方案或关闭硬件加速即可。完整参数与示例见 命令行手册 和 HTTP 接口手册界面改过的参数都会保存在./UmiOCR-data/.settings手动编辑后用umi-ocr --reload刷新引擎扩展插件与 Python 源码位于UmiOCR-data/plugins/和UmiOCR-data/py_src/【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考