Umi-OCR 开源离线OCR软件使用指南:界面操作、文本后处理与命令行/HTTP集成
Umi-OCR 开源离线OCR软件使用指南界面操作、文本后处理与命令行/HTTP集成【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR本文以 Umi-OCR 项目的英文主文档README_en.md为主线系统梳理这款免费、开源、可离线运行的批量 OCR 软件从解压即用与 Scoop 安装到截图 OCR、批量 OCR、文档识别、二维码等标签页的实际操作再到文本后处理段落合并、忽略区域等进阶功能以及命令行与 HTTP API 两种外部集成方式。读完后你既能独立完成日常的文字识别任务也能把 Umi-OCR 接入自己的自动化脚本与工作流。一、项目定位与核心特性英文 README 对 Umi-OCR 的定义是Free, Open-source, Batch Offline OCR Software免费、开源、可批量的离线 OCR 软件并声明适用于Windows 7 x64 及以上系统。其四项核心特性在 README_en.md 中给出免费Free项目全部代码开源完全免费方便Convenient解压即用、离线运行全程不需要联网高效Efficient自带高效的离线 OCR 引擎在计算机性能足够的前提下识别速度可以快于在线 OCR 服务灵活Flexible界面可自定义并支持命令行、HTTP API 等多种外部调用方式。从 CHANGE_LOG.md 可以补充一条平台演进的实现事实软件在 v2.1.32024.7.23起新增了对Linux 平台的兼容并支持 Docker 部署也就是说当前版本并不局限于 Windows。仓库根目录随附的Umi-OCR_Rapid_v2.1.5.7z即基于 Rapid-OCR 引擎的 v2.1.5 发布包。二、安装与启动2.1 直接解压运行发布包提供两种形态见 README_en.md 的 Getting Started 章节.7z压缩包需要 7z 等压缩软件解压.7z.exe自解压包在没有安装压缩软件的电脑上直接运行即可解压。本软件无需安装解压后点击Umi-OCR.exe即可启动。仓库中随附的 Umi-OCR_Rapid_v2.1.5.7z 就是一个标准的发布包样例。2.2 通过 Scoop 安装Scoop 是 Windows 下的命令行安装管理工具。安装 Scoop 后可用以下命令安装 Umi-OCRscoop bucket add extras二选一安装不要同时安装快捷方式可能会互相覆盖scoop install extras/umi-ocr # 自带 Rapid-OCR 引擎兼容性更好 scoop install extras/umi-ocr-paddle # 自带 Paddle-OCR 引擎速度稍快英文 README 特别提醒两种引擎包不要同时安装如需要切换 OCR 引擎可以额外导入插件库Umi-OCR_plugins中的插件随时切换不同的 OCR 引擎。三、界面语言与多语言支持Umi-OCR 的界面支持多国语言。第一次打开软件时会按照电脑的系统设置自动切换语言如需手动切换进入全局设置→语言/Language即可支持的界面语言包括繁体中文、英语、日语等。从仓库的本地化工程文件可以进一步确认语言覆盖面。dev-tools/i18n/lupdate_all.py 中维护了参与翻译的语言列表包括en_US英语、zh_TW繁体中文、ja_JP日语、fr_FR法语、pt葡萄牙语、ru_RU俄语、uz乌兹别克语、vi越南语、ta泰米尔语等注释中还保留了nb_NO、it_IT、es_ES、de_DE、ko_KR、pt_BR等待启用的语言。该脚本调用lupdate.exe扫描UmiOCR-data/qt_res/qml目录下的 QML 源码源语言为zh_CN生成各语言的.ts翻译工程文件再由 dev-tools/i18n/lrelease_all.py 将.ts编译为二进制翻译包.qm。翻译协作流程在 dev-tools/i18n/README.md 中有明确说明普通译者前往 Weblate 在线翻译平台校对、补充现有语言或新增语言开发者则通过lupdate_all.py生成.ts文件、经 Weblate 平台协作后再运行lrelease_all.py生成.qm文件并放入UmiOCR-data/i18n目录。此外引擎组件等插件使用另一套轻量翻译机制基于各插件目录下的i18n.csv文件与主界面翻译体系相互独立。四、标签页式界面总览Umi-OCR v2 由一系列灵活易用的**标签页tabbed interface**组成用户可按喜好自由打开所需标签页标签栏左上角可切换窗口常驻置顶标签栏右上角可锁定标签页防止日常使用中误触关闭。主要标签页包括截图 OCR、批量 OCR、批量文档 OCR、二维码、全局设置。下面逐一说明。五、截图 OCRScreenshot OCR打开截图 OCR 标签页后即可用键盘快捷键唤起截图识别图中文字见 README_en.md 的 Screenshot OCR 章节左侧图片预览栏可直接用鼠标划选并复制文字右侧识别记录栏可以编辑文字也允许划选多条记录批量复制支持在别处复制图片后粘贴到 Umi-OCR 中进行识别。5.1 文本后处理段落合并OCR 引擎的原始输出通常是一堆零散的文本块**段落合并Paragraph Merge**属于 OCR 文本后处理功能用于整理识别结果的排版与顺序让文本更适合阅读和使用。英文 README 列出的预设方案有单行Single line合并同一行的文字适合大多数场景多行-自然段Multiple lines - natural paragraphs智能识别并合并属于同一自然段的文字适合大多数场景多行-代码块Multiple lines - code block尽量还原文字的原始缩进与空格适合识别代码片段或需要保留空格的场景竖排Vertical layout适合竖排文字排版需要配合同样支持竖排识别的模型库使用。CHANGE_LOG.md 显示这套后处理机制还在持续演进v2.0.02024.2.29引入了更强大的排版解析器v1.3.6 起自动区分中/英文段落并采取对应的合并规则v2.1.3 还对单栏-单行方案优化了相邻文本块之间间隔较大时的空格补全逻辑。六、批量 OCRBatch OCR批量 OCR 标签页用于批量导入本地图片进行识别其能力要点如下识别结果可保存为txt / jsonl / md / csv(Excel)等多种格式与截图 OCR 一样支持文本后处理可识别同属一个自然段的文字并合并也支持代码块、竖排等多种处理方案单次导入的图片数量没有上限任务完成后软件可以自动关机或休眠。6.1 特殊功能忽略区域Ignore Regions忽略区域是批量 OCR 中专门用来排除图片中不想要的文字的功能入口在批量识别页右栏的设置中可打开忽略区域编辑器典型场景图片顶部、右下角存在多个水印/LOGO批量识别这类图片时水印会污染识别结果操作方式按住鼠标右键绘制多个矩形框这些区域内的文字将在任务中被忽略建议把矩形框画得尽量大完全包裹住水印可能出现的所有位置。需要注意忽略的粒度从中文 README 的说明可以确认只有完全处于忽略区域框内部的整个文本块而非单个字符才会被忽略。例如一个水印框只覆盖住了key_mouse这一个文本块则只忽略它相邻的pubsub_connector.py、pubsub_service.py等文本块得以保留。该功能自 v2.0.0 dev2023.10.25引入后续版本还在文档识别中支持了按页数范围指定忽略区域v2.1.1HTTP OCR 接口也暴露了忽略区域参数v2.1.2。七、批量文档 OCRBatch Documents OCR文档识别标签页用于从文档中批量提取文本。英文 README 对该页只给出了入口示意结合 CHANGE_LOG.md 的记录其能力为v2.1.0 起新增批量文档识别支持pdf、epub、mobi等格式中文 README 进一步列出pdf, xps, epub, mobi, fb2, cbz对扫描件可进行 OCR也可直接提取文档原有文本并可输出为双层可搜索 PDF支持设定忽略区域常用于排除页眉、页脚文字且可指定忽略区域生效的页数范围v2.1.1批量文档任务支持暂停/恢复v2.1.2只要不退出软件待机/休眠后可恢复任务并可在任务完成后自动关机/休眠。八、二维码QR Code二维码标签页包含扫码与生成码两个方向的功能扫码Scan Code通过截图、粘贴或拖入本地图片读取其中的二维码、条形码支持一图多码支持 19 种编码协议Aztec、Codabar、Code128、Code39、Code93、DataBar、DataBarExpanded、DataMatrix、EAN13、EAN8、ITF、LinearCodes、MatrixCodes、MaxiCode、MicroQRCode、PDF417、QRCode、UPCA、UPCE。生成码Generate Code输入文本生成二维码图片支持同样 19 种协议并可提供**纠错等级error correction level**等参数。实现层面从 CHANGE_LOG.md 可见二维码解析库在 v2.0.0 dev 阶段已从早期方案切换为性能更好、功能更丰富的zxing-cppWindows 版 v2.1.5 更新为 zxing-cpp 2.3.0。九、全局设置Global Settings全局设置页用于调整软件的全局参数英文 README 列出的常用功能包括一键添加快捷方式或设置开机自启更改界面语言支持繁体中文、英语、日语等切换界面主题提供多个亮色/暗色主题调整界面文字的字号与字体切换 OCR 插件即切换底层识别引擎渲染器Renderer界面默认使用 GPU 加速渲染如果在你的机器上出现截屏闪烁、UI 错位的情况可调整Interface and Appearance→Renderer尝试切换不同渲染方案或关闭硬件加速。另外从 v2.1.5 的更新日志可以补充该版本新增了日志机制——指定级别以上默认 ERROR的日志会保存到Umi-OCR/UmiOCR-data/logs目录保存级别可在全局设置标签页中更改这对排查运行问题很有用。十、API 集成命令行与 HTTPUmi-OCR 的灵活特性主要体现在两套外部调用接口上详细手册分别见 命令行手册 与 HTTP接口手册此处给出关键操作摘要。10.1 命令行调用命令行入口就是主程序Umi-OCR.exe注意使用备用启动器如UmiOCR-data/RUN_GUI.bat时可能无法使用命令行且必须在软件中允许 HTTP 服务默认开启主机选仅本地即可。Umi-OCR 通过本地回回的 HTTP 接口进行跨进程通信指令不会经过物理网卡也不会泄露到外部。常用指令软件操控umi-ocr --help # 获取说明 umi-ocr --show # 弹出主窗口 umi-ocr --hide # 隐藏主窗口 umi-ocr --quit # 关闭软件 umi-ocr --reload # 重新加载配置文件v2.1.5 以上版本支持其中配置文件为./UmiOCR-data/.settingsini 格式允许手动修改后用--reload重载并刷新设置界面。OCR 指令umi-ocr --screenshot # 鼠标框选截屏 umi-ocr --screenshot screen1 rect50,100,300,200 # 范围截屏第2屏 (50,100) 起 300x200 区域 umi-ocr --clipboard # 识别剪贴板中的图片 umi-ocr --path D:/xxx.png # 识别指定图片 umi-ocr --path D:/img1.png D:/img2.png D:/image/test # 多个路径文件夹会递归搜索范围截屏参数说明screen为显示器编号从 0 开始缺省 0rect为x,y,w,h矩形缺省全屏两者至少填一个才会触发范围截图否则执行鼠标截屏。二维码指令umi-ocr --qrcode_read D:/xxx.png # 识别二维码/条形码同样支持多路径 umi-ocr --qrcode_create 文本内容 D:/输出图片.jpeg # 生成二维码 umi-ocr --qrcode_create 文本内容 D:/输出图片.jpeg 128 256 # 手动指定宽128、高256结果输出umi-ocr --screenshot --clip # 复制到剪贴板 umi-ocr --screenshot --output test.txt # 输出到文件覆盖 umi-ocr --screenshot --output_append x.txt # 输出到文件追加 umi-ocr --screenshot -- test.txt # -- 等价于 --output-- 等价于 --output_append两个实用提示其一所有指令支持前缀简写如--screenshot可简写为--sc、--clipboard可简写为--clipbo其二受运行环境限制Umi-OCR 暂时无法重定向输出流系统的管道重定向符和管道操作符|可能失效需要用程序调用时建议改用 HTTP 的 argv 接口。10.2 HTTP 接口HTTP 接口的使用前提是全局设置中允许 HTTP 服务默认开启若需局域网访问将主机切换为任何可用地址即可。接口目录见 docs/http/README.md覆盖四类能力图片 OCR参数查询/api/ocr/get_options与 Base64 图片识别文档识别PDF完整的文档识别流程接口二维码Base64 图片识别与从文本生成图片命令行接口/argv端点用于跨进程传输命令行参数——向http://127.0.0.1:1224/argv发送POST请求body 为 JSON 列表如[--path, D:/xxx.png]等价于执行命令行Umi-OCR.exe --path D:/xxx.png。该接口因较敏感可访问本机图片、关闭软件等仅允许本地环回 127.0.0.1 调用。文档接口手册同时给出了三条注意事项关闭软件时若仍有未断开的 HTTP 连接可能导致进程未完全退出后端组件对并发支持较差尽量不要并发调用长时间、大批量、连续调用时小概率出现Error: connect ECONNREFUSED之类的报错重新发起请求即可。十一、项目结构与引擎生态从英文 README 的 About Project Structure 章节看Umi-OCR 采用多仓库 插件的工程结构主仓库本项目界面、业务逻辑与文档插件仓库Umi-OCR_plugins可切换导入的 OCR 引擎插件Windows / Linux 运行库仓库Umi-OCR_runtime_windows、Umi-OCR_runtime_linux负责各平台的开发/运行环境部署与构建构建项目工作需在对应运行库仓库中完成。主仓库目录中随附的 dev-tools/i18n/ 则是本地化开发工具集含lupdate_all.py、lrelease_all.py、convert_ts_txt.py等脚本供维护翻译文件的开发者使用。支持的离线 OCR 引擎包括 PaddleOCR-json 与 RapidOCR-json 两套以插件形式存在运行环境框架基于 PyStand 定制版。引擎选择直接对应第二章提到的两个 Scoop 包Rapid 版兼容性更好Paddle 版速度稍快v2.1.4 还针对 Paddle 插件优化了默认线程/内存限制默认内存占用不超过系统总内存的一半。十二、版本与后续跟进完整的版本演进记录见 CHANGE_LOG.md。与本文内容最相关的几个版本节点v2.1.52025.3.26当前 main 分支新增日志机制、--reload指令、Esc 隐藏主窗口、双栏布局手动切换并新增俄语、泰米尔语 UI 语言v2.1.3新兼容 Linux 平台新增 HTTP 文档识别接口v2.1.2批量任务支持暂停--screenshot支持指定屏幕范围v2.1.1新增二维码命令行/HTTP 接口、--output/--output_append/--clip输出指令v2.1.0新增批量文档识别功能。如果你使用的是较旧版本注意文档接口仅适用于最新版本旧版本文档需以对应 release 分支为准。遇到任何使用问题项目方建议通过仓库的 Issue 渠道反馈。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →