尧图精选

Umi-OCR:离线文字识别工具,5 分钟从截图到自动化

🕒 发布时间:2026/9/13 11:40:03 📁 来源:尧图网络
Umi-OCR离线文字识别工具5 分钟从截图到自动化【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费开源的离线 OCR 文字识别工具解压即用。截屏、批量图片、PDF 文档都能做离线文字识别还开放了命令行与 HTTP 接口。模型全部内置本地不联网、不注册。快速上手截图完成第一次文字识别最短体验路径就是截图识别。解压后运行Umi-OCR.exe进入截图OCR标签页然后先确认右侧排版解析方案普通文字保持默认即可再按截图快捷键或点左上角图标框选屏幕上的文字最后在右侧记录栏选中结果按CtrlC复制。整个流程不超过 30 秒。小技巧别的软件里复制过图片可以直接粘贴到这一页识别不用重新截屏。场景实战从个人到团队的三条路线按使用深度排了一条递进线先从屏幕里抠代码再批量消化扫描件最后把识别能力接进自动化流程。代码截图怎么识别才保缩进你能拿到什么可直接粘进 IDE 的代码文本行首缩进和行内空格原样保留。怎么做先在排版解析方案里选单栏-保留缩进其他方案会把缩进压扁再用快捷键框选代码区域最后在记录栏复制对应文本块。结果长什么样记录栏里得到和原图一致的分层结构类似这样history [] for iters in range(300): def closure(): optimizer.zero_grad() dummy_pred net(dummy_data)一个避坑提示 框选时把行号栏、侧边工具栏留在框外否则它们会跟着被识别成文本粘贴后还得手动删。批量OCR怎么配置你能拿到什么一个文件夹里每张图对应一个文本文件或汇总成 csv / jsonl / md 等格式。怎么做打开批量OCR标签页先点选择图片把整个文件夹拖进来支持 jpg、png、webp、bmp、tif、tiff含子文件夹数量没有上限再在右侧设置里选输出格式最后点开始任务。有固定水印的扫描件建议先画好忽略区域再启动具体画法见下一小节。结果长什么样左侧文件列表逐行显示耗时与置信度右侧记录栏按文件滚动输出全文任务结束后按设定保存 txt 或 csv 等结果文件。一个避坑提示像素超大的长图容易出现漏字去设置里把限制图像边长调高再跑。忽略区域怎么画水印、页眉页脚混进结果时用忽略区域直接屏蔽。进入批量识别页右栏设置的忽略区域编辑器按住鼠标右键在预览图上拖出多个矩形框把水印可能出现的位置完全罩住框画大一点没关系。注意规则只有完全落在框内的整个文本块才会被丢弃跨在框边缘的字符仍会保留所以宁可多罩一点空白别只罩住水印的一部分。自动化集成怎么接入现有流程你能拿到什么一个常驻本地环回的 OCR 服务脚本、定时任务、网页前端都能调用。怎么做HTTP 服务默认开启主机保持仅本地即可通信走本地回环不出网卡。用命令行还是 HTTP 接口都行最小示例见自动化接入一节。需要局域网访问时再到全局设置里把主机改为其他地址。结果长什么样接口返回code: 100表示成功101表示图中没找到文本其余为失败码并附带错误原因方便脚本判断分支。一个避坑提示⚠️ 后端对并发支持较弱批量请求请串行发送偶发ECONNREFUSED时直接重发即可。配置与性能引擎与关键参数软件支持两套 OCR 引擎插件在全局设置里切换或导入插件更换RapidOCRPaddleOCR获取方式发行版自带导入插件特点兼容性好开箱即用速度稍快语言模型随引擎可切换中、英、日、韩等模型方向纠正无支持ocr.cls可认倾斜、倒置文本常用参数都在配置文件UmiOCR-data/.settings里界面改动会写入此文件手动编辑后可用umi-ocr --reload重载参数默认值什么时候动ocr.limit_side_len960大图、长图漏字时调到 2880 / 4320ocr.clsfalse扫描件倾斜时开启会略降速度tbpu.parsermulti_para代码截图改 single_codetbpu.ignoreArea[]固定水印、页眉页脚位置data.format接口dict只要纯文本时改 text自动化接入命令行与 HTTP 最小示例命令行入口就是主程序本身前提是 Umi-OCR 已在运行# 框选屏幕区域截图识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别整个文件夹含子文件夹结果追加写入文本文件 umi-ocr --path D:/scan --output_append result.txt注意命令行不支持系统重定向写文件请改用--output/--output_append。HTTP 接口只需一段几十行的调用默认端口 1224import base64, json, requests # 读取图片并转成 Base64 with open(test.png, rb) as f: img_b64 base64.b64encode(f.read()).decode() payload { base64: img_b64, options: { tbpu.parser: single_code, # 排版方案保留代码缩进 data.format: text, # 返回纯文本 }, } # 发送到本地 OCR 服务 resp requests.post( http://127.0.0.1:1224/api/ocr, datajson.dumps(payload), headers{Content-Type: application/json}, ) print(json.loads(resp.text)[data]) # code 100 成功101 无文本常见问题现象处理识别错别字多确认语言模型与文本语种一致大图把ocr.limit_side_len调高水印、页眉反复混进结果批量识别里画忽略区域框要大、要完整罩住水印命令行没输出、重定向失效确认 HTTP 服务已开启改用--output写文件批量任务跑得太慢用自带的 RapidOCR 引擎关闭方向纠正边长限制保持 960截图快捷键没反应查是否被其他程序占用或改点左上角图标发起截图收尾一句话总结Umi-OCR 是一款能陪你用很久的免费 OCR 软件——开源、离线、模型本地化从一张截图到整条自动化流水线都接得住。常用资源都在仓库里配置文件UmiOCR-data/.settings命令行手册docs/README_CLI.mdHTTP 接口手册docs/http/README.md图片识别接口参数docs/http/api_ocr.md更新日志CHANGE_LOG.mdPython 源码UmiOCR-data/py_src/【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →