尧图精选

Umi-OCR 免费离线OCR教程:截图识别与批量转文本,五分钟跑通

🕒 发布时间:2026/9/19 6:43:36 📁 来源:尧图网络
Umi-OCR 免费离线OCR教程截图识别与批量转文本五分钟跑通【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR想把一堆扫描版 PDF 变成能搜索的文本在线平台往往有三个绕不开的问题文件要先传到别人服务器上、免费版有每日额度、断网就彻底罢工。Umi-OCR 是一款免费开源的离线 OCR 工具截图取字、图片批量转文本、PDF 文档识别全部在你电脑本地完成不注册、不上传、不联网。 前五分钟装好并做完首次设置Umi-OCR 怎么装下载或命令行二选一拿发布包推荐发布包是.7z压缩包或.7z.exe自解压文件任选其一。解压后双击Umi-OCR.exe就能启动全程没有安装向导Windows 7 x64 及以上、Linux x64 都能跑。Scoop 安装Windowsscoop bucket add extras scoop install extras/umi-ocr该包自带 Rapid-OCR 引擎偏好 Paddle-OCR 引擎速度略快的话有对应版本可装。开发者向的源码方式则是git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR后自行构建运行。首次启动后确认三件事第一次启动要加载识别模型耗时比普通软件长一些属正常现象之后启动和识别都很快。建议先做好三件事界面语言全局设置→语言/Language。语言初始跟随你的系统环境之后可随时在简体中文、繁体中文、英语、日语等之间手动切换OCR 引擎二选一。Rapid-OCR 兼容性更好Paddle-OCR 速度略快日常使用默认即可截图快捷键进入截图页把唤起识别的热键改成你顺手的一个默认CtrlAltZ。另外顺手确认全局设置里的本地 HTTP 服务处于开启状态默认开启主机保持仅本地——这是后面用命令行调用的前提。️ 4 个高频场景从一张截图到一整摞文档场景 1截图 OCR框一下就能取走屏幕文字屏幕上有一句话想存下来按快捷键用鼠标框住文字区域结果直接进剪贴板粘进任何输入框即可按Esc可取消误选。这页还有两处设计省事在别处复制过图片的话直接粘贴进软件就能识别重复上一次截图功能在处理相邻区域时连续出结果右侧记录栏里的文字可以二次编辑还能跨多条记录划选复制。场景 2几百张图片一次转文本手里的截图、照片数量大想一次性拿到文字进批量 OCR标签页把图片文件拖进列表没有数量限制几百张没问题支持 jpg、png、webp、bmp、tif、tiff 等常见格式完成后选择保存格式txt 适合人读、csv 用 Excel 打开、jsonl 交给程序处理、md 直接成稿可勾选任务完成后自动关机或休眠夜间挂机跑一整晚。如果超长图出现识别不全去页面设置 → 文字识别把限制图像边长的数值调高。场景 3扫描版 PDF 变可搜索文档文档识别页收 pdf、xps、epub、mobi、fb2、cbz 六类文件。电子 PDF 直接抽取原有文本层扫描版走完整 OCR 流程。重点是它能输出双层可搜索 PDF原始版式原样保留同时全文支持关键词检索扫描论文从此能用 CtrlF 找段落。这一页同样支持忽略区域剔除页眉页脚和完成后自动关机。场景 4扫二维码与生成码一个页面搞定读码截图、粘贴或拖入本地图片即可取出其中的码一张图里有几个码就全部读出协议覆盖共 19 种覆盖 QRCode、DataMatrix、EAN13、Code128、PDF417、Aztec 等常见二维码与条形码生成码输入文本生成码图片纠错等级等参数可调。⚙️ 3 个调校让识别结果更可用画框挡住水印忽略区域批量处理带 LOGO、水印、页码的文档时干扰文字会混进结果。做法在批量页右侧设置里打开忽略区域编辑器按住鼠标右键拖动画出多个矩形把水印可能出现的位置全部包住落在框内的完整文本块会在任务中被跳过框外内容照常保留。框尽量往大了画覆盖所有可能位置效果更稳。文档识别页也能设同样的忽略区域。让排版解析修好阅读顺序引擎输出的文本块顺序是检测序不一定符合阅读习惯排版解析选项负责理顺多栏-按自然段换行自己识别双栏版面论文、报告直接选它单栏-保留缩进保行首缩进和行内空格专为代码截图设计识别内容可直接粘进编辑器不做处理保留引擎原始输出。横排文字天然支持从右到左的竖排也能处理前提是所选引擎本身支持竖排。识别语言选对中英文混排更稳识别语言和界面语言是两码事前者决定用哪个模型跑识别后者只管界面显示。内容中英混杂时勾包含中文和英文的组合项比只勾单语模型稳得多纯英文文档则单独勾英文模型即可。界面语言方面软件内置多国语言库繁中、英语、日语界面都能用。️ 命令行与脚本调用 OCR入口就是主程序本身Umi-OCR.exe或在配好环境变量的环境下直接写umi-ocr。前提是设置里的本地 HTTP 服务已开启默认即是。最常用两条# 识别整个文件夹的图片结果导出为 txt umi-ocr --path D:/images --output result.txt # 框选当前屏幕结果进剪贴板 umi-ocr --screenshot --clip图片已在剪贴板就加--clipboard想持续追加写同一个文件加--output_append读码、生成码对应--qrcode_read、--qrcode_create全部说明用--help查看。这些调用只在系统内部环回通信不会出现在物理网络上。完整参数表见 命令行手册若要接进脚本看 HTTP 接口文档调用/argv接口等价于执行一条命令行。⚠️ 开工之前硬件要求与常见翻车点硬件与图片质量要求内存 4GB 起步CPU 性能越强识别越快扫描纸质文档建议不低于 300dpi源图模糊的话任何参数都救不回来。5 个高频翻车点超长图识别不全去页面设置调高限制图像边长水印、页码混入结果用忽略区域把干扰位置框掉输出格式拿不准程序处理选 JSONL人工编辑选 TXTExcel 统计选 CSV图片量特别大按每批 50~100 张分次跑比一次硬塞更稳截屏闪烁或 UI 错位到界面和外观→渲染器换渲染方案或关掉显卡加速。 常用资源入口离线 OCR 的价值只有一句话无论文档量多大数据始终留在你自己手里。解压发布包、运行主程序第一张图识别出来不超过五分钟。项目文档速查命令行手册docs/README_CLI.mdHTTP 接口文档docs/http/README.md更新日志CHANGE_LOG.md界面多语言说明dev-tools/i18n/README.md【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →