尧图精选

PaddleOCR Agent Skills 安装指南:如何快速跑通文字识别与文档解析

🕒 发布时间:2026/9/17 10:02:20 📁 来源:尧图网络
PaddleOCR Agent Skills 安装指南如何快速跑通文字识别与文档解析【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR这篇文章帮你在支持 Skills 的 AI 应用里装好并配好 PaddleOCR 的两个官方 Agent Skills——文字识别与文档解析再用一份真实文件跑通一次完整任务。前提执行机装有 Python 3.9主路径安装需要 Node.js且已拿到百度 AI Studio 的 access token。先定目标只取文字还是连结构一起要装之前先选 Skill两者只装你需要的你的需求选择输出形态只要图片或 PDF 里的纯文本paddleocr-text-recognition行级文本、边界框坐标、置信度分数要保留标题、表格、公式等文档结构paddleocr-doc-parsingMarkdown / 结构化结果判断标准目标是纯文本就选前者文档含表格、公式或复杂版面就选后者。识别 Skill 的 SKILL.md 也明确要求不要处理含表格、公式或复杂版面的文档两个 Skill 的完整规则在 skills 目录 下各自的 SKILL.md 文件里。开工前备齐三样东西Python、paddleocr 包、AI Studio token确认执行 Skill 的设备已安装 Python 3.9 或以上版本。Skill 的命令最终都落在paddleocrCLI 上跑不了 Python 就跑不了任务。安装 PaddleOCR 3.7.0 及以上版本它提供paddleocrCLIpip install paddleocr3.7.0注意paddleocr api是把文件提交到官方托管服务再等结果不做本地推理所以无需 GPU也不用装额外依赖组。获取 access token打开百度 AI Studio 账户设置中的 Access Token 页面accessToken 入口复制 token 备用。安装主路径一条命令慢网改走本地克隆主路径npx skills 全局安装skillsCLI 会把 Skill 全局装到设备上装完各 AI 应用都能用前提是已安装 Node.js。npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y只装其中一个 Skill 时保留对应那条命令即可。可选分支网络慢或超时先克隆仓库再本地安装PaddleOCR 仓库较大网络慢的环境下npx skills add可能因超时失败。遇到这种情况先把仓库克隆到本地目录再从本地路径装git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing仓库里的skills/目录就是两个 Skill 的源码所在。兜底OpenClaw 走 clawhub其余环境手动拷贝如果你用 OpenClaw安装位置与规则以其官方 Skills 文档为准直接执行clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing以上都不适用时克隆仓库把PaddleOCR/skills下对应的 Skill 目录拷贝到你 AI 应用指定的位置具体拷贝到哪份以该应用的安装文档为准Claude Code、claude.ai、OpenClaw 各自有 Skills 安装说明。配置PADDLEOCR_ACCESS_TOKEN 填进哪按官方文档环境变量只有两个必填PADDLEOCR_ACCESS_TOKENaccess token。两个 Skill 的 frontmatter 都把它声明为必需环境变量primaryEnv缺失时 Skill 不会正确工作。可选PADDLEOCR_BASE_URLAPI base URL。不改则默认使用官方服务地址。部分应用的填法Claude Code在项目根目录的.claude/settings.local.json里加env字段ACCESS_TOKEN换成你在 AI Studio 拿到的 token{ env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }OpenClaw在~/.openclaw/openclaw.json中为每个 Skill 置enabled: true并在env里填 token装了两个就写两条{ skills: { entries: { paddleocr-text-recognition: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } } } } }应用不在上述范围时直接把 token 以环境变量PADDLEOCR_ACCESS_TOKEN提供给它即可单次调用也可以用--token参数显式传入。调用一句话让 AI 应用替你跑 paddleocr api配置完成后用自然语言描述任务并附上文件 URL 或本地路径。官方文档给出的示例提示词提取这个文件中的全部文本https://example.com/invoice.jpg提取本地文件 C:\docs\invoice.pdf 中的全部文本。解析这个 PDF并返回主体内容和全部表格https://example.com/report.pdfSkill 内部实际执行的是paddleocr api命令理解其行为或手动验证时可以直接跑paddleocr api --model_type ocr --file_url https://example.com/image.pngpaddleocr api --model_type doc_parsing --file_path ./document.pdf关键参数行为--model_type必填只接受ocr和doc_parsing两个值--file_url与--file_path二选一分别对应文件 URL 与本地路径。完整参数列表以paddleocr api --help的输出为准详见官方 CLI 文档。验证先核对 JSON 字段再认三种失败信号命令成功时输出格式化 JSON。文字识别--model_type ocr包含jobId和每页的prunedResult、ocrImageUrl其中prunedResult内含rec_texts行级文本与rec_scores置信度分数{ jobId: job-xxx, pages: [ { prunedResult: { rec_texts: [Line 1, Line 2], rec_scores: [0.98, 0.95] }, ocrImageUrl: https://... } ] }文档解析--model_type doc_parsing包含jobId和每页的markdownText、markdownImages、outputImages{ jobId: job-xxx, pages: [ { markdownText: # Title\n\nContent..., markdownImages: { img1: https://... }, outputImages: { layout1: https://... } } ] }核对方法看pages是否覆盖目标页码、rec_texts/markdownText是否与文档实际内容一致。若用--output指定了文件CLI 会写入该文件并打印保存位置未指定时打印到标准输出。出错时信息进标准错误流并返回非零退出码据此可判定失败。SKILL.md 列出的常见错误有三类认证错误PADDLEOCR_ACCESS_TOKEN无效或缺失——检查环境变量是否配置、token 是否来自 AI Studio 且未过期。配额错误API 限流或配额超出。未检测到内容图片可能是空白页或不含文字。规则CLI 返回错误时向用户说明具体问题不要静默失败也不要回退到应用自身的视觉能力。边界哪些文档别用识别 Skill预处理何时关paddleocr-text-recognition不适用于含表格、公式、图表或复杂版面的文档这类任务改用paddleocr-doc-parsing。结果展示规则向用户展示完整提取内容除非内容超过 10,000 字符才允许省略。Skill 依赖paddleocrCLI由paddleocr3.7.0提供CLI 默认读取PADDLEOCR_ACCESS_TOKEN也可用--token显式传入。API 默认开启文档预处理即扭曲矫正use_doc_unwarping与方向分类use_doc_orientation_classify。不改的话每个请求都会先过一遍预处理稳妥但更慢。输入平整且方向正确截图、扫描规范的文档时可以关掉以加快结果paddleocr api --model_type ocr --file_path ./document.pdf --use_doc_unwarping False --use_doc_orientation_classify False以下情况保留预处理输入是弯曲或折叠文档的照片、存在明显透视变形、方向不确定旋转 90/180/270 度。验收标准拿一份你手头的真实 PDF 或图片按上文提示词跑一遍输出中出现与文档实际内容一致的rec_texts或markdownText即整条链路已打通。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →