Paperless-ngx 文档管理系统完整指南:从扫描到归档的个人数字档案
Paperless-ngx 文档管理系统完整指南从扫描到归档的个人数字档案【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx凌晨对账时翻箱倒柜找一张 2023 年的水电发票最后还是从一摞旧纸里挖出来——这是很多人处理家庭文件的日常。Paperless-ngx 是一个社区维护的开源文档管理系统你把纸质或电子文档丢给它它负责扫描、OCR 识别、自动分类和全文检索最终变成一套存在你自己服务器上、随时可搜索的电子档案。它面向不想把账单、合同、发票交给云端、又希望长期可查的个人和小团队。读完这篇指南你能做到用 Docker 在一台机器上把 Paperless-ngx 跑起来并把第一份文档送进去被自动处理理解一份文档从进入系统到被找到、被授权的完整流程配置邮件抓取、规则触发等自动化让归档变成无感操作。场景地图先看它适合谁这一节帮你判断自己的使用场景并找到对应的项目能力。Paperless-ngx 用标签 对应人 文档类型 存储路径四元组组织文档。不同场景下这四个维度对应不同的现实对象。典型场景你会存什么Paperless-ngx 如何对应家庭账单水电、话费、信用卡账单对应人 服务商文档类型 账单标签 月份/年度团队合同采购合同、租赁合同对应人 合作方存储路径 合同目录标签 已签署/待归档发票归档报销发票、电子发票文档类型 发票自定义字段 税号/金额自动匹配归档个人资料库体检报告、证件扫描件自定义字段 有效期权限 仅本人可见版本 多份证件对应关系不是死板的你可以按需要调整。核心思路是把现实里谁、什么、什么时候、放哪里这四件事映射到系统的四个元数据维度上。最快落地路径三分钟跑通部署这一节带你从拿到仓库到看到第一份文档被处理走最短路径。最省心的方式是用仓库自带的安装脚本它会交互式地帮你建好 compose 文件、拉镜像、启动容器、创建管理员账户。git clone https://gitcode.com/GitHub_Trending/pa/paperless-ngx bash paperless-ngx/install-paperless-ngx.sh如果你想要手动控制可以从仓库的docker/compose/目录取一份模板推荐 PostgreSQL 版docker-compose.postgres.yml再配上docker-compose.env和.env然后选择数据库模板—docker/compose/docker-compose.postgres.yml为推荐起点SQLite 版适合单机轻量MariaDB 版适合已有 MariaDB 的场景。改挂载与端口— 把./consume等路径前缀改成本机实际目录端口默认 8000可改成任意空闲端口。配环境变量— 编辑docker-compose.env按需设置 OCR 语言等参数完整选项见 docs/configuration.md。拉镜像并启动—docker compose pull然后docker compose up -d容器自动完成数据库迁移。打开网页验证— 访问http://127.0.0.1:8000首次进入会提示创建超级用户账户之后拖一份 PDF 进去看它出现在列表里。关键挂载点速查挂载路径容器内路径作用./consume/usr/src/paperless/consume待处理文档入口消费者轮询此目录./data/usr/src/paperless/data存放 SQLite 库与辅助数据./media/usr/src/paperless/media文档与缩略图的实际存储./export/usr/src/paperless/export导出目录用于备份数据库与消息队列的变量在 compose 文件里已经写死指向容器内的db与broker你只需关心.env里的PAPERLESS_URL、PAPERLESS_SECRET_KEY、PAPERLESS_REDIS三项。一份文档的完整生命周期这一节讲清楚一份文档进来后到底发生了什么让你知道每个环节能调什么。摄入。文档从consume目录、网页拖拽或邮件三种途径进入系统。系统把它视为待处理不覆盖原始文件处理完后原件被移走、按你的命名规则重建到媒体目录。多核机器可并行消费多份文档。识别。若文档没有可提取文本Paperless-ngx 调用 Tesseract 引擎做 OCR支持 100 语言。数字原生文档带文本层的 PDF会跳过这一步。OCR 语言可在.env里用PAPERLESS_OCR_LANGUAGES指定中文场景设为chi_sim并加上eng。分类。入库前系统基于已学习的数据自动匹配标签、对应人和文档类型。你可以让分类器只建议不强制人工确认后回填训练数据会越来越准。索引。识别出的文本被喂进全文检索引擎按相关度排序、支持关键词高亮与相似文档推荐。检索质量随文档量增长而稳定提升。检索。界面支持按标签、对应人、类型组合筛选搜索框带自动补全。你可以把常用筛选保存为视图一键切换。权限。每个文档和每个对象都支持独立授权可按用户分配能看哪些。超级用户拥有全部权限日常建议给普通成员开受限账户。让它更聪明自动化与集成这一节按如果你要……就……组织帮你对号入座地配置。如果你要自动从邮箱收附件就在/settings/mail配置 IMAP 账户与抓取规则。规则可以按发件人、主题匹配附件被消费后系统还能对原邮件执行标记已读/删除。适合长期收电子发票、电子合同的场景。如果你要规则触发的自动归档就配置工作流Workflow。工作流由触发条件 动作组成文档消费完成时可自动加标签、设对应人、改文档类型、发通知。比如文件名含invoice→ 类型设为发票 打待报销标签。工作流比单个分类规则更强可组合多步动作。如果你要记录固定元数据就建自定义字段。字段支持文本、数字、日期、布尔、下拉等类型建好后可作为筛选与批量编辑维度。适合发票的税号/金额、证件的有效期这类非标签的结构化数据。如果你要对外分享就启用分享链接。文档详情页可生成带可选过期时间的公共链接无需为对方建账户。规模与稳定让它长期跑下去这一节把数据、性能、安全、备份、升级合并成一组可长期运行的保障建议。性能与存储。文档以明文不加密存于磁盘建议放在 SSD 以提升 IOmedia目录会随文档增长定期规划容量。多核部署下消费是并行的无需额外调优。安全。系统强调绝不在不受信任的主机上运行因为敏感信息以明文存储。最稳妥的做法是部署在家里或自有服务器、置于内网、走 HTTPS、用强密码、给日常使用开普通账户而非超级用户。备份。文档导出器document exporter可把全部文档、缩略图、元数据、数据库内容打包到export目录并支持增量更新适合配合rsyncDocker 用户也可直接备份media、data、pgdata等卷。要点备份前确保没有在消费文档。定期用导出器做逻辑备份卷备份做物理兜底。异地存放一份副本避免同机故障同时丢数据和备份。恢复时用 document importer 把导出导入全新实例。升级。升级前务必备份并确认没有活动消费docker compose down停服后docker compose pull docker compose up拉取新版up时会自动执行数据库迁移跨大版本如 v3先阅读迁移说明。要点每次升级前做一次完整备份。查看 docs/changelog.md 了解破坏性变更。先在测试环境验证再上生产。升级后跑一次 sanity checker 校验档案健康。收尾上手清单与资源第一次部署时按这份清单逐项打勾。已用 Docker Compose 启动http://127.0.0.1:8000可访问已创建超级用户并为日常使用建了普通账户已往consume目录丢过一份 PDF确认它出现在列表已确认 OCR 语言包含所需语种如chi_sim已建好标签 对应人 文档类型 存储路径的初始结构已配置导出器并做过一次完整备份已把实例放在受信主机、走 HTTPS关键资源入口官方文档docs/含 setup、usage、configuration核心源码src/documents/消费、分类、检索、src/paperless/配置与解析部署模板docker/compose/各数据库 compose 文件与环境变量示例Paperless-ngx 把纸质文档变成可长期检索的电子档案关键不在功能多而在于你愿意花一点时间把元数据结构建好、把备份跑通。从一份文档开始逐步把家庭账单、团队合同、发票归档搬进来数字档案就会自然成形。【免费下载链接】paperless-ngxA community-supported supercharged document management system: scan, index and archive all your documents项目地址: https://gitcode.com/GitHub_Trending/pa/paperless-ngx创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →