尧图精选

book-to-skill版本演进全记录:1.0到1.4关键变更与背后动机

🕒 发布时间:2026/9/17 21:13:36 📁 来源:尧图网络
book-to-skill版本演进全记录1.0到1.4关键变更与背后动机【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skillbook-to-skill 是一款把技术书籍PDF、EPUB、DOCX 等转成结构化 AI 技能Agent Skill的开源工具生成的技能可被 Claude Code、GitHub Copilot CLI 等智能体按需加载。本文基于 CHANGELOG.md 完整梳理 1.0.0 到 1.4.0 五个版本的演进路线并解读每次发版背后的设计动机。 五个版本一览快速定位每个版本的定位版本发布日期核心主题1.0.02026-06-08首个正式标签多格式提取 章节检测1.1.02026-06-12多宿主兼容Copilot CLI / Amp / Claude Code1.2.02026-06-17成为可pip install的 Python 包1.3.02026-07-30安全强化 韩文/泰文章节检测1.4.02026-08-10批量鲁棒性与 CJK 成本估算修复五个月五个版本节奏清晰先立地基 → 再扩生态 → 然后降门槛 → 再堵安全漏洞 → 最后磨体验。下面逐版本拆解。1️⃣ 1.0.02026-06-08打地基——多格式提取与章节检测首个正式标签发版官方定位是转换器已稳定、支持多格式、在真实书籍上验证过。多格式提取PDF、EPUB、DOCX、HTML、Markdown、reStructuredText、AsciiDoc、RTF以及经 Calibre 转换的 MOBI/AZW解析器按格式拆分到 book_to_skill/parsers/ 目录缺依赖时自动降级到标准库回退方案。extract.py --check预检命令一条命令告诉你每种格式装了哪些提取器、缺什么该装什么。自适应章节深度token 预算按书籍类型 × 阅读深度缩放学习型章节还要求带完整示例。Discovery Loop Tax 度量工具tools/discovery_tax.py 实测直接灌入上下文 vs 按需发现回答一个问题各花多少 token。批量容错一个坏文件只跳过并告警不再中止整批转换。动机先证明核心价值链路书 → 干净文本 → 章节结构可靠其余一切留待后续版本。2️⃣ 1.1.02026-06-12同一份 SKILL.md跑通三大 AI 助手GitHub Copilot CLI 升级为一等公民同一份 SKILL.md 通过开放的 Agent Skills 标准在 Copilot CLI、Amp、Claude Code 三端均可被发现、安装和运行脚本探针覆盖 8 条宿主发现路径。validate_skill.py --lens claude|copilot|amp按每个宿主的规则审计生成的技能文件CI 默认仍用claude保证向后兼容。归属横幅每次运行开始打印 scripts/ 下的署名横幅尽力而为不会导致运行失败。动机宿主中立host neutrality。为此甚至从 frontmatter 里删掉了allowed-tools字段——技能要在三个宿主上都合规宁可放弃单宿主的权限优化。3️⃣ 1.2.02026-06-17一条命令安装——成为正式 Python 包这是降低上手门槛的一版可安装的 Python 包pyproject.toml 定义了book-to-skill控制台命令和python -m book_to_skill入口可选提取器拆成 extrasepub、pdf、docx、rtf、technical、all基础安装零第三方依赖要求 Python ≥ 3.9。Markdown / AsciiDoc 标题检测没有 Chapter N 数字标题的.md/.adoc文档不再检测出 0 章围栏代码块内的标题会被忽略。setext / RST 下划线标题标题行下面一排或-也能识别。章节语言扩围新增法、德、意、荷四语的章节词多语言目录检测同步覆盖。CJK 全角数字第章全角数字与第1章同样可检测。CI 安全扫描上线CodeQL、Bandit、Zizmor Dependabot。动机让用一下的成本从读一堆文档降到一条pip install同时把解析错误从静默吞掉改为记录到 stderr为后续排障铺路。4️⃣ 1.3.02026-07-30安全专场——把生成物当成不可信输入这一版的关键词是硬化hardening几乎所有变更都围绕生成的技能在入库前必须过安检生成技能提示注入扫描无依赖的顾问级扫描器在技能被接受/发布前标记指令覆盖短语、模型控制标签、隐形 Unicode、越权 frontmatter 和外传型内容报告只给出规则与位置绝不回显攻击者可控文本。隐形 Unicode 清洗所有解析结果统一移除零宽字符与 Unicode tag 区段并上报移除数量清洗后无可见内容的源直接拒绝。DOCX XXE / 十亿笑声防御解析前检查 XML 部件是否声明 DTD 或实体直接拒绝。子进程参数注入加固文件路径先绝对化再传给pdftotext/pdfinfo/ebook-convert文件名以-开头不会再被当成命令行选项。PR 依赖 CVE 审查新增中等以上 CVE 的依赖会被 CI 标记。顺带两个值得一提的变更pdfextra 从已停更的PyPDF2换到维护中的pypdf新增韩文제N장在约 3000 条法律语料上验证精确率 0.999 / 召回率 1.000和泰文บทที่ N章节标题检测——此前泰文书籍完全无法按章节切分。动机技能会被智能体当作指令读取所以一本书里藏的恶意内容等于直接注入。安全门禁放在生成链路里比放在文档里有效得多。5️⃣ 1.4.02026-08-10打磨体验——批量转换的最后一公里最新版聚焦真实用户会踩到的坑CJK 感知的 token 估算按码点而非空格分词计数修复了无空格中日韩书籍成本预检约 1000 倍低估的问题拉丁文本行为不变。扫描件 PDF 提前中止检测到纯图像 PDF 时立即停止并给出 OCR 提示ocrmypdf而不是干完一整本书产出一个空技能。批量更抗造不可读的源跳过而非中止整批未知 CLI 参数给出警告而非静默忽略。章节检测补盲目录不再只认第一个源文件嵌套章节也会被扫描Chapter I.这类章节词 罗马数字的常见形式此前完全漏检现在可识别。文本清洗更保守pdftotext的页边页眉清理扩展到pypdf/pdfminer路径且不再误删真实的单词行。动机早期版本解决能不能转1.4.0 解决批量转 100 本书时会不会半夜炸掉。 背后动机总结为什么这套演进节奏值得借鉴回看五个版本有几条贯穿始终的工程原则详见 CONTRIBUTING.md量出来别声称Measure, dont assert韩文检测附精确率/召回率实测成本宣称附 tools/discovery_tax.py 的基准数据——PR 里没证据的收益主张会被打回。变更日志不手改CHANGELOG.md 由 git-cliff 从 Conventional Commit 自动生成配置见 cliff.tomlPR 标题就是 changelog 条目避免多人共写同一个 Unreleased 段落产生合并冲突。基础安装保持零依赖从 1.2.0 定包结构起每个格式都有标准库回退可选依赖全部走 extras。安全随功能走1.2.0 上 CI 扫描、1.3.0 做生成物安检安全投入和功能发布是同一节奏而不是事后补丁。 延伸阅读仓库内路径CHANGELOG.md — 完整发版记录与手写细节注释docs/architecture.md — 流水线与组件图docs/how-it-works.md — 提取与生成的完整流程docs/performance.md — Discovery Loop Tax 方法与实测数据book_to_skill/ — 提取器主包parsers、config、dependenciestools/ — 度量与校验工具tests/ — 覆盖章节检测、清洗、批量容错的测试套件一句话总结book-to-skill 的 1.0→1.4 演进就是一部核心链路 → 生态兼容 → 安装门槛 → 安全门禁 → 体验打磨的标准开源工具成长史每一步都有度量数据和真实书本来背书。【免费下载链接】book-to-skillTurn any technical book PDF into a Claude Code skill — ready to study, reference, and use while you work.项目地址: https://gitcode.com/GitHub_Trending/bo/book-to-skill创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →