Hugging Face Skills 技能包:解析 AGENTS.md 技能发现机制与 9 大 Agent 技能实战指南
Hugging Face Skills 技能包解析 AGENTS.md 技能发现机制与 9 大 Agent 技能实战指南【免费下载链接】ai-engineering-hubIn-depth tutorials on LLMs, RAGs and real-world AI agent applications.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-hub导读本指南以 hugging-face-skills 项目中的 agents/AGENTS.md 为线索系统讲解Agent Skills标准化技能包的注册、发现与调用机制。你将掌握AGENTS.md 在编码 Agent 技能体系中的定位与文件结构、仓库内置的 9 个技能数据抓取、Hub 操作、数据集管理、模型评测、云端作业、模型训练、论文发布、工具构建、实验跟踪各自的能力边界与典型触发场景以及如何通过link-skills.sh一键安装、用/skills验证技能加载并借助模板与生成脚本自动维护技能清单。AGENTS.md 是什么Agent 技能发现的注册表在 Claude Code 等编码 Agent 的技能体系中一个技能Skill是自包含的文件夹把指令、脚本和资源打包在一起供 AI Agent 针对特定用例使用每个技能目录下都包含一个带 YAML frontmattername与description的SKILL.md文件见 README.md。agents/AGENTS.md正是这份体系顶层的技能注册表它不承载某个技能的具体操作指令而是以统一格式声明仓库中已有哪些技能、各自在什么场景下被触发、对应的SKILL.md位于哪里。Agent 读取该文件后即可建立用户意图 → 技能 → 技能文档 → 执行脚本的完整检索链。文件的核心指令只有一句话却是整个体系的运转规则IMPORTANT: You MUST read the SKILL.md file whenever the description of the skills matches the user intent, or may help accomplish their task.也就是说AGENTS.md本身不执行任何操作它的职责是让 Agent 在描述匹配时必须深入阅读对应SKILL.md获取完整操作指南从而把技能发现与技能执行两个阶段解耦。AGENTS.md 文件结构逐段解析以 agents/AGENTS.md 为准文件由三个区块组成每一段都有明确的机器可读意图。1.skills注册区块技能名 → SKILL.md 路径映射文件首行以skills标签包裹技能列表每一行是技能名 - 路径/SKILL.md的形式- brightdata-web-mcp - skills/brightdata-web-mcp/SKILL.md - hugging-face-cli - skills/hugging-face-cli/SKILL.md - hugging-face-datasets - skills/hugging-face-datasets/SKILL.md - hugging-face-evaluation - skills/hugging-face-evaluation/SKILL.md - hugging-face-jobs - skills/hugging-face-jobs/SKILL.md - hugging-face-model-trainer - skills/hugging-face-model-trainer/SKILL.md - hugging-face-paper-publisher - skills/hugging-face-paper-publisher/SKILL.md - hugging-face-tool-builder - skills/hugging-face-tool-builder/SKILL.md - hugging-face-trackio - skills/hugging-face-trackio/SKILL.md这 9 项对应仓库skills/目录下的 9 个技能文件夹路径均指向各技能的SKILL.md。2.available_skills触发描述区块技能的能力描述该区块为每个技能提供一段技能名: \描述形式的语义描述供 Agent 依据用户意图进行匹配。例如hugging-face-jobs 的描述覆盖了云上执行任意负载UV 脚本、Docker 作业、硬件选择、成本估算、Token 认证、密钥管理、超时配置、结果持久化等完整场景并明确标注Should be invoked for tasks involving cloud compute, GPU workloads...——即用户提到云算力、GPU 负载或无本地环境在 HF 上跑作业时就必须激活该技能。3. 路径相对性规则文件末尾明确了一条易被忽略的约定Paths referenced within SKILL folders are relative to that SKILL.技能文件夹内部引用的路径如脚本、模板、参考文档均以该技能目录为相对起点例如hf-datasets技能内的脚本scripts/example.py在实际引用时应写为hf-datasets/scripts/example.py。理解这条规则才能正确解析每个SKILL.md内部指向references/、scripts/、templates/的局部链接。9 大技能能力全景从数据抓取到模型训练以下逐一展开 AGENTS.md 注册的 9 个技能结合各自SKILL.md与仓库脚本说明其能力边界与触发条件。brightdata-web-mcp可靠的网页数据获取能力基于 Bright Data 的 Web MCP 提供搜索、抓取与结构化抽取能力自动处理反爬、CAPTCHA 与动态内容。核心工具见 SKILL.mdsearch_engine搜索引擎检索Rapid 免费模式scrape_as_markdown页面转 Markdownextract按 prompt 抽取结构化 JSONPro 模式scrape_batch/scraping_browser_*/web_data_*批量抓取、JS 重站点、Amazon/LinkedIn 等平台数据配置方式远程 SSE 端点https://mcp.brightdata.com/sse?tokenYOUR_API_TOKEN或 Streamable HTTP 端点本地API_TOKENtoken npx brightdata/mcpPro 模式远程加pro1、本地设PRO_MODEtrue。触发场景获取实时网页内容、绕过访问限制、采集电商与社媒数据、标准请求失败时的兜底。仓库 prompt.txt 给出了真实用例用该技能抓取 12 个 AI 教育类 App 的 Play Store 评论。hugging-face-cliHub 的hf命令行操作能力覆盖认证、下载/上传、仓库管理、缓存管理、云端作业与推理端点。典型命令见 SKILL.md认证hf auth login、hf auth whoami、hf auth switch下载hf download repo_id --local-dir ./models --include *.safetensors --repo-type dataset上传hf upload repo_id . . --create-pr --commit-messagemsg仓库管理hf repo create name --private、hf repo tag create repo_id v1.0缓存hf cache ls、hf cache prune云端作业hf jobs run --flavor a10g-small image cmd推理端点hf endpoints deploy my-endpoint --framework vllm --accelerator gpu --instance-size x4GPU Flavor 全集cpu-basic、cpu-upgrade、cpu-xl、t4-small、t4-medium、l4x1、l4x4、l40sx1、l40sx4、l40sx8、a10g-small、a10g-large、a10g-largex2、a10g-largex4、a100-large、h100、h100x8。hugging-face-datasets数据集全生命周期管理能力在 Hub 上初始化数据集仓库、写入配置与 system prompt、流式追加行并新增了基于 DuckDB SQL 的数据集查询/变换能力。核心脚本见 SKILL.mdscripts/dataset_manager.pyinit、config、quick_setup、add_rows、stats等子命令内置 chat / classification / qa / completion / tabular / custom 六类 JSON 模板对应templates/目录。scripts/sql_manager.py通过 DuckDBhf://协议直接查询 Hub 数据集hf://datasets/{dataset_id}{revision}/{config}/{split}/*.parquet支持query、describe、sample、count、histogram、transform、export、push-to等操作。典型工作流先用 HF MCP Server 做数据集发现与元数据检索再用本技能完成创建、编辑、SQL 查询与数据变换如把 MMLU 按学科过滤后--push-to生成医学子集。hugging-face-evaluation模型卡评测结果管理能力为模型卡添加结构化的 model-index 评测元数据支持三条路径——从 README 抽取评测表格、从 Artificial Analysis API 导入分数、用 vLLM/lighteval 运行自定义评测见 SKILL.md。核心工作流scripts/evaluation_manager.pyget-prs先检查是否已有公开 PR防止重复提交→inspect-tables定位 README 表格→extract-readme --table N生成 YAML→ 加--apply推送或--create-pr创建 PR。配套脚本scripts/run_eval_job.py、scripts/run_vllm_eval_job.py、scripts/lighteval_vllm_uv.py、scripts/inspect_vllm_uv.py与scripts/artificial_analysis_to_hub.py。hugging-face-jobs云上通用负载执行能力在托管基础设施上运行任意负载数据处理、批量推理、实验基准、合成数据生成、定时任务覆盖 UV 脚本与 Docker 两种提交方式见 SKILL.md。提交方式UV 脚本推荐hf_jobs(uv, {script: ..., flavor: cpu-basic, timeout: 30m})脚本内用 PEP 723 头部声明依赖CLI 等价命令为hf jobs uv run my_script.py --flavor cpu-basic --timeout 30m。Dockerhf_jobs(run, {image: python:3.12, command: [...], flavor: cpu-basic})甚至可直接使用 HF Space 镜像hf.co/spaces/lhoestq/duckdb。关键要点脚本路径注意区分——hf_jobs()MCP 工具只接受内联代码或 URL本地文件路径在远端容器内不存在而hf jobs uv runCLI 支持本地路径自动上传。作业环境是临时的结果必须通过push_to_hub、外部存储或 API 回调持久化否则全部丢失默认超时仅 30 分钟长任务需显式设置2h等。现成脚本scripts/generate-responses.pyvLLM 批量推理并回推数据集、scripts/cot-self-instruct.pyCoT 自指导合成数据、scripts/finepdfs-stats.pyPolars 流式统计 Hub 上的 parquet 数据。hugging-face-model-trainerTRL 云端模型训练能力基于 TRLTransformer Reinforcement Learning在 HF Jobs 上完成 SFT、DPO、GRPO 与奖励模型训练并支持 GGUF 转换用于本地部署Ollama、LM Studio、llama.cpp见 SKILL.md。核心约束一律用hf_jobs(uv, {...})内联提交训练脚本不落本地文件脚本必须包含 Trackio 监控。TRL 配置类使用max_length而非max_seq_length默认 1024右侧截断。环境临时性决定了必须配置push_to_hubTrue、hub_model_idusername/model-name并在作业中传secrets{HF_TOKEN: $HF_TOKEN}。训练前校验强烈建议先用 dataset inspector 校验数据集格式DPO 要求严格列名prompt/chosen/rejected输出✓ READY/✗ NEEDS MAPPING附可复制映射代码/✗ INCOMPATIBLE三种判定避免 GPU 作业因格式不匹配失败浪费成本。现成模板scripts/train_sft_example.py、scripts/train_dpo_example.py、scripts/train_grpo_example.py、scripts/estimate_cost.py、scripts/convert_to_gguf.py。硬件选型参考1B 用t4-small、1-3B 用t4-medium/l4x1、3-7B 用a10g-small/a10g-large、7-13B 用a10g-large/a100-large、13B 用a100-large/a10g-largex2超过 7B 建议 LoRA/PEFT。hugging-face-paper-publisher论文发布与关联能力在 Hub 上创建论文页面、从 arXiv 索引论文、将论文关联到模型/数据集卡、声明作者身份并使用 Markdown 模板生成专业研究文章见 SKILL.md。配套资源scripts/paper_manager.py、templates/arxiv、ml-report、modern、standard 四套模板、references/quick_reference.md与examples/example_usage.md。hugging-face-tool-builderHF API 复用脚本构建能力为链式组合/重复执行/自动化的 HF API 任务构建可复用命令行脚本见 SKILL.md。脚本规则必须支持--help优先 Shell 脚本复杂场景可用 Python/TSX统一用HF_TOKEN环境变量作为Authorization: Bearer请求头优先简单、可管道组合的方案。参考实现references/baseline_hf_api.shPython/TSX 各一份基线、references/hf_enrich_models.shstdin → NDJSON 流式管道、references/find_models_by_paper.sh、references/hf_model_card_frontmatter.sh。例如管道baseline_hf_api.sh 25 | jq -r .[].id | hf_enrich_models.sh | jq -s sort_by(.downloads) | reverse | .[:10]即可实现拉取模型列表 → 逐条补全元数据 → 按下载量排序取 Top10。hugging-face-trackio实验跟踪与可视化能力训练期间用 Python API 记录指标、之后用 CLI 检索/分析指标支持实时仪表盘、同步到 HF Space 以及 JSON 输出见 SKILL.md。最小记录示例import trackio trackio.init(projectmy-project, space_idusername/trackio) trackio.log({loss: 0.1, accuracy: 0.9}) trackio.log({loss: 0.09, accuracy: 0.91}) trackio.finish()CLI 检索trackio list projects/runs/metrics、trackio get project/run/metric、trackio show、trackio sync加--json输出结构化结果供自动化与 Agent 使用。远程训练场景传space_id使指标同步到 Space 仪表盘实例终止后数据不丢失。技能目录的标准结构与约定仓库内每个技能目录遵循统一结构以skills/hugging-face-jobs/为例SKILL.md技能入口YAML frontmatter 含name、description决定触发时机与可选的license正文为 Agent 执行时的操作指南。references/深度参考文档如hardware_guide.md、hub_saving.md、token_usage.md、troubleshooting.md。scripts/可直接运行或内联提交的 Python/Shell 脚本。templates/数据集技能chat、classification、qa、completion、tabular、custom 六类 JSON 模板。examples/评测、论文、数据集技能示例数据与用法文档。这种入口文档 参考文档 脚本 模板的层次保证AGENTS.md只做轻量注册把重量级知识下沉到各技能目录内按需加载。安装与激活把技能挂载到 Claude Code按 README.md 的安装流程克隆仓库并进入项目目录运行bash scripts/link-skills.sh安装技能启动编码 Agentclaude输入/skills验证技能是否全部加载。scripts/link-skills.sh的实现逻辑见 link-skills.sh遍历skills/*/下所有含SKILL.md的目录将其整体符号链接到.claude/skills/skill-name/Claude Code 期望的目录结构并逐项输出[OK]状态与最终链接计数。技能挂载后直接在指令中提及即可触发例如见 README.mdUse the Bright Data web skill to scrape this website https://example.com/.Use the HF LLM trainer skill to estimate the GPU memory needed for a 70B model run.Use the HF model evaluation skill to launchrun_eval_job.pyon the latest checkpoint.Agent 会依据AGENTS.md的描述自动加载对应SKILL.md与辅助脚本。仓库 prompt.txt 展示了一条完整链路示例先用 Bright Data Web MCP 抓取 12 个 App 的 Play Store 评论并整理成 CSV再发起基于distilbert-base-uncased的 SFT 文本分类微调实验——恰好串联了抓取、数据加工与模型训练三大技能。AGENTS.md 的自动化维护机制agents/AGENTS.md不是手写维护的而是由脚本从各SKILL.md的 frontmatter 自动生成见 generate_agents.py模板驱动AGENTS_TEMPLATE.md 定义了输出结构用{{#skills}}...{{/skills}}循环占位符标记技能列表与描述区块的插入位置。元数据采集collect_skills()扫描skills/*/SKILL.md用无外部依赖的正则解析 frontmatterparse_frontmatter提取name、description与相对路径并按名称排序保证输出确定性。渲染render()实现一个极简 Mustache 式渲染器把占位符替换为各技能的实际值写入agents/AGENTS.md。一致性校验validate_marketplace()双向校验.claude-plugin/marketplace.json与已发现技能——每个技能必须在 marketplace 中有同名条目每个 marketplace 插件也必须存在对应SKILL.md否则打印错误并以非零退出码结束。README 同步update_readme()在!-- BEGIN_SKILLS_TABLE --与!-- END_SKILLS_TABLE --标记之间自动重写技能表格。这解释了 AGENTS.md 中两个容易被忽略的设计description字段同时承担Agent 触发判断与注册表展示双重职责而 marketplace.json 中的描述则是面向人类浏览者的两者各自维护、由脚本保证名称与路径一致。自定义技能复制、改 frontmatter、再生成如需新增技能可按 README.md 的流程操作复制一个现有技能目录并重命名如hf-datasets/更新新目录SKILL.md的 frontmatter补充name与description正文写入操作指引、示例与护栏增补目录内引用的脚本、模板与参考文档在.claude-plugin/marketplace.json添加一条简洁、面向人类的描述运行python scripts/generate_agents.py校验结构并重新生成AGENTS.md与 README 技能表重装或重新加载技能包使新目录生效。整个闭环意味着新增一个技能的唯一事实来源是它自己的SKILL.mdfrontmatter其余注册表、marketplace 与 README 表格均由脚本同步派生既避免了多份清单手工维护的漂移也保证了 Agent 读取的AGENTS.md永远与仓库实际技能一一对应。关键结论速查agents/AGENTS.md是技能发现入口职责是让 Agent 在描述匹配时必须读取对应SKILL.md本身不承载执行逻辑。仓库注册了 9 个技能覆盖网页抓取、Hub CLI、数据集管理、模型评测、云端作业、模型训练、论文发布、API 工具构建与实验跟踪。技能目录统一为SKILL.mdreferences/scripts/ 可选templates/、examples/frontmatter 的description决定触发时机。安装只需bash scripts/link-skills.sh脚本将技能目录整体软链到.claude/skills/用/skills验证。AGENTS.md由 AGENTS_TEMPLATE.md 与 generate_agents.py 自动生成并校验 marketplace 一致性、同步 README 技能表——新增技能后务必重新运行生成脚本。【免费下载链接】ai-engineering-hubIn-depth tutorials on LLMs, RAGs and real-world AI agent applications.项目地址: https://gitcode.com/GitHub_Trending/ai/ai-engineering-hub创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →