Axolotl 全链路实战指南:从 YAML 配置驱动到 SFT / RLHF / GRPO 的完整技术图谱
Axolotl 全链路实战指南从 YAML 配置驱动到 SFT / RLHF / GRPO 的完整技术图谱【免费下载链接】axolotlGo ahead and axolotl questions项目地址: https://gitcode.com/GitHub_Trending/ax/axolotl本文以仓库根目录的 AGENTS.md 为骨架系统梳理 Axolotl 这一配置驱动config-driven的大语言模型微调框架每一次训练运行都由单个 YAML 文件定义无需修改任何 Python 代码即可完成 SFT、DPO/KTO/ORPO、GRPO、EBFT 等训练方法。读者将掌握完整 CLI 命令矩阵、核心 YAML 配置模式、六大训练方法的方法学对比与选型逻辑以及 SFT、偏好学习Preference Learning、GRPO 在线强化学习、奖励模型训练等分支的底层源码结构与实战排障要点。一、项目定位与技术栈Axolotl 是一个专注于大语言模型微调的开源框架其核心设计哲学是配置驱动base_model、adapter、datasets、学习率、训练轮数等所有关键要素全部沉淀在一个 YAML 文件中axolotl train config.yaml即可启动训练单卡或多卡自动检测。从 AGENTS.md 声明的技术栈看框架建立在一套成熟的生态之上层次技术选型用途语言/框架Python、PyTorch基础运行时模型生态HuggingFace Transformers模型加载与架构训练框架TRL提供 DPO/KTO/ORPO/GRPO 等 Trainer 基类参数高效微调PEFTLoRA/QLoRA适配器层分布式DeepSpeed、FSDP多卡/多节点扩展推理服务vLLMGRPO 生成在线强化学习的数据生成值得强调的是项目结构本身也体现了配置驱动 插件化的思想src/axolotl/utils/schemas/下所有配置校验由 Pydantic 完成config.py定义主 schemaAxolotlInputConfigsrc/axolotl/integrations/承载 liger、cut_cross_entropy、swanlab、nemo_gym 等插件src/axolotl/monkeypatch/则存放对 HF transformers 的运行时补丁。二、CLI 命令矩阵从训练到部署的九大入口AGENTS.md 给出了完整的命令矩阵其实现集中在 src/axolotl/cli/main.py基于 Click 框架。九个核心命令如下axolotl train config.yaml # 训练单卡或多卡自动检测 axolotl preprocess config.yaml # 分词数据集并校验配置 axolotl preprocess config.yaml --debug # 检查分词样本与 label 掩码 axolotl inference config.yaml # 交互式推理 axolotl merge-lora config.yaml # 将 LoRA 适配器合并进基座模型 axolotl vllm-serve config.yaml # 启动 vLLM 服务GRPO/EBFT 训练用 axolotl fetch examples # 下载示例配置 axolotl agent-docs # 展示面向 Agent 优化的文档随 pip 包分发 axolotl agent-docs grpo # 按主题展示 Agent 参考文档 axolotl config-schema # 导出配置 JSON Schema下面逐项说明其语义与源码级细节2.1 train核心训练入口train命令接受--launcher参数可选accelerate默认、torchrun、python三种多卡启动方式并支持--sweep传入超参数扫描配置。从 main.py 的实现看它通过generate_config_files展开配置普通配置与 sweep 配置都会生成中间文件临时文件在结束后自动清理再由launch_training实际启动进程当配置中启用 Rayuse_ray时launcher 会被覆盖走 Ray 路径。train命令还透传--之后的额外参数给底层启动器。2.2 preprocess训练前的干跑preprocess是排查数据集问题的第一道防线只做分词与配置校验不启动训练。配合--debug可以逐样本检查分词结果与 label 掩码对应 SFT 中的train_on_inputs掩码逻辑。这也是 docs/agents/sft.md 中Label masking wrong故障的标准排查手段。2.3 inference交互式推理inference提供三种交互形态纯命令行、--chat多轮对话、--gradio浏览器界面--gradio与--chat互斥。实现上支持与train相同的--launcher多卡分发。2.4 merge-lora / merge-sharded-fsdp-weights权重落地merge-lora将训练好的 LoRA 适配器合并回基座模型额外提供--dequant把量化基座反量化合并为 bf16 权重与--override-quantizer在量化器身份不匹配时强制合并例如训练与合并时 torchao 版本不一致两个高级选项。merge-sharded-fsdp-weights用于合并 FSDP 分片权重解决 FSDP 训练产物无法直接加载的问题。2.5 vllm-serveGRPO/EBFT 的在线生成引擎GRPO 在线强化学习需要 vLLM 服务实时生成 rolloutsvllm-serve即为此而生。启动后训练进程通过/generate、/set_lora等 HTTP 接口与 vLLM 交互详见后文 GRPO 架构。2.6 fetch按需拉取资源fetch支持examples、deepspeed_configs、docs三类资源。特别地对于纯 pip 安装无仓库 checkout的用户执行axolotl fetch docs下载文档是agent-docs命令可用性的前提。2.7 agent-docs面向 Agent 的文档分发agent-docs是 AGENTS.md 的运行时落地文档以docs/agents/*.md形式随包分发实现位于 src/axolotl/cli/agent_docs/init.py。其TOPICS映射表把主题名映射到具体文件overview→ 根目录AGENTS.md其余sft、grpo、preference_tuning、reward_modelling、pretraining、model_architectures、new_model_support分别对应docs/agents/下同名文档。路径解析策略是先仓库根、后 cwd可编辑安装/仓库 checkout 时向上查找仓库根目录pip 安装时回退到axolotl fetch docs下载的./docs/agents/。agent-docs --list列出全部主题。2.8 config-schema机器可读的配置全集config-schema从AxolotlInputConfig.model_json_schema()导出完整 JSON Schema支持--format yaml与--field 字段定向查询方便 Agent 与工具链发现所有配置项的类型、默认值与描述main.py。当全量 schema 生成失败如torch.dtype不可 JSON 序列化时会自动降级为简化字段表并给出警告。三、Config Pattern一个 YAML 定义一次训练AGENTS.md 给出的最小配置骨架如下base_model: meta-llama/Llama-3.1-8B-Instruct adapter: lora # 或 qlora省略则全参微调 datasets: - path: my_dataset type: chat_template # prompt strategy详见 docs/dataset-formats/ output_dir: ./outputs/lora-out要点拆解base_model可以是 HuggingFace Hub 上的模型 id也可以是本地/对象存储路径adapterlora、qlora4-bit 量化 LoRA或不填full fine-tune对应 PEFT 层datasets数组结构每个元素含pathHF Hub / 本地 JSONL/JSON/Parquet / S3/GCS 路径与typeprompt strategy 名称如chat_template、alpacaoutput_dir模型/适配器权重与 tokenizer 的保存位置。该 schema 的权威定义位于 src/axolotl/utils/schemas/config.py 的AxolotlInputConfig其下细分model、training、peft、trl、fsdp等子 schemasrc/axolotl/utils/schemas/。核心设计原则是功能通过 YAML 开关而非改代码启用——plugins:列表加载集成模块、prompt_strategies/中每个type:值映射到一个处理函数、core/trainers/mixins/提供可组合的训练器行为。四、训练方法全景六种方法一张表AGENTS.md 汇总了六种训练方法及其配置键这也是 docs/choosing_method.qmd 决策指南的依据方法配置键适用场景SFT默认输入-输出对、指令微调DPO/IPOrl: dpo/rl: dpo, dpo_loss_type: [ipo]成对偏好数据chosen vs rejectedKTOrl: kto非成对二元偏好标签ORPOrl: orpo单阶段对齐无需参考模型GRPOrl: grpo基于可验证奖励函数的 RL数学、代码EBFTrl: ebft基于内部表征特征匹配奖励这些枚举值的权威定义在 src/axolotl/utils/schemas/enums.py 的RLType中DPO/GDPO/GRPO/IPO/ORPO/KTO/SIMPO/EBFT。训练器路由逻辑位于 src/axolotl/core/builders/rl.py 的HFRLTrainerBuilder——它会根据rl类型分发到对应的 TRL Trainer如DPOTrainer、KTOTrainer、ORPOTrainer、CPOTrainer其中 SFT 走 core/builders/causal.py 的HFCausalTrainerBuilder。选型速判默认从 SFT 起步有偏好数据优先 DPODPO 过拟合换 IPO显存受限且偏好数据成对时选 ORPO/SimPO无参考模型显存约省一半只有点赞/点踩二元信号用 KTO需要可验证奖励的推理任务数学、代码用 GRPO特征匹配类奖励用 EBFT。五、SFT 深度参考流水线、数据格式决策树与超参速查本节基于 docs/agents/sft.md 展开并辅以仓库源码佐证。5.1 训练流水线SFT 是 Axolotl 最基础的路径整体架构如下YAML Config → axolotl train config.yaml 1. 加载基座模型QLoRA/8-bit 时附带量化 2. 按配置挂载适配器层LoRA/QLoRA 3. 加载 分词数据集 - 应用 prompt 模板chat_template / alpaca / 自定义 - 掩码输入train_on_inputs: false - 打包样本sample_packing: true 4. 训练循环HuggingFace Trainer - forward → loss → backward → optimizer step → lr scheduler step 5. 保存模型/适配器权重 tokenizer 多卡FSDP 或 DeepSpeed 自动在 GPU 间分片模型。与 GRPO 不同SFT无需任何外部服务进程不依赖 vLLM。入口是 src/axolotl/cli/train.py由HFCausalTrainerBuilder将配置组装为训练器core/builders/causal.py基础训练器类为 core/trainers/base.py 的AxolotlTrainer打包packing、优化器、调度器、checkpoint 等行为由 core/trainers/mixins/ 提供。5.2 数据集格式决策树数据是 chat/message 格式吗 ├─ 是OpenAI message 格式role/content │ ├─ 是 ──────────────────────────────── type: chat_template 推荐 │ └─ 否自定义字段名────────────────── type: chat_template message_property_mappings └─ 否指令/响应成对数据 ├─ 是 ── type: alpaca instruction, input, output └─ 否纯文本 ├─ 是且带分段 ───────────── type: input_output 无模板掩码 └─ 是且连续 ──────────────── type: completion 预训练风格各格式的完整规格见 docs/dataset-formats/处理函数的实现位于 src/axolotl/prompt_strategies/chat_template、alpaca、completion、input_output 均有对应处理模块。5.3 模型规模 → 适配器选型模型规模LoRAQLoRA4-bit全参微调显存约1-3B首选低预算方案单卡可行8-16 GBLoRA7-8B首选均衡之选需多卡16-24 GBLoRA13-14B首选均衡之选必须多卡24-40 GBLoRA30-70BLoRA 或 QLoRA单卡首选多节点40-80 GBQLoRA5.4 超参数参考区间参数LoRAQLoRA全参微调learning_rate1e-4 ~ 3e-41e-4 ~ 3e-41e-5 ~ 5e-5lora_r16-6416-64N/Alora_alpha1-2 倍lora_r1-2 倍lora_rN/Amicro_batch_size2-82-41-2gradient_accumulation_steps2-84-164-16num_epochs1-31-31-3optimizeradamw_8bitadamw_bnb_8bitadamw_torch_fused有效 batch size micro_batch × grad_accum × 卡数模型越大学习率越低。LoRA 参数定义在 src/axolotl/utils/schemas/peft.py 的LoraConfig中。5.5 健康训练指标指标健康状态异常信号train_loss下降chat 模型起步约 2-4从 step 1 起持平或上升 → 数据或 LR 问题eval_loss下降跟随 train_loss上升而 train_loss 下降 → 过拟合grad_norm0.1-10相对稳定峰值 100 → 不稳定恒为 0.0 → 权重冻结learning_rate遵循调度器曲线持平或 NaN → 配置问题重点关注loss 不降检查train_on_inputs、数据集、LR、loss 快速归零过拟合、eval_loss 发散减少 epochs、加正则化。详细排查见 docs/training_stability.qmd。5.6 SFT 已知问题速查表问题修复方案训练 OOM减小micro_batch_size、开启gradient_checkpointing、减小sequence_lensample_packing SDPA bf16 组合 loss 恒为 0.0改用attn_implementation: flash_attention_2或关闭sample_packing缺少 chat template 报错显式设置chat_template: chatmllabel 掩码错误运行axolotl preprocess config.yaml --debug检查 labelsLoss NaN使用bf16: auto、降低 LR、检查数据中是否有空样本tokenizer pad token / 无限 loss设置special_tokens: pad_token: |end_of_text|FSDP 保存挂起使用fsdp_state_dict_type: FULL_STATE_DICTDeepSpeed CheckpointError在gradient_checkpointing_kwargs中设置use_reentrant: true5.7 性能剖析在配置中开启剖析建议在 warmup/autotune 稳定后的步骤区间采样# 剖析第 3-7 步 profiler_steps_start: 3 profiler_steps: 5产物为output_dir下的profiler_trace.jsonChrome trace与snapshot.pickle内存快照可在chrome://tracing中查看也可用仓库自带脚本程序化分析python scripts/analyze_profile.py output_dir/trace 按算子级给出 CUDA 时间、内存分配与 kernel 分解重点关注大型 matmul kernel融合或量化候选、H2D/D2H 内存拷贝不必要的数据搬运、小而频繁的 kernelkernel 融合候选、kernel 间隙CPU 开销导致的流水线气泡。六、偏好学习RLHF参考DPO/IPO/KTO/ORPO/SimPO本节基于 docs/agents/preference_tuning.md 展开。6.1 方法总览方法数据要求核心思想最佳适用DPO成对chosen rejected通过偏好对隐式建模奖励通用对齐最常用IPO成对DPO 的变体损失避免过拟合DPO 过拟合时KTO非成对completion 二元标签Kahneman-Tversky 损失无需成对只有赞/踩数据时ORPO成对SFT 偏好损失一体无参考模型单阶段对齐省显存SimPO成对长度归一化、无参考模型简单配置、对长度鲁棒默认从 DPO 起步。所有偏好方法必须sample_packing: false。6.2 架构与显存模型┌──────────────┐ ┌───────────────┐ ┌───────────────┐ │ Policy Model │ │ Reference │ │ Preference │ │ (trainable) │ │ Model (frozen)│ │ Dataset │ └──────┬───────┘ └──────┬────────┘ └──────┬────────┘ └──────────┬───────┘ │ v │ Forward pass on chosen rejected ─────┘ │ Preference Loss (DPO/IPO/KTO/...) │ Backprop Update 例外ORPO 与 SimPO 不使用参考模型显存约省一半。与 GRPO 不同偏好学习是离线 RL使用预先收集的偏好数据无需 vLLM 服务。DPOIPOKTOORPOSimPO参考模型需要需要需要不需要不需要显存开销~2× 模型~2× 模型~2× 模型~1× 模型~1× 模型TRL trainer 类DPOTrainerDPOTrainerKTOTrainerORPOTrainerCPOTrainer对应配置类如AxolotlKTOConfig、AxolotlORPOConfig、AxolotlCPOConfig定义在 src/axolotl/core/training_args.pyDPO 训练器实现在 src/axolotl/core/trainers/dpo/。6.3 方法选择逻辑有成对偏好数据chosen rejected默认 →rl: dpo过拟合 →rl: dpo, dpo_loss_type: [ipo]显存受限 →rl: orpo无参考模型对长度敏感 →rl: simpo无参考模型只有二元标签好/坏→rl: kto需要单阶段训练无独立 SFT→rl: orpo6.4 Prompt Strategy 解析机制type字段会被解析为一个 Python 函数这正是配置驱动的微观体现type: chatml.intel → axolotl.prompt_strategies.dpo.chatml.intel(cfg, **kwargs) → 返回 transform_fn(sample) → {prompt, chosen, rejected} type: chat_template.default → axolotl.prompt_strategies.dpo.chat_template.default(cfg, dataset_idx, **kwargs) type: {field_prompt: prompt, ...} dict 形式 → axolotl.prompt_strategies.dpo.user_defined.default(...)模块基座为axolotl.prompt_strategies.{rl_method}将dpo替换为kto或orpo即对应方法的策略模块。相关文件prompt_strategies/dpo/chat_template、chatml、llama3、user_defined、passthrough、prompt_strategies/kto/、prompt_strategies/orpo/。6.5 健康训练指标指标健康区间问题信号train/loss下降0.3-0.7持平或上升 数据损坏或 LR 过高rewards/chosen上升持平 模型未学到偏好rewards/rejected下降上升 模型偏好错误回答rewards/margins为正且上升为负 偏好 rejected 而非 chosenrewards/accuracies 0.5趋向 0.7 0.5 不如随机logps/rejected下降上升 reward hackinggrad_norm0.01-10.0 100 梯度爆炸方法差异提示DPO/IPO 关注rewards/marginsKTO 损失噪声更大ORPO 需同时监控 SFT 与 odds ratio 分量SimPO 检查长度归一化后的奖励分离度。6.6 已知问题速查表问题修复方案sample packing 崩溃设sample_packing: false所有偏好方法的硬性要求KTOKeyError: label确保数据集有布尔label列ORPO/KTO 分词期KeyError加remove_unused_columns: falseORPO 模板未应用ORPO 必须显式设置chat_template参考模型导致 OOMDPO/IPO/KTO使用 LoRA/QLoRA或改用 ORPO/SimPO无参考模型IPO label_smoothingrl: ipo时不要设置dpo_label_smoothing七、GRPO 深度参考可验证奖励驱动的在线强化学习本节基于 docs/agents/grpo.md 展开。7.1 双进程架构GRPO 是 Axolotl 中架构最特殊的方法训练器与推理引擎分离运行。Terminal 1 (GPU 0) Terminal 2 (GPU 1) ┌──────────────────────┐ ┌──────────────────────────────────┐ │ vLLM Server │ HTTP │ Trainer │ │ Serves base model │◄────────────►│ 1. Send prompts to vLLM │ │ LoRA adapter │ /generate │ 2. Score completions (rewards) │ │ │ /set_lora │ 3. Compute advantages │ │ Punica kernels for │ │ 4. PPO-clip gradient update │ │ LoRA inference │ │ 5. Sync LoRA weights to vLLM │ └──────────────────────┘ └──────────────────────────────────┘三要素缺一不可①rl: grpo的 YAML 配置② 奖励模块含奖励函数的 Python 文件③ 正在运行的 vLLM 服务axolotl vllm-serve config.yaml。实现上训练器为 src/axolotl/core/trainers/grpo/trainer.py 的AxolotlGRPOTrainer采样工具在 sampler.pyvLLM 服务入口为 src/axolotl/cli/vllm_serve.py完整用户文档见 docs/grpo.qmd 与 docs/vllm_serving.qmd。7.2 奖励函数签名def my_reward(completions, **kwargs) - list[float]: # completions[i][0][content] 第 i 个 completion 的文本 # **kwargs 包含未被 transform 移除的数据集列 return [score_for_each_completion]多奖励组合reward_funcs: [r1, r2]配合reward_weights: [1.0, 0.5]。7.3 关键异步特性特性配置用途异步预取async_prefetch: true生成与训练重叠LoRA 同步vllm_lora_sync: true通过文件系统快速同步适配器流式打分streaming_partial_batch: true逐组打分零优势跳过skip_zero_advantage_batches: true跳过无学习信号的 batch回放缓冲replay_buffer_size: 100缓存高信号分组IS 校正vllm_importance_sampling_correction: true修正 off-policy 分布偏移7.4 健康检查rewards/*/mean应在 20 步内 0.15否则单独测试奖励函数reward_std多数步骤应 0否则无学习信号entropy应在 0.05-0.5 0.01 即模式坍缩grad_norm应在 0.001-1.0 10 不稳定恒 0.0 说明触发零优势跳过。详细诊断见 docs/training_stability.qmd。八、奖励模型Reward ModellingORM 与 PRM本节基于 docs/agents/reward_modelling.md 展开。奖励模型为 RL 提供打分信号分结果级与过程级两类。8.1 结果奖励模型ORM训练一个分类器预测整个交互上的偏好使用AutoModelForSequenceClassificationbase_model: google/gemma-2-2b model_type: AutoModelForSequenceClassification num_labels: 1 reward_model: true chat_template: gemma datasets: - path: argilla/distilabel-intel-orca-dpo-pairs type: bradley_terry.chat_template数据集格式{system: ..., input: ..., chosen: ..., rejected: ...}。8.2 过程奖励模型PRM训练一个 token 分类器对每个推理步骤打分使用AutoModelForTokenClassificationbase_model: Qwen/Qwen2.5-3B model_type: AutoModelForTokenClassification num_labels: 2 process_reward_model: true datasets: - path: trl-lib/math_shepherd type: stepwise_supervised数据集格式详见 docs/dataset-formats/stepwise_supervised.qmd。实现佐证reward_model/process_reward_model字段定义于 src/axolotl/utils/schemas/config.pyBradley-Terry 策略在 src/axolotl/prompt_strategies/bradley_terry/stepwise 策略在 src/axolotl/prompt_strategies/stepwise_supervised.py。九、仓库结构导航与工程规范9.1 源码目录速查src/axolotl/ cli/ # CLI 入口train、preprocess、inference、merge_lora、vllm_serve 等 core/ builders/ # TrainerBuildercausal.py 对应 SFTrl.py 对应 RLHF trainers/ # 训练器类与 mixinoptimizer、scheduler、packing dpo/ # DPO 训练器与配置 grpo/ # GRPO 训练器与采样器 loaders/ # 模型、tokenizer、适配器、processor 加载 prompt_strategies/ # 数据集格式处理器chat_template、alpaca、dpo/、kto/、orpo/ utils/schemas/ # Pydantic 配置 schemaconfig、model、training、peft、trl、fsdp integrations/ # 插件liger、cut_cross_entropy、swanlab、nemo_gym monkeypatch/ # 对 HF transformers 的运行时补丁 examples/ # 按模型组织的示例 YAMLllama-3/、qwen2/、mistral/、ebft/ 等 deepspeed_configs/ # DeepSpeed JSON 配置zero2、zero3 docs/ # Quarto 文档站点9.2 开发与测试规范仓库在.pre-commit-config.yaml中固定了 CI 工具版本切勿直接运行系统级ruff/mypypre-commit run --all-files— 以 CI 锁定版本运行 ruff、ruff-format、mypy、bandituvx ruffrev check --fix uvx ruffrev format— 用锁定版本自动修复rev取.pre-commit-config.yaml中ruff-pre-commit的 revpytest -m not slow --ignoretests/e2e tests/— CPU 测试套件。安装、CI 矩阵、GPU e2e 与 skip-CI 关键词详见 .github/CONTRIBUTING.md。9.3 编码约定要点配置驱动功能通过 YAML 开关启用而非改代码Prompt strategiestype:值一一映射到 src/axolotl/prompt_strategies/ 中的函数插件系统plugins:列表加载集成模块训练器 mixincore/trainers/mixins/提供可组合行为Schema 校验所有配置经utils/schemas/的 Pydantic 校验注释纪律默认不写注释仅当 WHY 不显然时隐藏约束、微妙不变量、针对特定 bug 的 workaround才加不解释代码做了什么不引用当前任务/PR/调用者单行不超过一句。十、关键文档导航AGENTS.md 提供了完备的文档地图整理如下Getting Started — 快速上手教程Choosing a Method — SFT vs DPO vs GRPO 选型指南Support Matrix — 支持矩阵、特性耦合与已知缺口Config Reference — 全部配置项Dataset Formats — chat_template、alpaca、input_output、completion 等RLHF — DPO/KTO/ORPO/GRPO/EBFT 配置与数据集格式GRPO Deep Dive — 异步训练、自定义奖励、扩展vLLM Serving — GRPO/EBFT 的 vLLM 配置Multi-GPU — FSDP 与 DeepSpeedTraining Stability — loss/NaN/OOM 排查Debugging — VSCode 与 Docker 调试面向 Agent 的分主题参考文档即axolotl agent-docs topic的源文件docs/agents/sft.md — 监督微调docs/agents/preference_tuning.md — DPO、IPO、KTO、ORPO、SimPOdocs/agents/grpo.md — 带奖励函数的 GRPO 在线 RLdocs/agents/reward_modelling.md — 结果级与过程级奖励模型docs/agents/pretraining.md — 持续预训练docs/agents/model_architectures.md — 模型特有注意点Gemma4、Qwen3.5 MoE 等docs/agents/new_model_support.md — 新模型架构支持与调试典型示例配置按模型分布在 examples/ 下如llama-3/的 LoRA/QLoRA/全参配置、qwen2/dpo.yaml、llama-3/qlora-1b-kto.yaml等DeepSpeed 配置位于 deepspeed_configs/。结语从AGENTS.md这份精炼的 Agent 参考文档出发可以清晰看到 Axolotl 的完整技术版图以 YAML 配置为唯一入口的极简使用范式、覆盖 SFT 到 GRPO/EBFT 的六大训练方法、以及分层清晰的源码结构CLI → Builder → Trainer → Prompt Strategy → Schema。无论你是在进行指令微调、偏好对齐还是构建基于可验证奖励的在线强化学习系统上述命令、配置模式、指标阈值与故障排查表都能直接作为落地参考。【免费下载链接】axolotlGo ahead and axolotl questions项目地址: https://gitcode.com/GitHub_Trending/ax/axolotl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联
返回资讯列表 →