尧图精选

TIS-DPO 论文解读:Token 级重要性采样如何为 DPO 偏好对齐“精确定价”

🕒 发布时间:2026/10/1 21:23:41 📁 来源:尧图网络
文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载本文基于开源仓库《大模型基础》Foundations-of-LLMs中收录的论文解析文档深度拆解清华、Apple 与 UIC 联合提出的TIS-DPOToken-Level Importance Sampling for Direct Preference Optimization with Estimated Weights先从“平均奖励含噪声”这一 DPO 缺陷切入再推导最优偏好数据分布、重要性采样权重与正反模型奖励估计的完整技术链路最后落到实验结论与工程落地的现实价值。读完本文你将理解为什么“所有 Token 一视同仁”会拖累对齐效果以及如何用「Token 级奖励估计 重要性权重裁剪」把 DPO 的优化效率推向新的高度。一句话总结TIS-DPO 的核心贡献是将 DPO 的优化粒度从“回答级别”下沉到“Token 级别”并通过正面/负面模型输出概率之差估计每个 Token 的奖励再把奖励映射为重要性采样权重融入目标函数从而在不对原始偏好数据构建过程做任何改动的前提下提升 LLM 偏好对齐的优化效率与结果最优性。研究背景为什么 DPO 会“一视同仁”地吃亏Direct Preference OptimizationDPO是目前最流行的大模型偏好对齐方法之一它跳过显式奖励模型直接用偏好数据对 ${y_w, y_l}$ 优化策略 $\pi_\theta$。但在经典的 DPO 设定中回答里每一个 Token 对损失的贡献是同权重的而现实中的 Token 重要性差异极大——甚至一份“好回答”里也可能混入低奖励的 Token。作者在原文中给出一个关键直觉与 Token 级奖励值相比文本的平均奖励存在噪声。当模型对“正例/负例回答谁更好”的判断出错时优化的方向就会被污染。本文将正负回答平均奖励值“比较出错”的概率定义为数据噪声并给出其上界证明见论文附录$$ P(S_w\leq S_l)\leq\exp\left(-\frac{2n_wt^2}{(b_w-a_w)^2}\right)\exp\left(-\frac{2n_lt^2}{(b_l-a_l)^2}\right) $$其中$S_w$、$S_l$正例win与负例lose回答的平均奖励值$n_w$、$n_l$正、负回答的 Token 数量$b_w$、$a_w$正回答的最大、最小 Token 奖励$b_l$、$a_l$负回答的最大、最小 Token 奖励$t$判定阈值参数。从公式可以读出两个规律Token 数量越少或奖励波动区间 $(b-a)$ 越宽出错上界越大——说明短回答、内部奖励波动剧烈的文本更容易让平均奖励“失真”Token 奖励波动越大平均奖励出错的概率越大对优化过程的干扰也越强。这构成了 TIS-DPO 的动机根基要让 DPO 学得更稳、更准就必须处理 Token 级奖励的差异性而不是简单地对整句取平均。最优偏好数据分布让每个 Token 的期望奖励恒定既然平均奖励噪声源自 Token 奖励的波动那么理想的偏好数据应该让 Token 奖励尽量稳定。论文据此定义最优偏好数据分布$\mathcal{D}^*$定义 1在最优数据集 $\mathcal{D}^$ 中对于任意上下文 $(x, y^{t})$下一个 Token $y_t$ 都是从具有相同期望奖励 $R^$ 的分布中采样的即$$ \forall(x,y^{t}),\quad\mathbb{E}_{y^t\sim\mathcal{D}^(\cdot|x,y^{t})}[r(y^t\mid x,y^{t})]R^$$其中 $\mathcal{D}^(\cdot\mid x,y^{t})$ 表示给定上文 $(x,y^{t})$ 时从 $\mathcal{D}^$ 采样 $y_t$ 的概率。满足该性质的分布意味着无论生成到哪个位置每个 Token 的期望奖励都稳定在同一水平平均奖励不再被“个别高奖励/低奖励 Token”带偏。但现实数据显然不满足这一理想性质——因此需要引入统计学工具重要性采样Importance Sampling。重要性采样从真实分布逼近最优分布重要性采样是一种利用“来自不同分布的样本”估计“目标分布期望”的方法$$ \mathbb{E}{x\sim p}[f(x)]\mathbb{E}{x\sim q}[f(x)\frac{p(x)}{q(x)}], $$其中 $p$ 为目标分布$q$ 为实际抽样分布比值 $\frac{p(x)}{q(x)}$ 称为重要性权重——它衡量目标分布下样本出现的概率相对抽样分布被放大或缩小了多少。论文推导出最优分布与实际分布之间存在如下关系证明见论文附录$$ D^*(x,y^{t},y^t)\frac{D(x,y^{t},y^t)}{w(y^t\mid x,y^{t})}. $$也就是说只要已知重要性权重 $w$就能把从实际分布 $D$ 采样的数据“折算”成最优分布 $D^*$ 下的样本。论文给出的权重形式为$$ w(y^t\mid x,y^{t})k\cdot\exp(\mu r(y^t\mid x,y^{t})), $$该权重与 Token 奖励值正相关直觉上非常好理解在“好回答”中奖励值过大的 Token 应降低采样概率它们会让平均奖励虚高奖励值过小的 Token 应提高采样概率它们拖低了平均奖励“坏回答”的处理逻辑对称。通过这样的加权可以在不改变数据收集流程的前提下让训练分布逼近“Token 奖励平稳”的最优分布。正反模型对比无奖励模型条件下的 Token 级奖励估计权重公式依赖 Token 级奖励 $r(y^t\mid x,y^{t})$但传统的轨迹级sequence-level奖励模型很难给出 Token 粒度的奖励。为此论文采用**训练一对“正面模型”与“负面模型”**的方式将正模型与负模型对同一 Token 的输出概率之差作为该 Token 奖励的估计。形式化表达为$$ w_tk\cdot\exp(\mu\cdot\text{clamp}(\log\frac{\pi^(y_t\mid x,y^{t})}{\pi^-(y_t\mid x,y^{t})},L,U)), $$其中$\pi^$、$\pi^-$正面模型与负面模型$\log\frac{\pi^}{\pi^-}$正负模型对同一 Token 的对数概率差被视作奖励估计$\text{clamp}(\cdot, L, U)$将奖励值裁剪到区间 $[L, U]$用于抑制重要性采样的高方差问题$k$、$\mu$缩放系数与温度系数共同决定权重动态范围$L$、$U$奖励裁剪下界与上界。论文提供了三种训练对比模型的方式训练方式说明Prompt-based基于提示词直接构造正/负模型实现最轻量SFT-base基于监督微调Supervised Fine-Tuning基座分别得到正、负模型DPO-base基于 DPO 训练的基座演化出正、负模型与对齐任务同源三种方式分别覆盖了从“零训练成本”到“与任务强相关”的不同工程取舍读者可根据算力与数据条件选择。TIS-DPO 目标函数Bradley-Terry 模型的 Token 级化将 Bradley-TerryBT奖励模型从回答级别下沉到 Token 级别并嵌入重要性采样权重即可得到 TIS-DPO 的目标函数。与原文档一致其核心结构为把 DPO 中“整句对数概率比”的累加替换为“按 Token 重要性权重加权后的逐 Token 对数概率比”使优化信号聚焦于真正影响偏好判别的 Token而非被平均奖励稀释。与标准 DPO 相比TIS-DPO 目标函数有两个显著变化权重化每个 Token 的梯度贡献乘以其重要性权重 $w_t$实现“重要的 Token 多学次要的 Token 少学”裁剪保护奖励估计经过 $\text{clamp}(L, U)$ 裁剪防止极端 Token 权重引发方差爆炸、训练不稳。由于 TIS-DPO 只改目标函数、不改数据构建它可以即插即用地替换任意 DPO 训练流程这一点在实际工程中价值极大。实验结论与优势论文实验表明TIS-DPO 在多个偏好对齐任务上相较标准 DPO 均有提升无害性对齐harmlessness与有帮助性对齐helpfulness上表现更优摘要任务等生成类场景下效果出色全程不修改原始数据构建过程适用于真实业务场景。综上TIS-DPO 通过“为每个 Token 分配基于奖励的权重 重要性采样”两步操作同时提升了偏好对齐的优化效率与结果最优性并为处理 Token 级重要性差异提供了新范式。延伸阅读与仓库资源本文解析的论文解读文档收录于仓库的 Arxiv 一周进展报告大模型方向/20241004-20241010/重要性采样解锁Token级偏好对齐.md所属仓库是浙大团队开源的大模型系统学习资料库。若想补齐论文的前置知识建议配合以下仓库资源系统学习教材正文偏好对齐、奖励模型与 RLHF 相关内容可参阅 《大模型基础》教材/大模型基础 完整版.pdf或按章节查阅 《大模型基础》分章节内容共六章 PDF覆盖语言模型基础到大模型架构。论文列表大模型经典论文列表/readme.md 收录了从 Transformer、RLHF、DPO 到 LoRA、RAG 的经典论文与代码链接方便按章节追踪本主题的前沿进展。同系列报告对照阅读本仓库“Arxiv 一周进展报告”栏目还收录了多个偏好对齐方向的姊妹篇可与本文形成互补Cal-DPO解决 DPO 正例奖励下降缺陷2D-DPO片段 × 方面的二维细粒度对齐加权偏好优化按样本难度动态调权GenARM自回归奖励模型的测试时对齐关键公式速查表模块公式/定义作用数据噪声上界$P(S_w\leq S_l)\leq\exp(-\frac{2n_wt^2}{(b_w-a_w)^2})\exp(-\frac{2n_lt^2}{(b_l-a_l)^2})$揭示平均奖励噪声与 Token 波动的关系最优分布定义$\mathbb{E}_{y^t\sim\mathcal{D}^*(\cdotx,y^{t})}[r(y^t)]R^*$定义 Token 奖励平稳的理想数据分布重要性采样$\mathbb{E}{x\sim p}[f(x)]\mathbb{E}{x\sim q}[f(x)\frac{p(x)}{q(x)}]$用真实分布逼近目标分布最优-实际分布关系$D^*D/w$得到权重与分布的折算关系Token 权重$w_tk\cdot\exp(\mu\cdot\text{clamp}(\log\frac{\pi^}{\pi^-},L,U))$正负模型概率差 → 裁剪 → 权重TIS-DPO 目标BT 模型的 Token 级化 重要性权重让优化聚焦于高价值 Token阅读建议先读“DPO 局限性”一节理解问题动机再对照“重要性采样”公式理解权重来源最后结合实验结论评估 TIS-DPO 在自身任务上的适配价值——它在“数据不动、仅换损失函数”的约束下为偏好对齐提供了一条低成本、高回报的改进路径。赞分享文档教程大模型【免费下载链接】Foundations-of-LLMsA book for Learning the Foundations of LLMs项目地址https://gitcode.com/GitHub_Trending/fo/Foundations-of-LLMs点击查看免费下载相关推荐终极指南如何用PaddleNLP DPO对齐策略快速实现人类偏好学习终极指南如何用PaddleNLP DPO对齐策略快速实现人类偏好学习 PaddleNLP是飞桨深度学习框架推出的大语言模型开发套件支持高效的大模型训练、无损大模型NLP预训练微调模型推理服务模型量化分布式训练RLHF人工智能终极指南如何用DPO与ORPO算法实现小模型偏好对齐终极指南如何用DPO与ORPO算法实现小模型偏好对齐 在人工智能快速发展的今天让语言模型更好地理解人类偏好已成为关键技术挑战。smol course项目专注教程人工智能大模型NLP微调偏好对齐技术终极指南DPO vs KTO vs IPO性能对比分析偏好对齐技术终极指南DPO vs KTO vs IPO性能对比分析 在当今快速发展的AI领域偏好对齐技术已成为提升语言模型性能的关键手段。Alignment大模型微调RLHFNLP上一篇解锁Wallpaper Engine壁纸资源RePKG完全解密指南下一篇RePKG终极指南3分钟学会Wallpaper Engine壁纸资源提取与转换创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →