尧图精选

awesome-generative-ai-guide 论文速览:2024 年 6 月生成式 AI 前沿工作全景解读(46 篇)

🕒 发布时间:2026/10/2 2:15:15 📁 来源:尧图网络
文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载2024 年 6 月是生成式 AI 研究高度密集的一个月对齐与推理优化Step-DPO、mDPO、SRPO、RAG 体系重构LongRAG、DPA-RAG、PlanRAG、CRAG、评测方法论LiveBench、LLM-as-Judge、MMLU-Redux、安全红队WildTeaming以及基座模型Claude 3.5 Sonnet、DeepSeek-Coder-V2、Nemotron-4 340B等多条主线同时取得重要进展。本文以开源仓库 awesome-generative-ai-guide 的 2024 年月度论文列表 中的june_list.md为核心骨架逐篇梳理当月 46 篇代表性工作并结合仓库中的 RAG 研究表、AI 评测 2025 表、Agentic 搜索与检索表 与 调研论文精选 进行交叉印证与纵深解读帮助你快速建立对 2024 年中旬生成式 AI 研究格局的完整认知。注june_list.md属于 2024 年存档版本反映的是当时的领域状态仅作参考持续更新的当前资料请查阅 仓库索引 与 Understand AI 旅程其中 301 层级正是月度论文 研究表 年度报告的前沿 feed。一、对齐与偏好优化从整体打分走向细粒度过程监督2024 年 6 月偏好优化Preference Optimization领域最显著的趋势是从整体答案打分转向过程级、步骤级监督同时探索多模态场景与任务无关的鲁棒对齐。Step-DPO以推理步骤为单位的偏好优化数学推理要求长而精确的推理链每一环节的正确性都至关重要。Step-DPO6 月 28 日指出传统 DPO 对长链数学推理收益有限——模型难以定位错误答案中的具体错误根源在于缺乏细粒度的过程监督。Step-DPO 将单个推理步骤作为偏好优化的基本单元而非对答案整体打分配合自研的数据构建流水线产出了包含 1 万条步骤级偏好对的高质量数据集。论文还发现在 DPO 中模型自生成数据比人类或 GPT-4 生成的数据更有效后者存在分布外问题。仅用 1 万条偏好对、少于 500 步训练即可让 70B 参数模型在 MATH 上提升近 3%应用于 Qwen2-72B-Instruct 时MATH 与 GSM8K 测试集分别达到 70.8% 与 94.0%超越 GPT-4-1106、Claude-3-Opus、Gemini-1.5-Pro 等闭源模型。mDPO解决多模态偏好优化的无条件偏好问题将 DPO 迁移到多模态场景往往难以获得一致提升。mDPO6 月 17 日通过对比实验识别出多模态偏好优化中的无条件偏好问题模型忽略了图像条件。mDPO 在优化语言偏好之外同时优化图像偏好并引入 reward anchor 强制被选回答的奖励为正避免相对偏好优化中固有的似然下降问题。实验在两种规模的多模态 LLM 与三个主流基准上验证了有效性尤其在减少幻觉方面显著。SRPO任务无关的鲁棒偏好优化在线与离线 RLHFPPO/DPO的最优解高度依赖任务。SRPO6 月 3 日将从人类偏好学习建模为自改进过程通过 min-max 对抗目标联合优化自改进策略与生成策略其解与训练任务无关。该目标可重写为非对抗的离线损失用标准监督优化即可规模化训练无需奖励模型与在线推理。在分布外 XSUM 数据集上SRPO 经 5 轮自我修正后以 90% 的胜率领先 DPO 达 15%。DITTO用少量演示做对齐DITTO6 月 2 日Demonstration ITerated Task Optimization源于在线模仿学习将用户的少量演示10 条视为优于 LLM 当前输出的偏好信号廉价生成在线对比数据。在新闻、邮件、博客等领域DITTO 的胜率平均超过少样本提示、SFT 与其他自博弈方法 19 个百分点是快速定制 LLM 风格与任务行为的新路径。SELF-TUNING 与教中学Learn by TeachingSELF-TUNING6 月 15 日借鉴费曼学习法提出自监督的 SELFTEACHING 策略用记忆、理解、自我反思三类知识密集型任务增强原始文档提升 LLM 从原始文档获取新知识的能力配套的 Wiki-Newpages-2023-QA 三个数据集用于剖析记忆、抽取与推理能力。实验表明 LLaMA2 家族模型在知识获取任务上一致领先并保持原有知识。Can LLMs Learn by Teaching?6 月 20 日则提出 LbTLearning by Teaching三层次方法观察学生反馈、从反馈中学习、迭代学习初步证据显示LbT 可诱导弱到强泛化强模型通过教弱模型提升自己且学生多样性有益教多个学生可能优于教一个学生或模型自教。SaySelf教模型表达细粒度置信度SaySelf6 月 5 日用 LLM 自动分析多条采样推理链的不一致性总结特定知识的不确定性并用自然语言表达构造 SFT 数据再以精心设计的奖励函数做强化学习来校准置信度惩罚错误输出上的过度自信。在分布内与分布外数据集上均降低了置信度校准误差且生成的自反思理由合理可用。OmegaPRM自动过程监督与数学推理OmegaPRM6 月 5 日提出分治式蒙特卡洛树搜索算法用二分查找快速定位思维链中的首个错误并平衡正负样本高效收集了超过 150 万条过程监督标注来训练 Process Reward ModelPRM。结合加权自一致性将 Gemini Pro 的 MATH 成功率从 51% 提升到 69.4%相对提升 36%全程无需人工干预。自动化对齐综述随着 LLM 逐步超越人类能力基于人工标注的传统对齐方法难以规模化。Towards Scalable Automated Alignment of LLMs: A Survey6 月 3 日系统梳理了自动化对齐方法依据对齐信号来源将其划分为 4 大类并讨论其底层机制与可行性的关键要素。这与仓库 调研论文精选 中按主题组织的综述清单互为补充适合作为对齐方向入门的第一站。二、RAG 与检索增强架构重塑、偏好对齐与机制探秘6 月是 RAG 研究的大月既有面向长上下文的架构重塑LongRAG也有检索器与 LLM 知识偏好对齐DPA-RAG、决策场景的 PlanRAG、机制层面的可解释性探针以及 CRAG 综合基准。仓库的 RAG 研究表覆盖 2023 年 3 月至 2026 年 6 月将 RAG 研究分为 RAG 综述、RAG 增强、检索改进、对比研究、领域 RAG、RAG 评测、RAG 嵌入、输入处理与 RAG 框架九大类本月的多篇工作正是该表中 June 2024 一档的核心条目。LongRAG长检索器 长阅读器传统 RAG 中检索单元很短如 DPR 处理 100 词的维基段落检索器被迫在巨大语料中找针形成重检索器、轻阅读器的不平衡设计。LongRAG6 月 21 日将整个维基百科切分为 4K-token 单元比原来长 30 倍单元总数从 2200 万降到 70 万大幅减轻检索器负担NQ 上 answer recall1 从 52% 提升到 71%HotpotQA全维基answer recall2 从 47% 提升到 72%。将 top-k 单元约 30K token喂给长上下文 LLM 做零样本答案抽取NQ 上 EM 达 62.7%当时已知最佳HotpotQA 上 64.3% 与 SoTA 持平——全程无需训练。该工作为RAG 与长上下文 LLM 结合提供了路线图式的洞见仓库 RAG 研究表 亦收录了其后续版本2024 年 10 月融入长文档全局理解与细节事实双视角。DPA-RAG检索器与 LLM 的双重偏好对齐RAG 的一个核心难题是检索器难以对齐不同 LLM 的知识偏好。DPA-RAG6 月 26 日提出通用框架先构造偏好知识流水线并引入五种查询增强策略缓解偏好数据稀缺随后完成外部与内部双重对齐在重排器中联合集成 pairwise、pointwise 与 contrastive 偏好对齐能力外部对齐并在普通 SFT 之前加入预对齐阶段让 LLM 隐式捕获与其推理偏好一致的知识内部对齐。在四个知识密集型 QA 数据集上全面超越基线且无缝兼容黑盒与开源 LLM 阅读器。PlanRAG先规划后检索的决策式 RAGPlanRAG6 月 18 日面向 Decision QA决策问答其配套基准 DQA 取材于 Europa Universalis IV 与 Victoria 3 两款游戏含 Locating 与 Building 两个场景。PlanRAG 第一步由 LM 生成决策计划第二步由检索器生成数据分析查询比 SoTA 迭代 RAG 在 Locating 场景提升 15.8%、Building 场景提升 7.4%。仓库 RAG 研究表 将该文归类为 RAG Enhancement2024 年 6 月。From RAGs to rich parameters机制层面探针RAG 广受欢迎但其工作机制并不清晰。From RAGs to rich parameters6 月 18 日用机制分析方法揭示LM 在 RAG 中走捷径强烈偏向只利用上下文信息作答几乎不依赖参数记忆。具体手段包括因果中介分析Causal Mediation Analysis显示回答问题时参数记忆利用极少注意力贡献与剔除实验Attention Contributions and Knockouts显示最后一个 token 的残差流并非由问题主语 token 丰富而是由上下文中其他信息性 token 丰富。该捷径行为在 LLaMa 与 Phi 家族模型上普遍存在——这对 RAG 从业者的启示是检索质量直接决定答案质量模型自身的先验知识在 RAG 管道中可能处于闲置状态。CRAG面向真实世界的综合 RAG 基准CRAG6 月 7 日Comprehensive RAG Benchmark包含 4409 个问答对与模拟 Web / 知识图谱搜索的 mock API覆盖五个领域、八类问题实体热度从流行到长尾、时间动态从数年到数秒。评测显示即便最先进的 LLM 直接作答准确率仅 ≤34%朴素接入 RAG 也只提升到 44%最先进的工业 RAG 方案仍有 37% 的问题无法无幻觉作答。高动态、低热度、高复杂度的问题准确率更低。该基准还孕育了 KDD Cup 2024 挑战赛。仓库 RAG 研究表 将其归为 RAG Evaluation2024 年 6 月。Buffer of Thoughts思维缓冲与跨任务泛化Buffer of ThoughtsBoT6 月 6 日用 meta-buffer 存储从跨任务解题过程中蒸馏出的高层思维模板每个新问题先检索相关模板再自适应实例化推理结构buffer-manager 动态更新缓冲以随解题增多扩容。在 10 个推理密集型任务上显著超越前 SoTAGame of 24 提升 11%、Geometric Shapes 提升 20%、Checkmate-in-One 提升 51%平均成本仅为多查询提示法tree/graph of thoughts的 12%。有趣的是 Llama3-8BBoT 有潜力超越 Llama3-70B。三、长上下文从上下文窗口扩展到针海捞针6 月的长上下文研究既有窗口扩展技术CREAM也有能力评测基准LOFT、MM-NIAH并延伸出长上下文能否取代检索/SQL的范式之争。CREAM高效上下文窗口扩展与中段增强CREAM6 月 11 日Continuity-Relativity indExing with gAussian Middle通过操纵位置索引插值位置编码只需在预训练上下文窗口如 LLaMA2-4K内微调即可扩展到 256K 目标长度用截断高斯鼓励微调时从中段采样缓解长上下文 LLM 的 Lost-in-the-Middle 问题。论文宣称对 LLaMA2-7B Base/Chat 两版均实现Never Miss A Beat式成功扩展。LOFT长上下文模型能否取代检索、RAG 与 SQLLOFT6 月 19 日构建了需要数百万 token 上下文的真实任务基准评估 LCLM 的上下文内检索与推理能力。结论尽管从未针对这些任务显式训练LCLM 竟能与 SoTA 检索与 RAG 系统匹敌但在 SQL 类任务所需的组合推理上仍有挑战提示策略对性能影响显著。这为长上下文 vs RAG的路线之争提供了评测基石——仓库 RAG 研究表 后续也收录了 2025 年 1 月 Long Context vs. RAG 的直接对比研究可对照阅读。MM-NIAH多模态针海捞针Needle In A Multimodal HaystackMM-NIAH6 月 11 日是首个系统评估 MLLM 长多模态文档理解能力的基准含多模态检索、计数、推理三类任务。评测显示现有前沿 MLLM 仍有显著提升空间尤其在视觉中心的任务上。四、评测防污染基准、LLM 裁判校准与基准自身的可靠性6 月评测方向出现两大议题一是构建防污染、可自动打分的基准LiveBench二是审视LLM 当裁判与既有基准MMLU本身的可靠性。仓库的 AI 评测 2025 表 将评测研究分为 LLM 裁判与自动评测、基准与数据集、领域评测、多模态评测、推理与认知评测、评测方法论、鲁棒性与安全评测、评测综述八大类本月多篇工作正是这些方向的早期代表。LiveBench防污染且自动客观打分测试集污染新模型训练集混入旧基准测试数据是评测公平性的顽疾而众包人工/LLM 裁判又可能引入偏差。LiveBench6 月 27 日号称首个同时免疫两类问题的基准(1) 基于近期信息源频繁更新题目(2) 依据客观 ground truth 自动打分(3) 覆盖数学、编码、推理、语言、指令遵循、数据分析等多样化难题。题目源自近期数学竞赛、arXiv 论文、新闻与数据集并包含 Big-Bench Hard、AMPS、IFEval 等基准的更难防污染版。评测了众多闭源与 0.5B~110B 的开源模型顶级模型准确率仍低于 65%。题目、代码与模型答案全部开源月度更新。Judging the Judges给LLM 裁判打分Judging the Judges6 月 18 日以 TriviaQA 为基准、配以高一致性人工标注评测 9 个裁判模型与 9 个考生模型base 与 instruct 两版。核心发现应使用 Cohens kappa 而非简单百分比一致率衡量对齐高百分比一致率的裁判仍可能打出截然不同的分数Llama-3 70B 与 GPT-4 Turbo 与人类对齐极佳但按排名考生模型的能力反被 JudgeLM-7B 与词法裁判 Contains 超越后者人类对齐低达 34 分。论文还分析了指令长度效应与宽宏偏差leniency bias。这提醒从业者LLM-as-a-Judge 的对齐指标与排序能力可能是两回事。Are We Done with MMLU?MMLU-ReduxMMLU-Redux6 月 6 日通过新错误分类法系统分析 MMLU发现大量 ground truth 错误遮蔽了模型真实能力——Virology 子集 57% 的抽样问题含错误。研究者手工重标注了覆盖 30 个学科的 3000 道题并揭示与原始报告指标存在显著差异呼吁修订 MMLU 的错误题目。这是基准自身的可靠性成为研究对象的标志性工作。GenAI Arena生成模型开放评测平台GenAI-Arena6 月 6 日针对图像/视频生成模型认为 FID、CLIP、FVD 等自动指标难以捕捉生成质量与用户满意度构建了文本到图像、文本到视频、图像编辑三大竞技场覆盖 27 个开源模型运营四个月积累 6000 社区投票同时发布清洗后的偏好数据 GenAI-Bench。实验显示多模态模型模仿人类投票的能力仍滞后即便最好的 GPT-4o 在质量子分上 Pearson 相关仅 0.22其余接近随机。Estimating the Hallucination Rate of Generative AIEstimating the Hallucination Rate6 月 11 日从贝叶斯视角定义幻觉在 ICL 设定下幻觉是相对真实潜在参数低概率的生成预测。方法只需生成查询/响应并评估响应对数概率即可估计 CGM 产生幻觉的概率在合成回归与自然语言 ICL 任务上做了实证。To Believe or Not to Believe Your LLM不确定性量化To Believe or Not to Believe Your LLM6 月 4 日同时考虑认知不确定性epistemic缺乏知识与偶然不确定性aleatoric不可约随机性推导出信息论度量仅凭特殊迭代提示下的模型输出即可检测仅认知不确定性大即输出不可靠的状态可用于单答与多答场景的幻觉检测——这正是一些标准策略如对响应对数似然设阈值在多答场景失效之处。Scaling and evaluating sparse autoencodersScaling sparse autoencoders6 月 6 日用 k-sparse 自编码器直接控制稀疏度简化调参并改善重建-稀疏前沿同时减少死隐单元在 GPT-4 激活上训练了 1600 万隐单元的 SAE400 亿 token发现关于自编码器规模与稀疏度的干净缩放律并引入若干特征质量新指标。这是可解释性机械可解释性方向的重要工程推进。五、安全与红队从野外攻击到平衡的安全行为WildTeaming 与 WildJailbreak野外越狱挖掘与大规模安全数据集WildTeaming6 月 27 日从真实用户-聊天机器人交互中挖掘出 5700 个新颖越狱策略簇并组合多种策略系统化探索新越狱相比 SoTA 越狱方法攻击多样性与成功率最高提升 4.6 倍。配套产出 WildJailbreak——含 262K 对 vanilla直接请求与对抗复杂越狱提示-响应对的开源安全数据集为缓解过度安全行为数据集提供两类对比查询有害查询与形式上相似但无害的良性查询。实验识别出理想安全行为的训练特性适当防护而不过度拒答、有效处理 vanilla 与对抗查询、通用能力几乎不下降。Merging Improves Self-Critique Against Jailbreak AttacksMerging Improves Self-Critique Against Jailbreak Attacks6 月 11 日提出用外部批判模型与原始模型合并增强 LLM 自批判能力并在净化合成数据上微调显著降低对抗提示的攻击成功率是越狱防御的新思路。NATURAL PLAN自然语言规划基准NATURAL PLAN6 月 10 日是包含 Trip Planning、Meeting Planning、Calendar Scheduling 三项任务的自然语言规划基准直接用 Google Flights/Maps/Calendar 输出作为上下文免去工具使用环境。SoTA 模型在 Trip Planning 上仅 31.1%GPT-4与 34.8%Gemini 1.5 Pro复杂度升高时性能骤降——10 个城市时所有模型低于 5%。消融显示自纠正、少样本泛化、长上下文上下文内规划对规划能力改善有限。六、Agent目标分解、环境进化与多智能体协同6 月 Agent 方向横跨高层目标分解SelfGoal、多样环境自进化AgentGym、多 LLM 协同Mixture-of-Agents为仓库 Agentic 搜索与检索表 所追踪的推理、规划、工具使用、多智能体协作主线提供了早期素材。SelfGoal语言智能体的自适应子目标分解SelfGoal6 月 7 日针对缺乏详细指令的高层目标与延迟反馈环境在交互中把高层目标自适应当地分解为子目标树识别最有用子目标并逐步更新结构。在竞争、合作、延迟反馈三类环境中显著提升语言智能体性能。AgentGym跨环境自进化的通用智能体AgentGym6 月 6 日提出通用 LLM 智能体自进化的三元组多样环境、轨迹集赋予基础能力与先验知识、有效的可扩展进化方法。AgentGym 提供多环境多任务的并发探索平台、扩充指令数据库、基准套件与跨环境高质量轨迹配套 AgentEvol 方法验证了智能体在未见数据上的自进化潜力进化后智能体可与 SoTA 模型相当。Mixture-of-Agents多 LLM 集体智慧Mixture-of-AgentsMoA6 月 7 日构建分层 MoA 架构每层含多个 LLM 智能体每个智能体把上一层所有输出作为辅助信息生成响应。仅用开源 LLM 的 MoA 即登顶 AlpacaEval 2.065.1%GPT-4 Omni 为 57.5%并在 MT-Bench、FLASK 上超越 GPT-4 Omni。七、模型与架构MoE 代码模型、合成数据基座与状态空间模型Claude 3.5 SonnetClaude 3.5 Sonnet6 月 20 日是 Claude 3.5 家族首发官方称以中端模型的成本与速度在广泛评测上超越竞品与 Claude 3 Opus属当月基座模型层面的标志性发布。DeepSeek-Coder-V2开源 MoE 代码模型DeepSeek-Coder-V26 月 15 日从 DeepSeek-V2 中间 checkpoint 继续预训练额外投入 6 万亿 token在代码任务上达到与 GPT4-Turbo 相当的水平相比 DeepSeek-Coder-33B 在代码与数学推理上大幅进步编程语言支持从 86 种扩展到 338 种上下文从 16K 扩展到 128K。Nemotron-4 340B合成数据对齐的旗舰基座Nemotron-4 340B 技术报告6 月 14 日发布 Base/Instruct/Reward 三件套采用 NVIDIA 开放模型许可FP8 精度下可部署于单台 8 卡 DGX H100。值得注意其对齐流程中超过 98% 的数据为合成数据突出展示了用强模型生成合成数据训练更小模型的路径——这与当月 Persona Hub 的合成数据范式形成呼应。Open-Sora 1.2开放视频生成Open-Sora 1.26 月 14 日延续开源视频生成倡议目标是高效产出高质量视频开源模型、工具与全部细节简化视频生成复杂度。Transformers are SSMsMamba-2 与状态空间对偶Transformers are SSMs6 月 1 日通过结构化半可分矩阵的各种分解建立 SSM 与注意力变体之间的理论联系框架SSDState Space Duality并设计新架构 Mamba-2核心层是选择性 SSM 的改进版训练速度 2-8 倍于原版语言建模上与 Transformer 保持竞争力。这是当月最值得关注的架构理论工作之一。Self-MoE自专长专家组合Self-MoE6 月 17 日把单体 LLM 转化为由自专长专家MiXSE组成的组合模块系统用自生成合成数据构建专家模块共享基座 LLM配自优化路由无需人工标注数据与新增参数。相比基座 LLM 在知识、推理、数学、编码等基准上大幅提升且优于实例合并与权重合并兼具更好的灵活性与可解释性。Pixel Transformers每个像素都是 tokenAn Image is Worth More Than 16x16 Patches6 月 13 日质疑视觉架构中局部性归纳偏置的必要性vanilla Transformer 直接以单个像素为 token 也能在分类、掩码自编码、扩散生成三类任务上表现高性能尽管计算上不实际但对下一代视觉架构设计有警示意义。Simple and Effective Masked Diffusion Language ModelsSimple and Effective Masked Diffusion LMs6 月 11 日指出简单掩码离散扩散比此前认知的更有效有效的训练配方 简化的 Rao-Blackwellized 目标经典掩码语言建模损失的混合可训练仅编码器的语言模型支持高效采样与半自回归任意长度文本生成逼近自回归困惑度是扩散语言模型的新 SoTA。Guiding a Diffusion Model with a Bad Version of ItselfGuiding a Diffusion Model with a Bad Version of Itself6 月 4 日发现用模型自身更小、训练更少的版本而非无条件模型做引导可在不牺牲多样性的前提下解耦控制图像质量ImageNet 上 64x64 达到 FID 1.01、512x512 达到 1.25 的记录且同样适用于无条件扩散模型。Artificial Generational Intelligence强化学习中的文化积累Artificial Generational Intelligence6 月 1 日首次给出强化学习中涌现式文化积累的通用模型平衡社会学习与独立学习的训练设置可催生文化积累跨代际in-context 学习与训练时代in-weights 学习两种积累分别对应知识与技能积累为更开放的学习系统与人类文化建模开辟新路。八、合成数据十亿人格驱动的数据合成范式Persona Hub10 亿人格作为世界知识载体Scaling Synthetic Data Creation with 1,000,000,000 Personas6 月 28 日提出人格驱动persona-driven的数据合成方法论从网络数据自动策展 Persona Hub——10 亿个多样化人格约占世界人口的 13%作为世界知识的分布式载体可触及 LLM 中几乎所有视角从而规模化生成多样化合成数据。用例覆盖数学与逻辑推理题、指令用户提示、知识密集型文本、游戏 NPC 与工具函数的规模化合成展示其通用性、可扩展性、灵活性与易用性。这一用 LLM 制造训练数据的范式在当月与 Nemotron-4 340B98% 合成对齐数据相互印证也是 SELF-TUNING 自教学、WildJailbreak 合成安全数据等工作的共同背景。九、多模态视觉草稿板、表格理解与多模态基础模型Visual Sketchpad视觉思维链Visual Sketchpad6 月 13 日给多模态 LM 一块可视草稿板与绘图工具LM 依据自己绘制的视觉工件进行规划与推理线条、框、标记等比文生图更接近人类草绘也可调用专家视觉模型检测模型画框、分割模型画掩码。在几何、函数、图形、国际象棋等数学任务与复杂视觉推理任务上平均提升 12.7%数学与 8.6%视觉GPT-4oSketchpad 在 V*Bench80.3%、BLINK 空间推理83.9%、视觉对应80.8%上刷新 SoTA。MMTab 与 Table-LLaVA多模态表格理解Multimodal Table Understanding6 月 12 日提出直接基于表格图像理解的新问题构建大规模数据集 MMTab覆盖广泛表格图像、指令与任务并开发通用表格多模态大模型 Table-LLaVA在 23 个 held-in/held-out 基准上显著超越近期开源 MLLM 基线。十、训练目标、记忆化抑制与上下文扩展之外的新损失/新训练范式Goldfish Loss像金鱼一样别死记硬背Be like a Goldfish, Dont Memorize!6 月 14 日针对 LLM 记忆训练数据引发的隐私与版权风险对 next-token 训练目标做细微修改训练中随机采样一部分 token 从损失计算中剔除被剔除的 token 不会被模型记忆从而防止逐字复现训练集中的完整 token 链。在十亿级 Llama-2 模型预训练与从头训练上显著降低可提取记忆且下游基准几乎不受影响。TextGrad文本版的自动微分TextGrad6 月 11 日借鉴反向传播思想让 LLM 以文本反馈反向传播来优化复合 AI 系统中各组件从代码片段到分子结构API 沿用 PyTorch 语法与抽象。无需修改框架仅提供目标函数即可开箱使用将 GPT-4o 在 Google-Proof QA 的零样本准确率从 51% 提到 55%LeetCode-Hard 编码方案优化相对提升 20%还能改进推理提示、设计药物样小分子与放疗计划。十一、如何用好这份月度论文清单仓库使用指南这份 6 月清单是 awesome-generative-ai-guide 仓库月度最佳论文体系的一部分。仓库 README 明确将该体系定位为 Understand AI 旅程 301 层级的前沿 feed月度论文 研究表 年度报告与 2024 年 1 月到 5 月、7 月到 12 月的月度列表共同构成完整存档2025、2026 年的月度列表持续更新。阅读时建议按主题对表将当月论文映射到仓库 按主题浏览 的九个主题页LLM 基础、提示与上下文、检索与 RAG、微调、AI 智能体、评测与可观测性、多模态、生产与 LLMOps、安全与安全例如 RAG 相关论文对照 RAG 研究表、评测论文对照 AI 评测 2025 表、Agent 论文对照 Agentic 搜索与检索表配合综述使用对陌生主题先用 调研论文精选覆盖基础模型、提示工程、RAG、幻觉、PEFT、Agent、多模态、评测、对抗攻击九大主题建立认知地图再深入单篇注意存档属性2024 年列表头部明确标注 Archived反映的是写作当时的领域状态涉及版本、模型能力或数据规模的内容均以论文原文与当时环境为准。从 Step-DPO 的过程级监督到 LongRAG 的检索单元重构从 WildTeaming 的野外越狱挖掘到 LiveBench 的防污染评测2024 年 6 月的这 46 篇工作几乎覆盖了此后两年生成式 AI 应用研究的全部主线。把这份清单与仓库的研究表、综述与年度报告配合使用即可将单月论文串联成完整的领域脉络。赞分享文档教程人工智能大模型【免费下载链接】awesome-generative-ai-guideA one stop repository for generative AI research updates, interview resources, notebooks and much more!项目地址https://gitcode.com/GitHub_Trending/aw/awesome-generative-ai-guide点击查看免费下载相关推荐2025年6月终极指南7篇突破性AI论文深度解读与快速实践2025年6月终极指南7篇突破性AI论文深度解读与快速实践 GitHub推荐项目精选 / ml / ML Papers of the Week是一个专注于每周人工智能技术博客基于Awesome Generative AI Guide的生成式AI实战项目精选基于Awesome Generative AI Guide的生成式AI实战项目精选 本文精选了四个具有代表性的生成式AI实战项目这些项目不仅能帮助你快速掌握前文档教程人工智能大模型探索生成式人工智能的神奇世界 Awesome Generative AI Guide探索生成式人工智能的神奇世界 Awesome Generative AI Guide 生成式人工智能Generative AI是一种能够自动生成新数据的人文档教程人工智能大模型上一篇技术突破OpenCore Legacy Patcher如何重构老款Mac的生命周期下一篇深入解析 You-Dont-Know-JSTypes Grammar第三章JS 对象值类型、自动装箱与 Records/Tuples 提案创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
上一篇/下一篇内容由系统自动关联 返回资讯列表 →