Toward Effective and Reliable LLM Agents via Dynamic Ontology——迈向高效且可靠的大语言模型智能体:基于动态本体论
一、研究问题与动机核心问题现有LLM智能体在执行复杂、多步的领域任务时依赖隐式的模型知识或非结构化上下文导致证据使用不完整多步决策脆弱、易出错行为缺乏可控性和可追溯性错误难以定位和修复关键洞察需要一个显式的、可执行的中间层来连接LLM与外部工具/数据既表达领域语义又约束智能体的操作边界。二、核心方法OaK框架OaK Ontology-as-a-Kernel“本体即内核”框架组成将任务接口打包为一个内核K (S, F)SSchema模式定义任务相关的实体类型、属性、关系如酒店有价格、最少住宿天数等FFunctions函数集类型化的可执行推理函数如候选检索、约束检查、预算计算等动态构建流程两阶段构建阶段在训练数据上迭代模式构建LLM分析任务需求 → 起草模式 → 用OWL推理器HermiT进行逻辑一致性验证知识图谱实例化从语料中提取实体和关系按模式构建图分块-映射-合并知识推理函数组合从通用图操作符查找、遍历、过滤、聚合等组合出领域专用的可调用函数本体评估与修复用任务评分 评判模型Judge LLM诊断错误生成增/删/改建议反馈到下一轮迭代推理阶段冻结内核应用于测试数据对每个测试查询用冻结的模式从语料中构建实例图ReAct智能体只能通过内核中声明的函数和类型来访问数据和执行操作所有操作都受模式约束答案可追溯到图证据三、实验设置三个基准数据集覆盖不同任务类型TravelPlanner多日旅行规划交通、住宿、餐饮等约束协调CRMArenaProCRM工作流执行B2B/B2C含策略、数据库、文本等子任务ToolQA异构语料库上的组合式工具使用两个LLM基础模型DeepSeek-v4-flash 和 gpt-4o-mini对比基线ReAct、AFlow、MemP、ReCode、AgentSquare四、主要结果1. 性能提升主要结果在三个数据集上OaK在大多数指标尤其是宏观/最终通过率上取得最优或次优成绩尤其在需要跨组件协调TravelPlanner和跨表/规则查询CRMArenaPro的任务上优势明显2. 消融实验三大组件不可或缺移除函数组合→ 性能大幅下降智能体需从零重建多步操作移除函数模块→ 性能下降失去可重用过程即使有图访问移除迭代细化→ 性能下降单轮构建无法修复缺失约束和函数缺陷3. 迭代效果前几轮性能快速提升4-5轮后趋于平稳证明评判驱动的细化工具有效4. 案例分析TravelPlanner模式修复为Hotel实体补充minimum_nights和maximum_occupancy字段函数修复相应地在候选筛选函数中加入人数和最少住宿天数过滤展现了模式和函数协同修复的机制5. 成本分析OaK输入令牌更少函数封装减少上下文重建但输出令牌和运行时间更高图实例化开销若图可跨查询复用成本可分摊五、核心贡献总结提出“本体即内核”的新范式将领域语义和可执行操作显式化为可验证、可检查的内核自动化构建流水线从任务描述和训练数据自动生成模式、图、函数无需人工专家评判驱动的迭代细化机制利用任务分数和执行轨迹联合修复模式和函数缺陷实验验证在三个不同设定基准上验证了有效性、鲁棒性和各组件的必要性六、局限与未来方向局限图实例化有计算成本依赖LLM提取器和评判模型的质量需要可靠的任务评估器提供反馈信号未来工作可重用/增量更新的图以摊销构建成本引入更强验证或人类反馈用于开放式任务扩展操作符库和本体表示以应对更大、演进的领域OaK通过为每个任务动态构建一个可验证、可迭代修复的“语义操作”内核将智能体的行为约束在显式的领域知识图谱上从而提升了LLM智能体在多步推理任务中的有效性、可靠性和可解释性。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要大语言模型LLM智能体严重依赖于编码在模型参数中或以非结构化上下文形式呈现的知识。在特定领域任务中这导致重要的语义联系往往是隐式的。这常常导致证据使用不完整以及多步决策的脆弱性。本体论提供了一种将领域概念和关系外部化为机器可解释结构的方法但构建可用于任务的本体传统上需要领域专家的大量投入且难以规模化。自动化构建同样充满挑战一个在语义上看似合理的本体可能并不包含实际决策所需的关系结构。我们提出了OaK一个“本体即内核”ontology-as-a-kernel的框架用于为LLM智能体动态构建和细化任务导向的本体。给定任务需求和训练数据OaK构建一个本体及其知识图谱生成用于图推理的任务适应函数并利用评判judge反馈进行迭代细化。通过使相关概念和关系显式化该本体为知识检索和多步决策提供了基础。我们在TravelPlanner、CRMArenaPro和ToolQA上评估了OaK。结果表明OaK改进了标准LLM智能体加强了证据基础并提升了多步推理的可靠性。1. 引言大语言模型LLM在理解和生成自然语言以及知识密集型推理方面展现出了强大的能力。LLM通过指令和上下文示例来处理各种任务。LLM智能体通过将LLM与检索系统Zhu等人2025、工具和记忆Zhang等人2026bYang等人2026等外部组件耦合将这些能力从生成响应扩展到目标导向的任务执行。一个典型的智能体运行一个循环反复解读目标和规划然后通过工具调用或检索来行动并观察结果直到任务完成。最近的智能体架构进一步整合了反思和过程记忆等机制以及模块化工作流优化Shinn等人2023Fang等人2026Zhang等人2025Shang等人2025。这些发展使得LLM智能体成为一个适用于需要命令执行和超越单一响应的多步推理任务的通用框架。尽管取得了这些进展核心挑战已不再仅仅是智能体是否能行动而是当执行过程变长且更自主时其行为是否仍保持可控和可信赖。在每个中间步骤智能体决定检索什么、调用哪个工具及其参数因此这些选择中的任何错误都可能传播到后续步骤。因此仅凭最终答案的准确性既不能揭示支持性证据也不能说明工具调用的合理性。它还掩盖了记忆的影响以及执行失败的根源Wang等人2026。最近关于工具使用智能体的研究暴露了这一差距ToolEmu识别出高风险工具设置中现实的长尾安全故障而AgentDojo表明不可信的工具输出可以通过提示注入操纵智能体行为Ruan等人2024Debenedetti等人2024。反思、过程记忆和工作流优化可以改进规划或重用但它们通常将可接受的概念和行动序列集保持为隐式Madaan等人2023Shinn等人2023Zhang等人2025Fang等人2026。因此提示指令和工具描述引导智能体的行为但并未提供可执行的契约来规定其可以执行什么或应如何检查其结果。可靠的智能体必须在执行过程中约束行动以便输出能够连接到支持性证据并且可以识别和修复有缺陷的步骤。这些需求指向了LLM与其所控制工具之间的一个缺失层一种任务导向的表示它使领域语义和可执行行为都变得显式化。本体论提供了一个自然的基础因为它们以机器可解释的形式组织概念和关系Gruber1993Hogan等人2021。然而传统的本体论主要是描述性的它指定了领域中存在什么但不一定指定智能体可以做什么。它也未明确操作应如何参数化以及在接受其结果前必须满足哪些条件。因此我们在操作意义上使用本体论。在我们的设定中数据表示的需求被编码在模式声明中而计算和工作流的需求则由函数的控制流强制执行。这样的本体论不是被动的知识描述。它充当一个语义和过程契约界定智能体可以做什么并使执行过程保持可检查性。我们提出了OaK一个用于LLM智能体的动态“本体即内核”框架。这里动态性指的是任务条件化的构建。对于每个任务OaK自动构建解决该任务所需的模式和类型化推理函数。然后它从任务数据中实例化相应的知识图并在冻结最终内核以进行推理之前利用训练样本和下游任务反馈来细化模式和函数。OaK将任务接口打包成一个内核K(S,F),其中 S 是任务导向的模式定义了智能体可用的领域概念及其属性和关系。函数集 F 定义了如何通过这些类型化元素的可执行程序进行检索、过滤、遍历、投影、聚合和多步推理。给定 SOaK从任务数据中实例化一个模式引导的知识图谱 G。该图提供了函数操作所依据的证据。在推理过程中一个ReAct智能体解读查询以选择一个函数并绑定其类型化参数然后使用该函数推理出最终答案。内核调节对可用证据和操作的访问。在构建过程中OaK评估这些执行情况并利用任务反馈在最终内核应用于未见查询之前细化 S 和 F。我们在TravelPlannerXie等人2024、CRMArenaProHuang等人2026和ToolQAZhuang等人2023上评估了OaK。这些数据集在任务设定和推理要求上有所不同。结果和分析表明OaK改进了标准LLM智能体并加强了多步推理的证据基础。我们的贡献总结如下我们引入了本体作为LLM智能体的内核。它将任务导向的模式与类型化推理函数以及模式引导的证据图相结合。我们开发了一个自动化流水线用于构建经过验证的模式实例化其知识图谱并将通用操作符编译为可执行的领域函数。我们提出了评判驱动的细化方法该方法利用官方任务分数和执行轨迹在构建循环中诊断和修复模式及函数故障。在TravelPlanner、CRMArenaPro和ToolQA上的实验表明在两个基础模型上均取得了一致的提升而消融研究证实了函数组合、函数模块和迭代细化的重要性。2. 相关工作用于智能体的LLM。LLM在智能体中充当通用的推理和决策组件。它们使智能体能够解读目标并分解任务根据中间观察调整其行为。ReAct建立了一个有影响力的范式在单个执行轨迹中交织推理和行动Yao等人2023。除了反思MemP将成功的轨迹提炼为可重用的过程记忆而ReCode则通过递归生成的程序来表示规划和行动Fang等人2026Yu等人2025。AFlow和AgentSquare进一步通过搜索代码表示的工作流或由规划和记忆组件组成的模块化架构来自动化智能体设计Zhang等人2025Shang等人2025。这些方法逐步将智能体的控制从模型参数中移出转移到反馈循环和可重用程序中。它们主要改进了智能体如何组织和调整其控制过程而OaK则通过显式的领域模式和可执行的推理函数来构建任务接口本身从而补充了这一方向的工作。调整其控制过程而OaK则通过显式的领域模式和可执行的推理函数来构建任务接口本身从而补充了这一方向的工作。可靠的智能体。LLM智能体的可靠性超越了端点准确性它要求每一步都保持受控每个决策都基于证据并且故障可以追溯到原因Wang等人2026。基于反馈的方法如Self-Refine和Reflexion使用模型生成的批评或执行结果来修正响应和未来的决策Madaan等人2023Shinn等人2023。ToolEmu和AgentDojo通过识别高风险工具设置中的现实故障以及评估通过不可信观察进行的间接提示注入暴露了互补风险Ruan等人2024Debenedetti等人2024。AgentSpec通过将安全需求表达为结构化规则结合运行时触发器和谓词及执行机制来处理执行控制Wang, Poskitt, and Sun2025。与此同时知识编辑旨在修正或更新存储在模型参数中的事实而不是将其外化Zhang等人2026a。这些方法提供了反馈、策略执行或执行记录。然而它们通常将任务规则和允许的操作视为固定输入或将它们分散在提示和实现代码中。结果任务需求与智能体执行之间的接口难以检查和适应。OaK则将此接口显式化为任务特定的内核将模式与类型化推理函数相结合并利用任务分数和执行轨迹来细化两者。用于智能体的图。本体论和知识图谱为组织领域概念及其属性和关系提供了机器可解释的结构Gruber1993Hogan等人2021。近期工作将LLM与知识图谱整合以支持知识的结构化获取和表示以及基于它们的推理Pan等人2024。GraphRAG和G-Retriever进一步利用图结构来检索全局相关或关系型证据用于生成和问答Edge等人2024He等人2024。这些方法主要将图视为外部知识和检索层。这可以改进证据访问但本身并不为智能体指定可重用的任务级计算。OaK则构建一个任务导向的模式和一系列类型化推理函数。它将它们的执行建立在数据相关的知识图谱上。它利用下游任务反馈联合细化模式和函数。在OaK中动态性因此指的是为手头任务构建这个特定任务的模式和函数目录。然后它从任务数据中实例化相应的图并在冻结内核以进行推理之前对其进行细化。这种设计使得图不仅是检索知识的来源也是智能体的语义和过程接口所操作的、有根据的基质。3. OaK框架3.1 概述OaK构建一个动态的任务导向本体内核并用它在LLM智能体和领域任务之间进行调解。图1OaK概览。构建阶段左在本体内核上运行一个细化循环。推理阶段右冻结内核并让ReAct智能体通过调用函数作为工具来解决未见查询。内核有两个主要组件即模式 S 和函数集 F。模式 S 界定了可以表达的内容函数 F 界定了可以计算的内容。一旦冻结内核是智能体访问数据的唯一通道。它不能命名内核未声明的概念或调用内核未声明的计算。OaK分两个阶段运行。构建阶段在训练数据上运行构建内核并在循环中对其进行细化。推理阶段冻结内核并将其应用于未见查询。图1展示了完整的循环。3.2 本体构建循环3.3 本体驱动的LLM推理4. 实验4.1 任务我们选择了这三个基准测试。它们涵盖了互补的智能体设定包括多步规划、CRM工作流执行以及异构语料库上的组合式工具使用。这种多样性使我们能够评估OaK在多种任务设定下的适用性。对于每个数据集我们都遵循官方的评估协议和指标。TravelPlannerXie等人2024评估联合安排交通、餐饮、景点和住宿的多日计划。常识约束CS和硬约束HC分别衡量整体可行性和显式需求符合度。在每个系列中微观micro是满足的个别约束的比例宏观macro是满足所有适用约束的计划比例最终final要求两个系列都完全满足。表1在DeepSeek-v4-flash和gpt4o-mini上的TravelPlanner结果。所有条目均为百分比%。CS 常识约束通过率HC 硬约束通过率Final 最终通过率。每列最佳值以粗体显示次佳值以下划线显示。CRMArenaProHuang等人2026在合成的B2B和B2C组织中评估客户关系管理CRM任务。它们分别代表面向公司和面向个人客户的过程。工作流Workflow、策略Policy和数据库Database使用精确匹配exact match而文本Text对离散答案使用精确匹配对自由形式答案使用令牌级F1。ToolQAZhuang等人2023使用归一化精确匹配normalized exact match评估异构外部语料库上的组合式工具使用。4.2 实现细节我们在两个LLM基础模型上运行每种方法DeepSeek-v4-flash和gpt-4o-mini。这些基础模型贯穿步骤1的需求分析和模式起草、步骤2的知识图谱实例化、步骤3的函数组合和知识推理。本体评估器在所有设定中保持固定使用claude-sonnet-4.6。每一轮构建抽取覆盖训练集20%的全新样本循环最多运行5次迭代。ReAct智能体每个查询最多执行20步。4.3 主要结果TravelPlanner。在表1中OaK在两个基础模型下均取得了最高的最终通过率并在测试集的所有宏观级别指标上领先。在DeepSeek-v4-flash基础模型上ReCode在常识微观分数上最强而MemP在硬约束微观分数上仍有竞争力。这表明满足个别约束并不一定能产生一个联合有效的计划。TravelPlanner需要关于日期、城市、交通、住宿、餐饮和预算的决策在数天内保持兼容。这使得跨组件协调至关重要。OaK在其模式中显式地表示了这些实体和约束。其知识图谱将它们与可用选项连接起来。其模式适应函数进一步将候选检索、预算计算和约束检查整合到一个连贯的规划程序中。这种组合帮助OaK保留整个行程中的依赖关系解释了其更强的宏观和最终表现而不仅仅是改善孤立的约束满足。图2TravelPlanner上的消融结果。CRMArenaPro。在CRMArenaPro上表2报告了OaK在B2B和B2C组织下两个基础模型均取得最高的平均分Avg.并在几乎所有类别级别的比较中领先。其优势在策略和数据库任务上尤为明显。这些任务要求智能体将业务规则合规性与准确的记录访问相结合。面向工作流的基线在一些工作流任务上表现良好MemP展示了可重用程序的价值。然而当任务需要选择正确的记录、字段和关系时它们的性能会下降。OaK通过显式表示CRM记录类型、字段及其关系来解决这一限制。它还将用于跨表查询、规则检查和数值计算的可重用函数建立在此表示之上。其在gpt-4o-mini上的更大优势尤其是在数据库任务上进一步表明模式驱动的执行减少了必须仅由基础模型执行的多步数据推理量。ToolQA。对于ToolQA表3报告了OaK在两个基础模型下均取得了最高的加权平均性能并在大多数子集-基础模型组合上取得了第一名。ToolQA要求智能体在异构语料库上组合多个操作包括字段查找、记录过滤、关系遍历和聚合。因此成功取决于操作顺序与领域特定字段和关系语义的协调而非独立选择工具。OaK通过将每个问题映射到类型化且可重用的程序来满足这一要求这些程序的参数和操作受显式领域模式和基础知识图谱的约束。与优化全局工作流或进行过程重用但未显式表示数据关系的方法相比OaK更可靠地将每个操作与适当的记录和关系连接起来。关于多个随机种子的额外鲁棒性结果见附录C。4.4 消融研究我们使用DeepSeek-v4-flash将完整的OaK与三个变体进行比较。我们在附录D中提供了使用gpt-4o-mini的消融实验。w/o Function Composition移除了组合步骤并将通用操作符 O 直接暴露给智能体。表2在DeepSeek-v4-flash和gpt-4o-mini上的CRMArenaPro结果。所有条目均为百分比%工作流、策略、文本和数据库是任务类别分数。平均分Avg.是工作流、策略、文本和数据库的等权平均值。每列最佳值以粗体显示次佳值以下划线显示。表3在五个子集上的ToolQA结果使用DeepSeek-v4-flash和gpt-4o-mini作为基础模型。所有条目均为百分比%报告精确匹配准确率。平均分Avg.是各子集的加权平均值。每列最佳值以粗体显示次佳值以下划线显示。TravelPlanner。在图2中移除任何组件都会显著降低最终通过率。最大的性能下降是由移除函数模块或函数组合造成的。尽管直接访问图可以保留个别的硬约束决策但它没有提供用于协调整个计划中交通、住宿、餐饮和预算约束的可重用程序。没有函数组合智能体必须为每个查询重建这些依赖操作。这进一步削弱了全局计划的一致性。单轮变体表现也显著较差。这表明迭代细化对于修复缺失的约束和不完整的推理过程是必要的。图3CRMArenaPro上的消融结果。CRMArenaPro。在图3中完整的OaK模型在B2B和B2C设定下均优于所有变体。移除函数组合导致最大的性能下降因为智能体必须从通用操作符重建跨表查询、业务规则检查和数值计算。即使可以访问图移除函数模块也通过消除用于重复CRM操作的可重用程序降低了性能。图4ToolQA上的消融结果。ToolQA。在图4的所有子集上OaK均优于所有变体。移除函数模块的变体是最强的但仍明显低于完整模型。这表明仅靠图访问无法替代模式适应的程序。移除函数组合会严重损害性能因为智能体必须为每个问题重建查找、过滤、关系遍历、投影和聚合的多步序列。图5在TravelPlanner、CRMArenaPro和ToolQA上使用DeepSeek-v4-flash的循环进展。图6针对Hotel实体类型的模式修复。4.5 构建循环分析我们记录了在固定推理协议下每个基准测试在每轮构建后的主要聚合指标。在所有三个基准测试中图5显示在早期轮次中性能迅速提升。这表明评判引导的更新快速修复了缺失的约束和图映射缺陷同时弥合了函数级别的差距。曲线在第4-5轮后基本趋于平稳表明五轮的预算捕获了迭代细化的大部分收益。后期轮次的小幅波动可能源于模式和函数的微调以及每轮使用全新训练样本所带来的影响。4.6 案例研究我们以TravelPlanner为例说明评判反馈如何协调模式和函数级别的修复。模式修复。在早期的构建轮次中评判发现Hotel实体暴露了可见属性如价格和房间类型但遗漏了minimum_nights和maximum_occupancy约束。没有这些字段智能体可能选择一个看起来价格合适且合适的酒店但实际上无效因为它要求更长的住宿时间或无法容纳整个团队。因此评判为Hotel实体发出一个添加建议添加这两个约束字段如图6所示。更新后的模式使这些需求变得显式并允许智能体在规划期间将其纳入考量。函数修复。仅更新模式是不够的因为get_accommodation_candidates函数尚未使用新暴露的约束。本体评估器追踪剩余的失败计划并发出一个修改建议添加了针对人数和最短住宿时间的过滤器如图7所示。修复后只有当酒店的最大入住人数覆盖了图7针对get_accommodation_candidates的函数修复。团队规模且其最低住宿要求符合计划停留时间时该酒店才会被保留。4.7 成本分析我们使用运行时和令牌计数作为资源代理以最终通过率作为任务质量度量在TravelPlanner上将OaK与基线进行比较。在图8中OaK在使用比ReAct和MemP更少的输入令牌的同时取得了最高的最终通过率。这种输入减少表明模式适应的函数减少了从大型上下文中重建图操作的需求。这种优势伴随着比几个基线更高的运行时和输出令牌使用量主要是因为OaK在规划前实例化了一个查询特定的图。当图可以在相关查询间重用时时此构建成本可以分摊。总体而言OaK以额外的执行和输出成本换取更强的任务性能同时保持适度的输入上下文成本。图8在TravelPlanner上使用DeepSeek-v4-flash的资源成本与最终通过率对比。5. 结论与未来工作我们提出了OaK一个“本体即内核”的框架将领域语义转化为LLM智能体的可执行接口。OaK构建一个任务导向的模式并实例化一个模式引导的知识图谱。然后它从该图上的通用操作符合成类型化推理函数。官方任务分数和执行轨迹指导迭代修复。在TravelPlanner、CRMArenaPro和ToolQA上OaK在两个LLM基础模型上取得了最佳的整体性能。消融研究证实了函数模块、函数组合和迭代细化的重要性。这些结果表明将领域语义和推理过程显式化可以提高LLM智能体的有效性和可检查性。OaK仍然需要付出图实例化的成本。其质量也依赖于基于LLM的提取器和评判并且需要可靠的任务评估器。未来的工作可以研究可重用和增量更新的图以分摊构建成本为开放式任务提供更强的验证或人类反馈以及包含更丰富的操作符库和本体表示以适应更大且不断发展的领域这些都是有前景的方向。
上一篇/下一篇内容由系统自动关联
返回资讯列表 →