Codex Harness – OpenAI 开源的 AI Agent 底层执行框架
Codex Harness是什么Codex Harness 是 OpenAI 开源的 AI Agent 底层执行框架。Codex Harness 是驱动 Agent 的外骨骼负责任务理解、记忆保持、工具调用、进度展示、失败处理及人类审批等完整执行循环。开发者可通过 CLI、SDK 和 app-server 三大组件将 AI 智能体无缝嵌入自有产品、运营看板或业务系统无需再把工作流硬塞进通用聊天框。Codex Harness的主要功能Agent 执行循环驱动 AI 智能体完成从任务理解到结果输出的完整迭代流程。上下文与记忆管理在长对话中保持上下文连贯智能压缩和审查相关信息。工具与技能调用支持 AI 灵活调用外部 API、数据库及自定义业务工具。沙箱安全执行提供隔离的运行时环境确保文件系统与网络操作安全可控。流式事件传输支持实时向应用前端推送 AI 的思考过程与执行进度。人类审批介入在关键操作前自动暂停并请求人类确认实现安全的人机协作。会话持久化支持跨会话保存和恢复对话状态、线程与任务生命周期。前后端解耦架构将审批界面与底层执行循环分离便于无缝嵌入任意业务系统。微信关注回复“开源”加入AI开源项目交流群如何使用Codex Harness获取开源代码前往 GitHub 的openai/codex仓库克隆项目即可解锁完整的 Harness 工具库。CLI 快速执行用codex exec命令行工具运行有边界的 Agent 工作流适合脚本和 CI 自动化任务。SDK 编程集成通过 TypeScript 或 Python 版官方 SDK在代码中精准启动、恢复或流式传输 Codex 任务。App-Server 产品嵌入部署 Codex app-server通过 JSON-RPC 协议将 Agent 循环深度集成到自有业务系统。暴露业务工具将应用自身的 API、数据库及操作接口通过 MCP 协议暴露给 Harness让 AI 调用真实业务数据。配置审批流程在前端接入审批界面Harness 会在关键操作前自动暂停并请求人类确认实现安全的人机协作。流式事件监听订阅 Harness 的流式事件输出在应用前端实时展示 AI 的思考过程与执行进度。注入业务上下文向 Harness 传入产品界面状态、用户行为及业务规则让 AI 基于真实场景而非通用聊天框工作。Codex Harness的核心优势开源可嵌入开发者可将 AI Agent 执行循环直接嵌入自有产品、运营看板或业务系统无需把工作流硬塞进通用聊天框。前后端彻底解耦应用层掌控界面、上下文、工具与审批流程Harness 层专注 Agent 循环与沙箱执行通过 JSON-RPC 协议实现通信分离。Harness 设计即性能在 ARC-AGI-3 基准上仅优化 Harness保留推理上下文压缩GPT-5.6 Sol 得分从 13.3% 飙升至 38.3%Token 消耗减少 6 倍。沙箱安全执行内置隔离运行时环境严格控制文件系统、网络访问与运行时审批确保 Agent 动作可控、可审计、可回滚。原生 Human-in-the-Loop在关键操作前自动暂停并请求人类确认审批通过后才继续执行天然适合容错率极低的业务场景。流式事件与持久会话支持实时向前端推送 AI 思考与执行进度并可跨会话保存和恢复线程状态适配长周期工作流。模型无关的执行引擎Harness 是编排层而非模型层可与不同底层模型配合聚焦「如何管理模型」而非绑定特定模型。Codex Harness的项目地址项目官网https://developers.openai.com/blog/codex-as-a-platformGitHub仓库https://github.com/openai/codexCodex Harness的同类竞品对比对比维度Codex HarnessLangGraph核心定位将 Agent 循环作为可嵌入产品的底层执行引擎基于图状态机的 Agent 工作流编排框架架构设计前后端分离应用层控制界面/审批Harness 处理执行循环节点-边模型开发者定义显式状态流与检查点审批机制原生内置 Human-in-the-Loop关键操作自动暂停请求确认需开发者手动在节点间插入中断/审批逻辑沙箱执行内置隔离运行时控制文件系统、网络与工具访问无原生沙箱需依赖外部容器/环境隔离集成方式JSON-RPC 协议连接 App-Server流式事件实时推送作为 Python/JS 库直接嵌入代码检查点持久化适用场景已有成熟业务界面的产品需 AI 在底层执行且人类掌控审批需要精确控制多步骤状态流转的复杂工作流编排Codex Harness的应用场景财税合规自动化嵌入税务准备工作流AI 处理复杂税务逻辑并自动填充申报表税务师在关键字段审批确认已验证处理 7,000 份申报表、准备时间缩短约三分之一。企业云平台应用构建如 Cisco App Builder客户在其云控制平台内使用自然语言创建自定义应用Harness 在幕后处理权限校验与底层逻辑流转。物流调度异常处理在物流看板中嵌入 Agent调度员点击「Investigate delay」后Agent 自动调用 MCP 工具获取实时运单数据、分析延误原因任何改单操作都需人工审批。运营仪表盘嵌入将 Agent 直接集成到现有运营看板中实时分析业务指标、触发异常告警、执行修复动作无需切换至独立聊天界面。安全运维审批安全分析师在预警队列中直接调用 Agent 排查受影响服务状态高危操作自动触发 Human-in-the-Loop 审批后执行。Codex Harness的相关问题QCodex Harness 是什么和 Codex 模型有什么区别A Harness 是驱动 AI Agent 的底层执行引擎负责任务理解、记忆保持、工具调用、沙箱执行、流式事件和审批流程而 Codex 模型是生成代码/推理的「大脑」。Harness 是「外骨骼」模型是「大脑」两者配合才能跑通完整 Agent 工作流。Q开源协议是什么可以免费商用吗A Apache-2.0 协议可以完全免费商用。你可以自由嵌入自有产品、修改源码、二次分发无需开源你的上层业务代码。Q必须绑定 OpenAI 的 GPT 模型吗能用 Claude 或 DeepSeek 吗A Harness 是模型无关的编排层架构上不强制绑定 GPT。但当前官方实现默认对接 OpenAI API若要替换为其他模型需自行适配模型调用层。Q三大组件怎么选什么场景用哪个Acodex exec → 脚本、CI 流水线、后台一次性任务返回结构化结果。Codex SDK → 你在写应用代码需要编程式启动、恢复或流式传输任务。Codex app-server → Agent 要成为产品的一部分需要持久对话、实时事件、中断工作和审批处理。Q已有业务系统如何接入 HarnessA 通过 Codex app-server 的 JSON-RPC 协议连接。你的应用负责提供「产品界面 业务上下文 审批流程」Harness 负责「Agent 循环 沙箱执行」双方通过 Context in / Events out 双向通信。QHuman-in-the-Loop 怎么实现对业务侵入大吗A Harness 在检测到「需审批的操作」时自动暂停 Agent 循环通过流式事件向前端推送审批请求用户确认后 Harness 继续执行。业务端只需实现一个审批 UI 并响应 JSON-RPC 事件侵入性极低。《FDEDeepSeek Harness 企业级智能体构建实战训练营》大模型实战专家—周红伟 法国科学院算法博士/前阿里人工智能专家/马上消金风控负责人课程背景DeepSeek-V4在企业端落地时技术难点不在模型本身而在如何把模型能力嵌入真实业务流程。多数团队面临的问题集中在几个方面模型私有化部署后的资源与并发控制、智能体框架选型与组件协作方式、工具调用的稳定性、多轮对话中的状态管理、以及上线后缺乏系统的评测与优化手段。企业需要的不是单次演示级别的对话效果而是可复用、可监控、可维护的智能体工程能力。Harness作为智能体构建框架提供了从任务规划、工具编排到状态管理的完整链路。但框架本身的上手门槛不低组件之间的交互逻辑、工作流设计方法、异常处理机制都需要系统梳理。目前市面上多数课程要么偏重模型原理要么停留在简单调用示例缺少面向企业级部署与工程化落地的实操内容。本课程以 DeepSeek-V4 和 Harness 框架为核心围绕企业实际交付场景设计两天内容。第一天聚焦部署、框架组件、对话规划、工作流与评测监控解决从零搭建到可运行的问题。第二天深入复杂场景、知识库、工具安全、弹性伸缩与工程化运维解决上线后能稳定运行的问题。全程以动手操作为主最终目标是让学员回到团队后能独立完成一个可交付的智能体应用。课程收益掌握 DeepSeek-V4 的企业级部署方法能够根据业务规模选择单机、集群或混合云方案并完成推理引擎参数调优、安全基线配置和版本管理。理解 Harness 框架的分层架构与核心组件协作机制具备独立搭建智能体运行环境、配置记忆与规划组件、打通工具调用链路的能力。学会多轮对话中的状态管理、工具选择策略与异常重规划方法能够设计稳定的对话交互流程减少工具调用失败对用户体验的影响。掌握业务工作流从建模到落地的完整过程包括节点设计、人工审核接入、幂等控制与异常补偿能够将智能体嵌入现有业务流程而非独立演示。建立智能体的评测与监控体系能够设计离线评测集、定义核心指标、搭建运行监控面板并基于失败案例持续优化提示词与工具配置。培训时长2天课程大纲第一天 主题DeepSeek Harness 基础架构与核心能力第一部分 DeepSeek-V4 企业级部署与环境配置1.1部署形态选型1.1.1 私有化单机部署的资源评估与适用场景1.1.2 私有化集群部署的高可用架构与网络规划1.1.3 混合云部署下的数据边界与模型下发策略1.2 模型服务配置1.2.1 推理引擎参数与显存占用调优1.2.2 上下文长度与并发吞吐的平衡配置1.2.3 模型版本管理与灰度发布流程1.3 安全基线设置1.3.1 API网关鉴权与调用频率限制1.3.2 日志脱敏与审计留存策略1.3.3 内网隔离与模型访问白名单控制第二部分 Harness 智能体框架架构与核心组件2.1框架分层结构2.1.1 接入层负责协议适配与请求路由2.1.2 编排层负责任务分解与状态流转2.1.3 执行层负责工具调度与结果回传2.2 核心组件功能2.2.1 记忆组件管理短期上下文与长期知识2.2.2 规划组件实现任务拆解与路径选择2.2.3 工具组件封装外部API与内部服务2.3 组件间通信机制2.3.1 同步调用链路的超时与重试规则2.3.2 异步消息队列的可靠性与顺序保障2.3.3 组件状态同步与故障恢复机制第三部分 多轮对话规划与工具调用编排3.1对话状态管理3.1.1 用户意图识别与槽位填充流程3.1.2 对话上下文的裁剪与摘要策略3.1.3 多轮场景下的指代消解与澄清机制3.2 工具选择策略3.2.1 基于能力描述的工具匹配方法3.2.2 工具调用失败后的降级与替代方案3.2.3 并行工具调用与串行依赖处理3.3 规划触发条件3.3.1 用户显式请求触发规划流程3.3.2 系统根据上下文主动发起规划3.3.3 异常中断后的重规划与续跑逻辑第四部分 Agent 业务工作流设计与落地4.1工作流建模4.1.1 流程节点定义与条件分支设计4.1.2 人工审核节点与自动执行节点编排4.1.3 子流程嵌套与流程版本管理4.2 任务执行控制4.2.1 步骤级超时与整体流程超时设置4.2.2 执行进度的状态追踪与回调通知4.2.3 幂等设计与重复执行的去重保护4.3 异常处理设计4.3.1 业务异常与系统异常的分类处理4.3.2 失败重试次数与退避策略配置4.3.3 流程中断后的数据回滚与补偿操作第五部分 智能体评测、监控与持续优化5.1评测体系构建5.1.1 离线评测集的构建与标注规范5.1.2 端到端任务成功率与步骤准确率指标5.1.3 工具调用正确率与响应时延评估5.2 运行监控指标5.2.1 请求量、错误率与平均响应时间5.2.2 Token消耗统计与成本分摊分析5.2.3 工具调用失败分布与异常聚类5.3 优化迭代路径5.3.1 基于失败案例的提示词修正方法5.3.2 工具描述的补充与调用约束收紧5.3.3 模型版本更新与回归测试流程第二天 主题企业级智能体工程化与复杂场景实战第一部分 复杂业务场景下的智能体设计1.1多智能体协作模式1.1.1 主管智能体负责任务分配与结果汇总1.1.2 专业智能体按领域分工处理子任务1.1.3 智能体间通过结构化消息完成交接1.2 长周期任务处理1.2.1 任务拆解后的分阶段执行与检查点1.2.2 执行过程中的状态持久化与恢复1.2.3 人工介入的触发条件与暂停续跑1.3 跨系统数据协同1.3.1 企业数据库连接与查询权限控制1.3.2 内部API网关的鉴权与调用封装1.3.3 文件系统与对象存储的读写适配第二部分 知识库构建与检索增强2.1知识库搭建流程2.1.1 文档清洗与段落切分策略2.1.2 向量化模型选择与索引构建2.1.3 元数据标注与过滤条件设计2.2 检索质量优化2.2.1 查询改写与关键词扩展方法2.2.2 召回结果的相似度阈值调整2.2.3 重排序模型与业务规则结合2.3 知识更新维护2.3.1 增量更新与全量重建的触发条件2.3.2 过期知识的标记与下线流程2.3.3 知识冲突的检测与人工仲裁第三部分 工具生态集成与安全防护3.1工具接入规范3.1.1 工具描述格式与参数校验规则3.1.2 同步工具与异步工具的适配封装3.1.3 工具版本管理与向后兼容原则3.2 安全防护策略3.2.1 工具调用参数的白名单与范围限制3.2.2 敏感操作的二次确认与审批流3.2.3 工具返回内容的过滤与脱敏处理3.3 权限体系对接3.3.1 企业身份系统的单点登录集成3.3.2 基于角色的工具可见性与调用权限3.3.3 用户级数据隔离与租户边界控制第四部分 高并发与弹性伸缩设计4.1性能瓶颈分析4.1.1 模型推理延迟与排队等待时间4.1.2 工具调用串行阻塞与并发上限4.1.3 上下文长度对首字延迟的影响4.2 弹性伸缩策略4.2.1 基于请求队列深度的自动扩容规则4.2.2 模型副本的预热与空闲缩容策略4.2.3 工具服务独立扩缩与连接池调整4.3 缓存与加速4.3.1 高频请求的结果缓存与失效策略4.3.2 提示词前缀缓存减少重复计算4.3.3 语义相似请求的匹配与复用机制第五部分 智能体工程化交付与运维5.1配置与发布管理5.1.1 提示词与编排逻辑的配置化外置5.1.2 多环境配置隔离与发布审批流程5.1.3 智能体版本回滚与配置热更新5.2 日志与可观测性5.2.1 全链路请求追踪与调用链串联5.2.2 结构化日志埋点与关键事件记录5.2.3 告警规则配置与值班响应机制5.3 运维自动化5.3.1 健康检查探针与自动重启策略5.3.2 定期巡检任务与容量趋势分析5.3.3 故障复盘报告与改进项跟踪第六部分 企业落地案例拆解与实战演练6.1案例场景分析6.1.1 智能客服工单处理流程设计要点6.1.2 合同审查辅助工具的拆解思路6.1.3 数据分析助手的需求边界与交付6.2 实战演练任务6.2.1 从零搭建一个带工具调用的查询智能体6.2.2 为已有业务流程接入人工审核节点6.2.3 完成一次故障演练与恢复验证6.3 落地避坑总结6.3.1 提示词过度设计导致的维护成本6.3.2 工具数量失控引发的选择错误率6.3.3 忽视评测导致的上线后质量波动
上一篇/下一篇内容由系统自动关联
返回资讯列表 →