深度 · 小互解读

OpenAI 将 Codex 的底层核心框架 Agent Harness 开源:你可以轻松将 Agent 接入自己的业务系统

OpenAI 把管理上下文、工具调用、沙箱和审批的 Codex 执行底座开放出来。开发者不用从零造 Agent 框架,就能让 Codex 进入现有的看板、工单和业务后台。

一分钟速览
  • Codex 不再只能待在编程插件或聊天框里;它的 Agent 能力可以接进物流后台、工单、报税和监控系统。
  • 用户继续在原来的系统里工作:系统把当前对象和业务状态交给 Codex,重要操作按规则等待人工批准,结果再写回正式记录。
  • 开发团队不用从零搭建上下文记忆、工具调用、沙箱、进度和审批机制,可以直接复用 Codex 已有的开源组件。
  • 开源的是 CLI、SDK、app-server 等执行底座;模型、托管服务、IDE Extension 和 Codex cloud 没有一起开源。

OpenAI 这次到底开源了什么

OpenAI 开源了让 Codex 能连续干活的底层框架:Agent Harness

可以把大模型想成一个聪明的大脑。大脑会思考,却不会自动知道自己正在处理哪张工单,也不会天然记住上一步做到哪里,更不知道该去哪个系统查数据、哪些操作可以直接执行、花钱或改记录前要找谁批准。要让它真正进公司上班,还得配上工作记录、工具箱、门禁和请示流程。Agent Harness 就是这套“上岗系统”。

这次开放带来三件很实际的事:

  • 对开发者:少造一层基础设施。 上下文记忆、工具调用、沙箱、进度和审批机制,都可以复用 Codex 已有的开源组件。
  • 对产品:AI 可以进入现有软件。 物流后台、工单系统、报税软件和监控看板都可以成为 Codex 的工作界面。
  • 对用户:不用把工作重新搬进聊天框。 原系统提供当前对象和业务状态,结果仍回到原来的正式记录。

放进物流后台,它可以是这样:调度员选中一票延误货物,Codex 直接拿到当前状态并调查原因;遇到花钱改订等有后果的动作,系统按规则停下来等人批准。

不过,先把边界说清楚:OpenAI 没有把整个 Codex、模型和云服务全部开源。明确开放的是 Codex CLI、SDK、app-server 等 Harness 与接入组件;模型访问、托管服务、IDE Extension 和 Codex cloud 仍是独立部分。准确地说,开发者拿到的是 Codex 的 Agent 执行底座和接入层,不是整套 Codex 的自托管版本。

为什么光有模型,还做不成真正的 Agent

一次普通的大模型调用很简单:输入问题,等待回答。可一旦任务从“回答”变成“完成”,缺失的东西会迅速暴露出来。

模型要知道自己正在处理哪个对象;要记得此前做过什么;要读取文件、日志或业务记录;要调用外部工具;要在失败后换一条路线;还要区分哪些动作可以自动执行,哪些动作必须停下来等人批准。任务持续几十分钟甚至跨越多轮时,它还得压缩旧上下文,又不能把早期的重要判断一起忘掉。

Agent Harness 就是负责记住进度、调度工具、限制权限并继续推进任务的执行系统。

Harness 为什么重要,最直接的问题是:同一个模型换一套运行方式,结果会差多少?OpenAI 给出了一个很有分量、但也很容易被滥用的数字。