OpenAI 开源 Codex Harness:从「模型」到「能干活的系统」,Agent 执行框架到底开源了什么?
·
一、Harness 是什么:Agent 的「外骨骼」
一个能真正运行的 Agent,不等于好模型 + 好 Prompt,还需要一层负责「干活」的执行系统,官方把这层叫 Harness:
- 管理会话状态与长对话记忆
- 调用工具、执行代码,并做流式执行与错误恢复
- 沙箱权限限制与人工审批请求
- 让任务跨多轮持续进行
OpenAI 开源的是这层执行系统,不是模型权重。模型访问与托管服务仍是单独一层。
二、三大组件,覆盖三种接入方式
- codex exec(CLI):跑「有边界」的 Agent 工作流并返回结构化输出,适合脚本、CI 或一次性后台任务
- Codex SDK(TypeScript / Python):程序化接口,可在应用代码里启动、恢复、监听 Codex 任务
- app-server(JSON-RPC 协议):把应用连接到本地 Codex 进程,支持持久化会话、事件流、任务中断、暴露专有工具与人工审批——适合把 Agent 真正嵌入产品
三、关键数据:同一个模型,效果差三倍
OpenAI 在官方博客给出一个反直觉的对照实验:在 ARC-AGI-3 基准上,只对 Harness 做两项调整——保留推理(retained reasoning)与 上下文压缩(context compaction)——就让 GPT-5.6 Sol 的得分从 13.3% 飙升到 38.3%,输出 Token 数量减少到约六分之一。
这说明两件事:
- Agent 的工程层(执行系统)对最终效果的贡献,常常被低估
- 「省 token」不是玄学,是执行层设计里可以量化的工程优化
数据为 OpenAI 自报口径,基准与实现细节以官方博客为准,建议作为方向参考而非绝对值。
四、已落地的场景
- 税务领域:合作方用该框架处理了约 7000 份申报表,准备时间缩短约三分之一
- 思科(Cisco):用 Codex SDK 在其云平台上构建了自然语言创建云应用的 App Builder
- 官方演示:虚拟物流仪表板里,选中延误货单后 Agent 自动关联数据、调用 MCP 工具、生成重订方案,并在执行写入前弹出人工审批对话框——界面、数据与审批权留在产品里,AI 只负责底层干活
五、对开发者的意义
- 不用再把人硬塞进聊天框:Agent 可以嵌进自己的产品、工程工具、运营看板,成为产品里的一段可编程能力
- 与 Claude Cowork 的正面竞争:Anthropic 的 Claude Cowork(截至 5 月已有至少 60 万家机构尝试)走「计算机使用」路线;OpenAI 这次把执行框架开源,等于把「Agent 基建」做成开源默认项
- 机会在更上层:执行框架免费开源了,真正的机会在垂直场景的 Agent 产品、MCP 生态、以及验收与安全层
六、安全提醒
能自主执行任务的 Agent 意味着更大的攻击面。官方也提示:隔离密码与敏感数据、避免无人监督的长任务。接入生产前,先给 Agent 划清权限边界与人工审批点。
葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。
更多推荐



所有评论(0)