OpenAI Agents API 公测:一次调用创建一个生产级 Agent
9 月 10 日,OpenAI 将 Codex Harness 封装为云端 Agents API 正式公测。开发者只需指定四项参数,任务描述、模型、工具列表、运行环境,就能创建一个长时间运行的生产级 Agent。不额外收费,按 Token 和工具使用量计费。这可能是 2026 年 Agent 生态最重要的基础设施级发布。
Agents API 和传统 API 调用有什么本质区别?
传统 API 是"一问一答",每次调用独立、无状态、超时短。Agents API 是"给一个目标,自己干完",Agent 在云端持续运行,自主拆解子任务、调用工具、处理异常,直到完成或超时。它把"写 Agent 编排代码"变成了"描述任务目标",开发者的角色从编排者变成了目标定义者。
# 本片段仅供学习参考,禁止直接用于生产环境
# 输出为模拟演算结果,非线上真实业务输出
import openai
# Agents API 调用示例:创建自主运行的代码审查Agent
agent = openai.agents.create(
model="gpt-6-astra",
task="审查指定 GitHub 仓库的 PR,检测安全漏洞和代码规范问题,生成审查报告",
tools=[
{"type": "github", "permissions": ["read:pr", "read:repo"]},
{"type": "code_execution", "sandbox": "hosted"},
{"type": "file_output", "format": "markdown"}
],
environment={"type": "hosted", "timeout_seconds": 1800},
constraints={
"max_tool_calls": 50,
"require_human_approval_for": ["merge", "close_pr"],
"report_format": "structured_json"
}
)
# 异步获取结果
result = agent.wait(timeout=1800)
print(f"审查完成: {result.report_file}")
print(f"发现 {len(result.findings)} 个问题")
print(f"Token 消耗: {result.usage.total_tokens}")
| 对比维度 | 传统 API | Agents API |
|---|---|---|
| 交互模式 | 请求-响应 | 目标-完成 |
| 状态管理 | 无状态 | 有状态会话 |
| 任务持续 | 单次调用 | 可跨天持续运行 |
| 工具调用 | 开发者编排 | Agent 自主选择 |
| 计费方式 | Token | Token + 工具 |
| 适用场景 | 聊天/补全 | 复杂任务自动化 |
Ciridae 延迟降 4 倍是怎么做到的?
关键在于"就近执行"。Agents API 支持 9 家第三方沙箱,Ciridae 选择将沙箱部署在离用户最近的边缘节点,官方公布的延迟改善约为 4 倍。具体延迟数值官方未公开披露,实际改善幅度取决于部署架构和网络环境。
不过,这些优化数据主要来自北美场景。对于国内企业而言,由于网络环境和数据合规要求,实际延迟改善幅度可能远低于公布的 4 倍。国内访问 OpenAI API 本身存在网络不确定性,边缘节点覆盖范围也不一定包含中国大陆,这些数字在本地化场景中需要打折看待。
Agent 部署成本拆解
Agents API 虽然声称"不额外收费",但实际企业部署的总成本远不止 Token 费用。以下是一个中等复杂度场景(如代码审查 Agent)的成本估算:
| 成本项 | 一次性成本(万元) | 持续性成本(万/年) | 说明 |
|---|---|---|---|
| 模型 Token 费 | 0 | 3-8 | 按月均 5000 次调用估算 |
| 沙箱/运行环境 | 0.5-1 | 2-5 | 第三方沙箱托管费 |
| 开发与集成 | 3-8 | 1-2 | 首次开发+持续迭代 |
| 监控与运维 | 0.5 | 2-4 | 日志、告警、人工干预 |
| 合规与安全审计 | 1-2 | 1-3 | 数据出境评估、安全扫描 |
| 合计 | 5-11.5 | 9-22 | 中等规模团队(10-30人) |
需要注意的是,如果任务涉及敏感数据出境,国内企业还需额外投入数据脱敏和本地化代理方案,这部分成本可能再增加 30% 到 50%。
场景成熟度分级
Agents API 公测时间尚短,不同场景的落地成熟度差异极大。以下基于公开案例和技术可行性评估:
| 成熟度 | 场景 | 现状说明 |
|---|---|---|
| 已跑通 | 代码审查、PR 自动化 | OpenAI 官方演示场景,生态最完善 |
| 已跑通 | 文档生成与格式转换 | 结构化输出稳定,工具链成熟 |
| 试点中 | 数据分析与报表 | 可用但结果可信度需人工复核 |
| 试点中 | 客服工单自动处理 | 需配合企业内部工具链,集成成本高 |
| 试点中 | 自动化测试生成 | 生成的测试用例覆盖率不稳定 |
| 仍在 PPT | 全自动运维 DevOps | 涉及生产环境写操作,安全风险未解决 |
| 仍在 PPT | 自主金融交易 | 合规和风控链路远未打通 |
| 仍在 PPT | 法律文书自主起草 | 幻觉风险未消除,责任归属不清 |
官方公布的早期客户数据
OpenAI 公测公告引用了三家早期客户数据:Ciridae 评估分从 0.71 升到 0.85、延迟降 4 倍;SafetyKit 单案例成本降 60%;Hypha 失败响应降 86%。这些均为厂商自报的受控环境结果,不是第三方基准。
批判性分析:Agents API 的过热信号
"一次调用创建生产级 Agent"的叙事非常诱人,但需要冷静看待几个问题。第一,"生产级"的定义被模糊了,Agent 能跑通不等于能稳定跑在生产环境,异常处理、重试策略、幂等性保证这些工程细节才是真正的生产门槛。第二,公测阶段的成功案例大多集中在 OpenAI 自己的生态圈内(GitHub、代码执行沙箱),跨厂商集成的成功率缺乏第三方验证。第三,"不额外收费"的承诺在公测期有效,但历史经验表明,OpenAI 在产品稳定后调整定价策略并不罕见,企业不应将当前计费方式作为长期预算依据。
适用场景与限制
适用场景:开发团队有 OpenAI API 使用经验,任务以代码工程和文档处理为主,数据不涉及敏感信息出境问题,团队具备 Agent 编排和异常处理的工程能力。
限制:国内访问网络不稳定;沙箱环境对企业内部系统 API 的集成能力有限;Agent 遇到未预见的边界条件时可能产生不可控的工具调用链,需要配置 max_tool_calls 上限与人工审批节点。
还有一个发布时容易被忽略的硬约束:Agents API 公测版的数据驻留目前仅限美国,且暂不支持零保留(Zero Data Retention)。对强合规团队来说,这不是"成本高低"的问题——任务数据和代码必然落在美国区域,当前版本基本没有评估空间,只能等官方后续支持。
如果你们的场景属于"代码不能离开内网"这一类,本地运行的开发环境是另一条可对比评估的路线:SophCode Desktop 公测期免费,模型本地运行、本地代理只监听 127.0.0.1,装好 VSCode/JetBrains 插件后可自行验证出站流量。详见置顶评论。
📅 本文基于 OpenAI Agents API 公测公告(2026-09-10)、SDK 文档 v1.0.0。API 能力和定价以官方最新文档为准。
参考来源
- OpenAI 官方博客:Agents API Public Beta Announcement(2026-09-10)
- OpenAI SDK 文档 v1.0.0:Agents API Reference, Tool Integration Guide
- Ciridae 技术博客:Edge Deployment for Agent Sandboxes(2026-09)
- Hypha Engineering Blog: Reducing Agent Cold-Start Failures by 86%(2026-09)
- InfoQ 报道:OpenAI Agents API 生态分析(2026-09-12)
免责声明:本文基于公开信息撰写,不含投资建议。技术能力和定价可能随产品迭代变化,以官方最新文档为准。代码示例仅供学习参考,禁止直接用于生产环境。
更多推荐


所有评论(0)