9 月 10 日,OpenAI 将 Codex Harness 封装为云端 Agents API 正式公测。开发者只需指定四项参数,任务描述、模型、工具列表、运行环境,就能创建一个长时间运行的生产级 Agent。不额外收费,按 Token 和工具使用量计费。这可能是 2026 年 Agent 生态最重要的基础设施级发布。

Agents API 和传统 API 调用有什么本质区别?

传统 API 是"一问一答",每次调用独立、无状态、超时短。Agents API 是"给一个目标,自己干完",Agent 在云端持续运行,自主拆解子任务、调用工具、处理异常,直到完成或超时。它把"写 Agent 编排代码"变成了"描述任务目标",开发者的角色从编排者变成了目标定义者。

# 本片段仅供学习参考,禁止直接用于生产环境
# 输出为模拟演算结果,非线上真实业务输出
import openai

# Agents API 调用示例:创建自主运行的代码审查Agent
agent = openai.agents.create(
    model="gpt-6-astra",
    task="审查指定 GitHub 仓库的 PR,检测安全漏洞和代码规范问题,生成审查报告",
    tools=[
        {"type": "github", "permissions": ["read:pr", "read:repo"]},
        {"type": "code_execution", "sandbox": "hosted"},
        {"type": "file_output", "format": "markdown"}
    ],
    environment={"type": "hosted", "timeout_seconds": 1800},
    constraints={
        "max_tool_calls": 50,
        "require_human_approval_for": ["merge", "close_pr"],
        "report_format": "structured_json"
    }
)

# 异步获取结果
result = agent.wait(timeout=1800)
print(f"审查完成: {result.report_file}")
print(f"发现 {len(result.findings)} 个问题")
print(f"Token 消耗: {result.usage.total_tokens}")
对比维度传统 APIAgents API
交互模式请求-响应目标-完成
状态管理无状态有状态会话
任务持续单次调用可跨天持续运行
工具调用开发者编排Agent 自主选择
计费方式TokenToken + 工具
适用场景聊天/补全复杂任务自动化

Ciridae 延迟降 4 倍是怎么做到的?

关键在于"就近执行"。Agents API 支持 9 家第三方沙箱,Ciridae 选择将沙箱部署在离用户最近的边缘节点,官方公布的延迟改善约为 4 倍。具体延迟数值官方未公开披露,实际改善幅度取决于部署架构和网络环境。

不过,这些优化数据主要来自北美场景。对于国内企业而言,由于网络环境和数据合规要求,实际延迟改善幅度可能远低于公布的 4 倍。国内访问 OpenAI API 本身存在网络不确定性,边缘节点覆盖范围也不一定包含中国大陆,这些数字在本地化场景中需要打折看待。

Agent 部署成本拆解

Agents API 虽然声称"不额外收费",但实际企业部署的总成本远不止 Token 费用。以下是一个中等复杂度场景(如代码审查 Agent)的成本估算:

成本项一次性成本(万元)持续性成本(万/年)说明
模型 Token 费03-8按月均 5000 次调用估算
沙箱/运行环境0.5-12-5第三方沙箱托管费
开发与集成3-81-2首次开发+持续迭代
监控与运维0.52-4日志、告警、人工干预
合规与安全审计1-21-3数据出境评估、安全扫描
合计5-11.59-22中等规模团队(10-30人)

需要注意的是,如果任务涉及敏感数据出境,国内企业还需额外投入数据脱敏和本地化代理方案,这部分成本可能再增加 30% 到 50%。

场景成熟度分级

Agents API 公测时间尚短,不同场景的落地成熟度差异极大。以下基于公开案例和技术可行性评估:

成熟度场景现状说明
已跑通代码审查、PR 自动化OpenAI 官方演示场景,生态最完善
已跑通文档生成与格式转换结构化输出稳定,工具链成熟
试点中数据分析与报表可用但结果可信度需人工复核
试点中客服工单自动处理需配合企业内部工具链,集成成本高
试点中自动化测试生成生成的测试用例覆盖率不稳定
仍在 PPT全自动运维 DevOps涉及生产环境写操作,安全风险未解决
仍在 PPT自主金融交易合规和风控链路远未打通
仍在 PPT法律文书自主起草幻觉风险未消除,责任归属不清

官方公布的早期客户数据

OpenAI 公测公告引用了三家早期客户数据:Ciridae 评估分从 0.71 升到 0.85、延迟降 4 倍;SafetyKit 单案例成本降 60%;Hypha 失败响应降 86%。这些均为厂商自报的受控环境结果,不是第三方基准。

批判性分析:Agents API 的过热信号

"一次调用创建生产级 Agent"的叙事非常诱人,但需要冷静看待几个问题。第一,"生产级"的定义被模糊了,Agent 能跑通不等于能稳定跑在生产环境,异常处理、重试策略、幂等性保证这些工程细节才是真正的生产门槛。第二,公测阶段的成功案例大多集中在 OpenAI 自己的生态圈内(GitHub、代码执行沙箱),跨厂商集成的成功率缺乏第三方验证。第三,"不额外收费"的承诺在公测期有效,但历史经验表明,OpenAI 在产品稳定后调整定价策略并不罕见,企业不应将当前计费方式作为长期预算依据。

适用场景与限制

适用场景:开发团队有 OpenAI API 使用经验,任务以代码工程和文档处理为主,数据不涉及敏感信息出境问题,团队具备 Agent 编排和异常处理的工程能力。

限制:国内访问网络不稳定;沙箱环境对企业内部系统 API 的集成能力有限;Agent 遇到未预见的边界条件时可能产生不可控的工具调用链,需要配置 max_tool_calls 上限与人工审批节点。

还有一个发布时容易被忽略的硬约束:Agents API 公测版的数据驻留目前仅限美国,且暂不支持零保留(Zero Data Retention)。对强合规团队来说,这不是"成本高低"的问题——任务数据和代码必然落在美国区域,当前版本基本没有评估空间,只能等官方后续支持。

如果你们的场景属于"代码不能离开内网"这一类,本地运行的开发环境是另一条可对比评估的路线:SophCode Desktop 公测期免费,模型本地运行、本地代理只监听 127.0.0.1,装好 VSCode/JetBrains 插件后可自行验证出站流量。详见置顶评论。

📅 本文基于 OpenAI Agents API 公测公告(2026-09-10)、SDK 文档 v1.0.0。API 能力和定价以官方最新文档为准。


参考来源

  1. OpenAI 官方博客:Agents API Public Beta Announcement(2026-09-10)
  2. OpenAI SDK 文档 v1.0.0:Agents API Reference, Tool Integration Guide
  3. Ciridae 技术博客:Edge Deployment for Agent Sandboxes(2026-09)
  4. Hypha Engineering Blog: Reducing Agent Cold-Start Failures by 86%(2026-09)
  5. InfoQ 报道:OpenAI Agents API 生态分析(2026-09-12)

免责声明:本文基于公开信息撰写,不含投资建议。技术能力和定价可能随产品迭代变化,以官方最新文档为准。代码示例仅供学习参考,禁止直接用于生产环境。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐