一个生成模型会写答案,一个决策模型会做有界判断,可光有这两者还不够定义一次受控的执行。10 月 2 日前后,Google 的 Agent Development Kit 与 OpenAI 的 Agents SDK 几乎同步发版(ADK Python 2.11.0 与 OpenAI Agents Python 0.23.0),两件发布都没讲太多新模型能力,而是不约而同地往「运行时控制语义」上补东西:取消信号、人工确认暂停、逐轮与逐会话的预算、本地记忆的持久化。这透露出一个判断——当 agent 的可信度不再只是答案质量一项,框架正在把控制权从模型手里,一点点挪进运行时本身。
接受边界在扩张:可信不再只看答案质量
过去评判一个 agent,我们习惯看它答得对不对、任务成了没。可一旦决策与执行被拆开,接受边界就从「答案质量」一项,扩到了四块各会出错的地方:其一是候选与阈值,模型给的概率如何变成可审计的状态转移;其二是审批与取消,一笔人工确认到底归谁、取消指令怎么传播;其三是预算与状态,预算记在哪里、历史怎么扫描与持久化;其人是人与模型的归属与兜底,谁拥有确认权、fallback 模型怎么定。这四块都不是模型智力的事,而是运行时状态语义,需要框架在版本之间保持一致。换句话说,agent 的可信度验收,从「答得好不好」拓展成「四个环节各自会不会出错」。
两个框架,同一条主线
把两家的 release notes 摆在一起,主线很清楚。ADK Python 2.11 允许 Runner、Workflow 与节点接收 abort_signal,客户端断开时就取消运行;工作流里的工具节点可用 RequestInput 暂停、等待人工确认;新增的 ModelConsultTool 能设逐轮与逐会话预算;本地 SQLite 记忆服务则补了一种状态持久化选项。OpenAI Agents Python 0.23 加了可配的 MCP 列举分页、可选的 Docker 移除保护、记忆整合轮次与加密历史扫描预算,并修了敏感 trace 元数据、函数工具审批归属与流式回调积压等处理。两边的具体能力不同,但都在回答同一组问题:何时停、谁来确认、预算记哪、历史怎么扫。这类 release notes 不是安全认证,也不提供任务成功率或人工接管率,它们只是把控制语义往前推了一步。
对框架选型的启示
对正在挑 agent 框架的团队,这次同步发版是个提醒:别只比「哪个模型更强、哪个示例更炫」,要看运行时是否把控制权交到了你手里。一个务实的检查清单是——能不能在客户端掉线时干净取消、能不能在危险动作前插一道人工确认、能不能按轮次或会话设预算封顶、记忆能否在不依赖外部服务的情况下持久化。这四条里缺任意一条,长任务或大批量并发都可能把成本与风险推到不可控。也要分清:框架给了这些开关,不等于你自动用好了它们,真正决定安全的是你在应用层画下的那几条边界线。
它的局限与下一步
这类能力再丰富,也有天花板。它们管的是「执行过程怎么受控」,管不了「这个任务该不该交给 agent、模型选没选对工具」。而且目前两边都没有给出跨版本兼容性矩阵,比如审批归属、取消传播、预算记账与持久化状态在不同版本间是否语义一致,这正是企业长期维护时容易踩的坑。可以预期,下一步框架之争会从「功能多不多」转向「控制语义稳不稳、可审计不可审计」。目前官方及行业暂未披露两版框架在真实负载下的验收指标,后续将持续跟进迭代动态。
一句话收尾:当模型会答也会做,框架真正值钱的不再是多一个示例,而是把停、确认、预算与记忆这些控制权稳稳交到运行时手里。