一个生成模型会写答案,一个决策模型会做有界判断,可光有这两者还不够定义一次受控的执行。10 月 2 日前后,Google 的 Agent Development Kit 与 OpenAI 的 Agents SDK 几乎同步发版(ADK Python 2.11.0 与 OpenAI Agents Python 0.23.0),两件发布都没讲太多新模型能力,而是不约而同地往「运行时控制语义」上补东西:取消信号、人工确认暂停、逐轮与逐会话的预算、本地记忆的持久化。这透露出一个判断——当 agent 的可信度不再只是答案质量一项,框架正在把控制权从模型手里,一点点挪进运行时本身。

接受边界在扩张:可信不再只看答案质量

过去评判一个 agent,我们习惯看它答得对不对、任务成了没。可一旦决策与执行被拆开,接受边界就从「答案质量」一项,扩到了四块各会出错的地方:其一是候选与阈值,模型给的概率如何变成可审计的状态转移;其二是审批与取消,一笔人工确认到底归谁、取消指令怎么传播;其三是预算与状态,预算记在哪里、历史怎么扫描与持久化;其人是人与模型的归属与兜底,谁拥有确认权、fallback 模型怎么定。这四块都不是模型智力的事,而是运行时状态语义,需要框架在版本之间保持一致。换句话说,agent 的可信度验收,从「答得好不好」拓展成「四个环节各自会不会出错」。

可信不再只看答案质量候选与阈值模型给的概率如何变可审计状态审批与取消人工确认归谁取消怎么传播预算与状态预算记在哪历史怎么扫存人与模型谁拥有确认fallback 怎么定接受边界从答案质量扩到四块各会出错的地方,框架把控制权前移进运行时
图 1|当生成模型产出答案、决策模型做有界判断,agent 的可信度不再只是答案质量一项。接受边界扩到四块各会出错的地方:候选与阈值、审批与取消、预算与状态、人与模型的归属与兜底。这四块都是运行时状态语义,需要框架保持一致

两个框架,同一条主线

把两家的 release notes 摆在一起,主线很清楚。ADK Python 2.11 允许 Runner、Workflow 与节点接收 abort_signal,客户端断开时就取消运行;工作流里的工具节点可用 RequestInput 暂停、等待人工确认;新增的 ModelConsultTool 能设逐轮与逐会话预算;本地 SQLite 记忆服务则补了一种状态持久化选项。OpenAI Agents Python 0.23 加了可配的 MCP 列举分页、可选的 Docker 移除保护、记忆整合轮次与加密历史扫描预算,并修了敏感 trace 元数据、函数工具审批归属与流式回调积压等处理。两边的具体能力不同,但都在回答同一组问题:何时停、谁来确认、预算记哪、历史怎么扫。这类 release notes 不是安全认证,也不提供任务成功率或人工接管率,它们只是把控制语义往前推了一步。

两个框架,同一条主线ADK Python 2.11abort_signal 取消RequestInput 人工确认预算与本地记忆OpenAI Agents 0.23MCP 分页可配Docker 移除保护记忆整合与加密扫描双方都往运行时补控制语义:何时停、谁来确认、预算记哪、历史怎么扫
图 2|Google ADK Python 2.11 与 OpenAI Agents Python 0.23 在同一天前后发布,不约而同补的是运行时控制:前者允许 Runner 接收 abort_signal 取消运行、工作流节点用 RequestInput 暂停等人工确认并设预算;后者加了可配的 MCP 分页、Docker 移除保护、记忆整合轮次与加密历史扫描预算。两条线指向同一件事——把控制权从模型手里挪进框架运行时

对框架选型的启示

对正在挑 agent 框架的团队,这次同步发版是个提醒:别只比「哪个模型更强、哪个示例更炫」,要看运行时是否把控制权交到了你手里。一个务实的检查清单是——能不能在客户端掉线时干净取消、能不能在危险动作前插一道人工确认、能不能按轮次或会话设预算封顶、记忆能否在不依赖外部服务的情况下持久化。这四条里缺任意一条,长任务或大批量并发都可能把成本与风险推到不可控。也要分清:框架给了这些开关,不等于你自动用好了它们,真正决定安全的是你在应用层画下的那几条边界线。

它的局限与下一步

这类能力再丰富,也有天花板。它们管的是「执行过程怎么受控」,管不了「这个任务该不该交给 agent、模型选没选对工具」。而且目前两边都没有给出跨版本兼容性矩阵,比如审批归属、取消传播、预算记账与持久化状态在不同版本间是否语义一致,这正是企业长期维护时容易踩的坑。可以预期,下一步框架之争会从「功能多不多」转向「控制语义稳不稳、可审计不可审计」。目前官方及行业暂未披露两版框架在真实负载下的验收指标,后续将持续跟进迭代动态。

一句话收尾:当模型会答也会做,框架真正值钱的不再是多一个示例,而是把停、确认、预算与记忆这些控制权稳稳交到运行时手里。