模型之上,平台开始卖「托管」

云栖大会 9 月 22 日的信息量密集,除了主论坛的算力底座与上午的办公套件,MaaS 与 Agent 技术主论坛藏着另一层产品线:阿里巴巴集团战略副总裁、ATH 事业群 MaaS 业务线总裁文征宣布千问 AI 平台全面升级——在模型服务基础上,新增 Agent 服务与行业 AI 解决方案两个层级,并推出 API 优速模式、Agent Studio 和千问 AI 座舱解决方案。

升级的背景是一条陡峭的增长曲线:过去一年阿里云 MaaS 平台服务的客户数增长六倍。文征的观察是,订单、代码、内容和业务流程开始主动发起调用,Agent 正在进入企业核心流程,企业需要的不再只是一个模型 API,而是覆盖模型供给、生产运行、Agent 构建与托管的完整体系。他给这轮变化起了个量化框架——单任务价值、Token 生产效率和单 Token 能力共同决定「智能价值密度」,智能正从被调用走向被交付。

千问 AI 平台三层升级:模型服务、Agent 服务、行业解决方案模型服务First and Best 供给Agent 服务托管与治理行业 AI 解决方案座舱等垂直场景Agent Studio:按任务自动路由模型 · 24 小时不间断托管支持企业内部知识数据与外部软件服务接入Agent 自进化引擎:运行观测 → AI 评测器 → AI 优化器 → 自动验证在上下文交互中持续调优,闭环回流
图 1|升级的关键不是新增一个入口,而是把「托管运行」本身做成了产品:Agent Studio 承接构建与治理,自进化引擎把评测、优化、验证串成持续回路。

Agent Studio:把托管运行做成产品

新发布的企业级全栈 Agent 服务平台 Agent Studio 是这轮升级的核心。它的能力清单包括:按任务自动路由选择模型、24 小时不间断托管运行、支持企业内部知识数据和外部软件服务接入。更值得注意的是随行发布的 Agent 自进化引擎,四个组件串成一条闭环——运行观测、AI 评测器、AI 优化器、自动验证——让智能体在上下文交互中持续调优。托管这件事的分量在于:智能体长任务最怕中途崩坏,失败重试、断点恢复、持续观测原本是每个企业自建的工程负担,现在被平台产品化承接下来。

模型供给侧的数字同样围绕 Agent 负载展开:决策链路长、并发高、时延敏感,平台通过 FlashBoot 与 UniScheduler 调度异构算力,把模型弹性启动时间从 1200 秒压缩到 70 秒,可以在 1 分钟内拉起 1 万个 Pods;首 Token 延迟降低 38%,Prompt Caching 成本最高节省 95%。生产级承诺包括 99.9% SLA、十亿级单客户峰值 TPM,以及面向敏感场景的 CMaaS 机密推理服务。接入方式上,开发者可以通过 API 集成或订阅 Token Plan,在已支持的常用 AI 工具里直接调用相应模型。Token Plan 这条线值得单独留意:订阅制把按量计费的 API 账单换成可预算的月费,且调用入口从开发者代码前移到常用工具里——平台争夺的不再只是企业的开发者,还有每个员工的直接用量。结合文征那句「从 Token 到结果」的价值重定义,平台层竞争正在从单价与速率,转向谁能替企业兜住智能体运行的整个生命周期。

面向 Agent 负载的平台调度(厂商口径)弹性启动1200 秒 → 70 秒(FlashBoot/UniScheduler)1 分钟内拉起 1 万个 Pods时延与成本首 Token 延迟降低 38%Prompt Caching 成本最高省 95%生产级承诺:99.9% SLA · 十亿级单客户峰值 TPMCMaaS 机密推理服务接入方式:API 集成 / Token Plan 订阅 / 常用 AI 工具内直接调用过去一年 MaaS 平台客户数增长六倍(厂商自述)
图 2|决策链路长、并发高、时延敏感的 Agent 负载正在重塑平台调度目标:启动速度、首 Token 延迟与缓存成本成了新账本,数字均为厂商口径。

三条产品线拼成一张全栈地图

把同一天的三场发布连起来看,阿里在智能体栈上的布局结构相当清晰:李飞飞主讲的 Agentic Cloud 管基础设施——算力、存储、执行环境;文征主讲的千问 AI 平台管模型服务与 Agent 托管——供给、路由、观测、进化;千问办公的企业上下文管业务应用——把企业数据变成智能体可调用的上下文。三层各守一段,叙事上互相引用,形成从芯片到办公场景的完整链条。

辩证地看两处张力。其一,文征提到平台的价值不是定义所有应用,而是让更多应用生长出来——但自进化引擎里的 AI 评测器与自动验证既是卖点也是边界:自动验证能覆盖到什么深度、错误进化的责任如何界定,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,弹性启动、首 Token 延迟、缓存成本这组数字全部是厂商口径,横向可比性有限。此外,2032 年 20GW 的算力投入规划已在基础设施发布中披露,本篇不再展开;座舱解决方案的行业落地细节,也有待后续论坛与客户案例补全。