一句话:沙特一家零售商,把 agentic AI 跑成了受治理的生产级平台,而非试点

近期一个值得放进案例库的落地样本,是沙特零售商 Tamimi Markets 与 NorthBay Solutions 共建的 AskBaba。它不是一个聊天机器人试点,而是一个受治理的生产级平台:由十九个以上的 Claude 专用智能体在 Tamimi 自家的云环境内运行,覆盖门店运营、采购、财务、人力等多个职能,能把原本卡在 BI 队列里等几天的分析,变成秒级自助回答,并自动处理日常补货与需求预测。对还在试点里打转的团队,这是一个「从演示到生产」的参照系。

一个主管智能体路由到多个专用智能体,数据留在自家云 主管智能体Claude 路由统一调度 分析智能体 采购智能体 人力/财务… 规模与治理 十九个以上专用智能体可推理逾五亿条交易记录数据留在自家 AWS 环境受治理、秒级自助
图 1|AskBaba 以主管智能体路由专用智能体,数据主权留在企业侧。

从「BI 队列等几天」到「秒级自助」

这家零售商面对的是一类典型的企业难题:数百上亿条运营数据锁在 BI 队列和专家团队后面,而高价值的零售工作——订货、预测、客户互动——却仍靠人工和表格推进。AskBaba 的做法,是把一个 Claude 主管智能体放在前台,由它把每个请求路由给对应的领域专用智能体,在Tamimi 自家环境内用阿拉伯语与英语双语作答。此前要等 BI 队列排期才能拿到的常规分析,现在三十秒内自助解决、全天候可用;与采购订单平台打通的实时校验层,会逐笔交叉核对每日订单。这种「从几天到几十秒」的落差,正是生产级平台区别于试点 demo 的地方。

十九个专用智能体,覆盖门店到董事会

AskBaba 不是单个问答机器人,而是一组各有分工的专用智能体:门店经理问库存与排班、品类买手问采购与选品、财务与高管问经营全景、人力问编制、IT 问系统——每个角色都有对应的智能体在背后跑。一个 Claude 主管负责路由与编排,把请求交给最合适的领域智能体。它的可推理范围覆盖五亿多条交易行项目与一百三十多张仓库表,用自然语言就能查。值得注意的设计是:智能体直接交付在员工已经在用的协作工具里,而不是另起一个没人去的入口——这恰恰是很多试点失败、而生产平台成功的分水岭。

为什么能过治理关:数据留在自家环境

零售数据敏感且监管严格,一个外部 SaaS 拿走高价值数据几乎不可能过审。AskBaba 把平台跑在 Tamimi 自己的 AWS 环境内,数据不出企业边界,由企业自己掌握治理。Claude 同时驱动了两件事:一是智能体为业务做了什么,二是 NorthBay 如何设计、构建并交付这套系统。这种「模型能力加企业自主管控」的组合,让它在受监管行业里也能走到生产级。对中东乃至其他对数据主权敏感的市场,这个架构选择本身就是可复制的经验。

从等待到秒级、从试点到生产(观测值,部分仍在验证) 等待天数此前:按天 秒级自助如今:约 30 秒 采纳增长数月内超四成
图 2|从按天等待到秒级自助,采纳在数月内显著增长。

辩证看:标杆数字仍待验证

需要保持清醒:案例中提到的秒级响应、逾五亿条记录、采纳增长超四成等,是观测到的生产用量,其中部分指标仍在与 Tamimi 的联合验证过程中,读者应视为「厂商与合作伙伴披露的方向性结果」而非独立审计结论。另外,这类平台的成功高度依赖底层数据质量与权限设计——如果 SAP 与数据仓库里的字段口径不一致,智能体再强也会给出似是而非的答案。生产级落地的隐性成本,往往藏在数据治理而非模型调用里。

增量认知:企业级演化的标尺是「治理下生产」

AskBaba 给行业一个可记下的标尺:评价一个企业级智能体项目,不该只看「单点是否惊艳」,而该看「是否在治理下跑成了生产」。试点阶段谁都能演示一个亮眼场景;难的是把数据主权、权限、审计、多职能覆盖、既有工具集成全部凑齐,让它在真实组织里天天跑、被成百上千人用。Tamimi 这例的价值,正在于它把「治理」从 PPT 上的原则,变成了架构里的硬约束——数据不出域、主管路由、专用智能体分工、实时校验层。

边界与后续

需要标注:该案例由 Anthropic 与 NorthBay 作为参考客户披露,部分数字处于 consent 与验证流程中,跨行业、跨地区的泛化仍需观察。另外,多智能体在零售场景里的失败模式(如路由错配、跨职能口径冲突)尚未充分公开。后续值得跟踪的,是这类「受治理生产级平台」能否从零售复制到其他受监管行业,以及专用智能体的数量会不会随时间膨胀到需要新的治理层。

结语

企业级智能体的竞争,上半场比谁先做出惊艳 demo,下半场比谁先把治理、数据主权与多职能覆盖凑齐、跑成天天有人在用的生产平台。Tamimi 与 AskBaba 这例,把下半场的样子画得相当具体。