一条清晰的边界:客户数据不出信任域
2026 年 9 月 15 日,在 Dreamforce 期间,Salesforce 与 NVIDIA 共同公布 Koa,把它定位为面向 Agentforce 的 CRM 推理模型。NVIDIA 创始人兼首席执行官黄仁勋与 Salesforce 首席执行官 Marc Benioff 同台介绍了这次合作。
技术底座是 NVIDIA 的开源模型 Nemotron-3-Super-120B,Salesforce 在此基础上做后训练。按 Salesforce 平台与工程负责人 Rohan Kumar 的说法,训练语料来自近三十年 CRM 部署经验所构建的合成数据集,覆盖制造、金融服务、医疗与旅行等 14 个以上行业,模拟的是销售与客服人员真实会做的动作:生成线索、评估商机、分派并解决服务工单。他强调训练与推理阶段都没有使用任何客户数据。
模型权重由 Salesforce 持有,训练与推理都跑在自有基础设施上,客户数据不跨越第三方的信任边界。这一点是这条路线与「把请求路由给前沿模型」最本质的区别。
训练什么:不是 CRM 知识,是工具调用序列
Koa 要解决的问题,和「模型知不知道 CRM 概念」无关,而是「模型能不能在多步流程里把工具按正确顺序调对」。
Salesforce 的做法是监督微调加上强化学习,强化学习部分使用了群体相对策略优化(GRPO),并配合 NVIDIA 的 NeMo RL、NeMo Gym 与 NeMo AutoModel 工具链。与 Koa 同步公开的还有一篇 arXiv 论文(编号 2609.15066),描述了一套被称作模拟到奖励的流程:把企业工作流的规格——用 Agent Script 这种 Salesforce 为 Agentforce 设计的声明式语言书写——展开成带人设条件的多轮任务。对于公开的工具调用领域,工作流结构则直接合成,而不是从 Agent Script 派生。
关键在于奖励的设计。任务是否完成的判定标准,是模型有没有对依赖数据的请求调出正确序列的工具,而不是它有没有写出看起来通顺的文字。这条设计把训练的优化目标从「像不像」拉到了「做没做对」,也是领域专用模型与通用模型在同一场景下表现分化的根源。
一组要分开读的口径
关于效果,目前公开的是 Salesforce 的自述数据:在自建的 CRM Bench 上——包含更新商机、分派工单、安排跟进这类真实任务——Koa 在 CRM 动作上匹配或超过了领先模型,并且错误率降低到三分之一。
这里有几点需要分开看。这是厂商自建基准上的自述结果,测试集、基线模型清单与统计方法都没有完整公开;论文口径与新闻稿口径在性能描述上并不完全一致;错误率降到三分之一对应的绝对值是多少,官方也没有给出。因此这个数字适合当作方向性信号,不适合当作采购依据。
部署形态与试点名单
Koa 会以托管模型的形式出现在 Salesforce 的生成式 AI 模型目录里,可以在组织范围内选为 Agentforce 的模型提供方,也可以在 Agentforce Builder 里按智能体或子智能体粒度设置。对已经在用 Agentforce 的客户来说,接入方式不需要重新设计智能体工作流——它只是模型提供方的一个选项,插进原有的 AI 网关架构。此前那些推理较重的提示会被路由到 Claude 或 ChatGPT,Koa 提供的是把它们收回自建的另一个选项。
内部应用已经开始:Koa 目前跑在 Salesforce 内部一个基于 Slack 的员工智能体里。客户侧目前是扩大范围的试点,官方点名的有 1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine 与 Xero。2026 年 10 月起,它作为 Agentforce 的可选模型开放给客户;正式可用时间预计为 2026 年冬季,初期只限美国区域。
与 Missionforce 的分工
同期还有一条并行的线。Salesforce 计划在 10 月把 NVIDIA 的 Nemotron 系列引入 Missionforce Operations 平台,面向需要私有云、气隙网络等强隔离环境的政府与受监管机构。Missionforce Operations 目前已在美区可用,经过后训练的 NVIDIA 模型将从 10 月起陆续开放给部分客户。
把两条线放在一起看,分工比较清楚:Koa 解决的是通用 SaaS 环境下的 CRM 推理自持,Missionforce 解决的是隔离环境下的模型可部署。共同点是都建立在开源权重之上——这是企业能够把模型搬进自己机房的前提,也是这次合作在商业逻辑上比较站得住的部分。
这条路线的意义与局限
值得肯定的是,它给出了领域专用模型一条可复制的工程路径:不靠采集客户数据,而是靠对自己擅长的业务流程做结构化建模,用合成场景把正确的工具调用序列变成可训练的奖励信号。对企业客户来说,这比「我们接入了通用前沿模型」更贴近采购时会问的问题——数据流向哪里、错误率能否度量、能不能自持。
局限同样清楚。其一,合成数据的覆盖边界取决于团队对工作流的建模能力,长尾异常场景很难由合成补齐,官方也没有披露合成场景与实际客户工单分布之间的偏差。其二,训练规模与算力投入没有公开,其他厂商能否以同等成本复现这条路径并不确定。其三,初期只限美国区域、试点名单较窄,绝大多数客户在正式可用前没有实操经验。其四,把推理收回自建,天花板也随之固定在自己的后训练能力上,后续迭代速度取决于这套训练管线的工业化程度,而非前沿实验室的节奏。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
结语
Koa 的价值不在于它是否真的超过了通用前沿模型,而在于它把「企业数据不出门」与「模型可自持」这两件事同时放进了同一个产品选择里。领域专用模型这条路,过去常被描述成数据壁垒之争;这次给出的答案是另一种:壁垒可能不在数据,而在对流程本身的结构化程度。