9 月 18 日,IDC 发布《中国企业级通用Agent产品技术评估》——国内头一份把 11 款企业级通用 Agent 产品放进同一口径实测的技术评估报告。同一口径的意思是:统一任务集、统一基座模型(DeepSeek-v4 Pro)、统一测试条件(通过统一的仿真 MCP Server 提供一致的工具接口与数据基线),近百道任务覆盖邮件、日程、会议纪要、企业知识检索、财报分析、表格清洗、文档与 PPT 生成、视频生成、CRM 与审批等真实办公场景,按复杂度分成常规任务(58.1%)与复杂任务(41.9%)两档。过去各家产品各自宣传的跑分,从此有了一个可以横向对照的坐标系。
实测结果:腾讯 WorkBuddy 以 7.30 分(满分 10 分)位居综合得分榜首,总分与复杂任务两项均为全场最高;在报告设置的九个评估维度——实测任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间、可观测、安全可控、工具与技能、生态与开放性——中,它拿下六个维度的头名。百度搭子以 7.10 分列其后,第三名是中国电信的 TeleAgent(6.85 分),字节跳动的 TraeWork 以 6.74 分居四。前三名里出现一家运营商,是这份报告最具话题性的细节——一家此前并不在企业办公软件牌桌上的公司,把长期积累的算力、模型、数据、安全与服务能力打包成了能替用户完成任务的产品。
比排位更有信息量的是报告对行业真实水位的判断。常规任务上,参评产品整体表现不错,多数产品一次交付即可使用;而复杂任务上,大部分产品「能交付,但还不能直接可用」。这句话应该贴在每个企业选型负责人的显示器上——它意味着当前企业级通用 Agent 的可用边界是清晰的:单系统内的标准化任务已经能接,跨系统的长链条任务仍需人盯着。而企业侧的诉求恰恰压在后者:IDC 今年 4 月的调研显示,53.6% 的受访企业把「能跨系统把一件事从头跑到尾」排在所有诉求的最前面。产品能力与客户诉求之间的这段差距,就是未来两年这个市场的全部竞争空间。
需求侧的进度也在报告中量化:48.5% 的企业已进入通用 Agent 的评估、试点或使用阶段,其中 19.5% 已试点或使用、29.0% 正在评估;分行业看,互联网最积极(83.3%),金融次之(63.3%),电信、能源和媒体各约五成。选型市场已经从观望转入实操,这正是第三方同口径评测出现的时间逻辑——没有统一标尺的时候,企业只能听厂商讲自己的故事。
这份报告背后的产业背景,是愈演愈烈的企业 Agent 入口之争。国内大厂今年以来或调整组织、整合产品线,或快速迭代新品、做生态;海外则是 OpenAI、Anthropic 与 Google 分别联合咨询公司把 FDE 团队派进客户现场,锚定各自要进入的高价值业务流程。争夺的三个关键点——入口、上下文和执行——决定了未来企业 IT 预算的流向:如果员工主要面对一个 Agent 入口,由它理解意图、调系统、找数据、跑工作流,那么这个入口就掌握了企业的 IT 调度平面。
对这份报告本身,也有几点要冷静对待。其一,评分差距集中在小数点后一位,0.2 分的差距不足以判定产品优劣,九个维度的雷达图比单一总分更有参考价值;其二,报告未公开全部任务集与逐项得分细节,第三方复测仍有空间;其三,统一样例场景偏办公通用场景,各行业专属场景的表现需要另行验证;其四,头部四名与后续梯队的分界线到底划在哪里,报告没有展开。给选型者的建议是把这份成绩单当起点而不是结论:用自己的任务清单在入围产品上跑一遍,再对照九个维度的分项得分做决策。WorkBuddy 自 3 月初发布以来保持高频迭代、6 月推出企业版,目前已在政务、医疗、教育、金融等 50 多个行业落地,蒙牛、平安、中金公司等在使用——产品节奏与市场验证的闭环,才是 7.30 分之外更值得关注的信号。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。