能力评测 2026-09-25 24 分钟阅读 入门

IDC 首份中国企业级通用 Agent 技术评估横评:统一沙箱里的 12 款产品与「Harness 决定论」

统一模型、统一仿真工具、近百道非公开任务、五类预埋干扰 — 国内通用 Agent 评测有了可对照的基准,但读表之前先弄清它的边界

摘要

2026 年 9 月 15 日,IDC 发布国内首份《中国企业级通用 Agent 产品技术评估》,对 12 款主流及开源通用 Agent 产品开展标准化实测:统一采用 DeepSeek-v4 Pro 作为基座模型,在统一 MCP 仿真环境中布置近百道非公开任务,按「开箱即测试、无提示词优化、失败后不追加人工指令」的闭环标准打分。结果呈现明显的头部集中:腾讯 WorkBuddy 综合得分 7.30 分居首(9 个维度中 6 项满分),百度搭子 7.10 分、中国电信 TeleAgent 6.85 分、TraeWork 6.74 分依次排列。本文拆解其评测方法、成绩单与分维度亮点,重点讨论报告最有价值的判断——同一模型同一评测条件下,产品差异很大程度上来自 Harness 工程——并给出方法论层面的批判性读表须知。

报告背景:通用 Agent 走向企业任务入口

这份报告出台的时间点值得注意。IDC 在 2026 年 4 月的企业调研中发现,48.5% 的受访企业已进入通用 Agent 的评估、试点或使用阶段——其中 19.5% 已试点或使用,29.0% 正在评估。当买方市场从「要不要试」进入「选哪家」,评测标准的缺位就成了真实痛点:过去一年国内通用 Agent 产品密集发布,但各家自报的能力清单彼此不可比,宣传语境下的「智能体」边界宽得可以装下任何聊天机器人。

IDC 在报告中给出的定义收窄了讨论范围:企业级通用 Agent 需要能够理解目标、调用工具和 Skill、连接企业知识和业务系统,并持续执行任务——智能体正从对话问答工具,转向可自主拆解任务、调用工具、完成闭环作业的产品形态。这个定义与本站多篇文章讨论的 Harness 工程范式一致(见文末相关研究)。

评测方法:统一沙箱与五类预埋干扰

这份报告在方法上的几个设定,是它区别于厂商自测与媒体横评的关键:

评分体系覆盖九大维度:任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间、可观测、安全可控、工具与技能、生态与开放性。计分规则是单一维度榜首获满分、后续名次加权——这意味着分数本质上是相对位次而非绝对能力值,这一点后面还会再提。

成绩单:四强数据与分维度解读

排名 产品 综合得分 亮点
1 腾讯 WorkBuddy 7.30 9 个维度中 6 项满分;总分与复杂任务得分居全场之首;在生态与开放性、任务表现、工具与技能、多智能体编排、记忆与工作空间、交互体验六个维度居首
2 百度搭子 7.10 与榜首仅差 0.20 分,整体能力分布均衡
3 中国电信星辰超级智能体 TeleAgent 6.85 任务表现维度获 5 分满分档(其他产品普遍 3 分);成本效率 4 分为本次评测该维度最高分;常规任务 3.49 分(满分 5),与榜首仅差 0.04 分
4 TraeWork 6.74 四强尾部,与榜首差 0.56 分

三个分维度细节比总分更有信息量。其一,TeleAgent 在常规任务上与 WorkBuddy 只差 0.04 分,差距主要被复杂任务拉开(3.36 分)——与 IDC「常规任务多数产品一次交付即可用、复杂任务大部分能交付但不能直接可用」的总体判断互相印证:复杂任务完成度是当前的分层线。其二,纳米 Work 虽未进入总分四强披露名单,却在多智能体编排、安全可控、生态与开放性三个维度获得满分,其中安全可控的 Top 评级仅由它一家获得——安全能力与综合体验并不同步。其三,TeleAgent 的信创适配(银河麒麟、统信 UOS 兼容认证,Windows/macOS/Linux 多终端覆盖)提示国产化采购场景的隐性权重,这类能力不在九维度计分里,却直接影响部分行业的选型。

Harness 决定论:同一模型,差距来自工程

这份报告在行业层面最有传播价值的判断是 IDC 的一句话:同一模型、同一评测条件下,产品差异很大程度上来自 Harness——也就是围绕模型搭起来的那层工程。报告进一步指出,复杂长链路任务的完成情况,尤其在上下文溢出和过程异常时任务能否继续顺利完成,相关 Harness 工程的设计起决定性作用。

把这句话放进本次评测的设计里看,它不是一个泛泛的判断,而是被实验结构直接支撑的:基座模型统一后,2.7 万分到 6.74 分之间近 0.6 分的差距、以及九维度上悬殊的分维度表现,全部只能归因于产品侧工程——工具编排、上下文管理、异常恢复、权限治理。这与国际评测社区的观察同向:同一模型在不同 Harness 下可以差出几十分的分数带(参见本站对 GAIA 脚手架贡献与 METR 评测鸿沟的分析)。

对买方而言,「Harness 决定论」的实操含义是:选型时考察的重心应从「接了哪个模型」转向「异常路径怎么处理」——工具失败后能否恢复、上下文溢出时能否交付部分结果、权限不足时能否合理停止。IDC 的任务表现维度正是按这三件事打分的:结果准确可信可核验、重复执行稳定、面对模糊指令与异常环境能否恢复或合理停止。

🧪 评测设计的隐含立场

「失败后不追加人工指令」与「任务后核验系统状态和最终文件」这两条闭环标准,实际上把「演示可用」与「生产可用」的界线画在了评测里。五类预埋干扰(尤其权限与密级)测的是企业最关心的越权风险,而 IDC 对企业级产品的建议也指向同一处:为 Agent 建立独立身份和权限体系,配置临时凭证与单独设定的操作范围。

企业侧数据:采用率与驱动因素

报告引用的 2026 年 4 月调研数据,为成绩单提供了需求侧坐标:

调研指标 数据
已进入评估、试点或使用阶段的企业 48.5%(19.5% 已试点或使用,29.0% 正在评估)
行业采用热度 互联网 83.3%、金融 63.3%、电信 55.0%、能源 50.0%、媒体 50.0%
评估通用 Agent 的首要驱动因素 53.6% 将「跨系统完成端到端任务」列为首要因素
规模落地的关键挑战 52.0% 认为 ROI 量化和成本治理是关键

两组数字放在一起读:近半数企业已在场内,而他们的评估标准高度收敛于「能不能跨系统把任务做完」;与此同时,过半企业把 ROI 量化列为规模化的关键难题。这意味着评测的九维度里,成本效率与可观测两个维度的长期权重会上升——IDC 对成本效率维度的定义也明确要求企业能按任务、用户、部门、Agent 和工具进行统计归因,并设置预算、配额、告警和降级策略。

方法论批判与读表须知

这份报告是国内通用 Agent 评测从无到有的一步,但引用它的数据前,有五条边界必须摆清楚:

  1. 非公开任务不可复现:防污染与可核验是一对永恒的矛盾。非公开任务集避免了训练集渗透与针对性优化,代价是第三方无法独立复跑验证——榜单的可信度完全押在 IDC 的执行公信力上。
  2. 结论绑定单一基座:统一 DeepSeek-v4 Pro 让「产品工程」可比,但也意味着排名不能外推到其他基座——换一个模型,Harness 的适配质量可能重排。
  3. 分数是相对位次:「榜首满分、后续加权」的计分规则决定了 7.30 与 7.10 的差距不等于能力差距的绝对度量;0.2 分的间隔与 0.04 分的任务级差距应分开解读。
  4. 完整名单与逐维度分值未全公开:公开信息确认了 12 款参评与四强得分,但完整产品名单与各维度明细矩阵目前未见全量披露,跨维度比较受限。
  5. 传播链的厂商色彩:报告发布后,围绕 TeleAgent、WorkBuddy 的媒体稿件多含厂商通稿背景,引用单一来源的分维度叙述时需要交叉核对——本文的分维度数据均以 IDC 报告口径与多家媒体报道交叉为准。

趋势判断与选型建议

IDC 在报告中给出四条趋势判断,值得原文照录后再解读:通用 Agent 将逐步成为企业任务入口;Agent Harness 将更多围绕具体任务进行动态组合;受控安全沙盒与全链路可观测将成为规模化部署的重要前提;Skill 资产化与成本治理将成为实现 ROI 闭环的重要路径。

结合本站的观察,给出三条选型建议。其一,把评测当筛选器而非判决书:本次四强的差距更多说明「头部产品工程都过关」,而非「榜首全面胜出」——用雷达图找与自身场景匹配的维度结构(例如信创环境看适配、强合规行业看安全可控评级),比只看总分更有用。其二,把复杂任务交付率列为 POC 的核心 KPI:本次评测的分层线就在这里,企业自测时应复制「预埋干扰 + 事后核验」的设计。其三,关注 Skill 资产化路线:当各家工程能力趋同(四强分差不足 0.6 分),知识与技能的可积累性将成为下一阶段的差异化变量——这与本站同期对 Repo-to-Skill 技能蒸馏范式的解构互为印证(见文末相关研究)。

至于本次评测完整 12 款产品名单、逐维度明细分值以及下一期评测的排期,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

核心发现

参考来源

  1. 百度百科 — 中国企业级通用Agent产品技术评估词条(IDC 报告汇总:评测方法、九维度、四强得分、调研数据、趋势判断;2026.09.25 查证)
  2. 光明网 — IDC发布Agent评估报告 中国电信TeleAgent跻身国内AI智能体头部梯队(2026-09-17,TeleAgent 各维度表现与信创适配细节)
  3. 极客公园 — TeleAgent 星辰超级智能体获 IDC 综合第三、任务表现达到满分档(2026-09-17,分维度数据交叉)
  4. 沙利文 — 2026 年智能体市场研究报告:WorkBuddy 稳居企业级、个人应用双榜头部(2026-09-20,作为第三方口径补充,与 IDC 结果互证)
  5. AI Weekly / 站内资讯 — IDC 报告发布相关行业报道(采用率与驱动因素数据交叉)