报告背景:通用 Agent 走向企业任务入口
这份报告出台的时间点值得注意。IDC 在 2026 年 4 月的企业调研中发现,48.5% 的受访企业已进入通用 Agent 的评估、试点或使用阶段——其中 19.5% 已试点或使用,29.0% 正在评估。当买方市场从「要不要试」进入「选哪家」,评测标准的缺位就成了真实痛点:过去一年国内通用 Agent 产品密集发布,但各家自报的能力清单彼此不可比,宣传语境下的「智能体」边界宽得可以装下任何聊天机器人。
IDC 在报告中给出的定义收窄了讨论范围:企业级通用 Agent 需要能够理解目标、调用工具和 Skill、连接企业知识和业务系统,并持续执行任务——智能体正从对话问答工具,转向可自主拆解任务、调用工具、完成闭环作业的产品形态。这个定义与本站多篇文章讨论的 Harness 工程范式一致(见文末相关研究)。
评测方法:统一沙箱与五类预埋干扰
这份报告在方法上的几个设定,是它区别于厂商自测与媒体横评的关键:
- 统一基座模型:全部参评产品统一采用 DeepSeek-v4 Pro,剔除「模型代差」变量——测的是产品工程,不是模型
- 统一仿真环境:通过统一仿真 MCP Server 提供一致的工具接口与数据基线,任务覆盖邮件、日程、会议纪要、企业知识检索、财报分析、表格清洗、文档与 PPT 生成、视频生成、CRM 与审批等真实办公场景
- 非公开任务集:近百道任务不对外公开,按复杂度分为常规任务(58.1%)与复杂任务(41.9%)
- 五类预埋非理想条件:工具缺口、数据缺口、同名干扰项、脏数据、权限与密级——专门测异常路径而非理想路径
- 闭环判定标准:开箱即测试、无提示词优化、失败后不追加人工指令;任务结束后还核验系统状态和最终文件,确认 Agent 是否真的完成而非「看起来完成」
评分体系覆盖九大维度:任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间、可观测、安全可控、工具与技能、生态与开放性。计分规则是单一维度榜首获满分、后续名次加权——这意味着分数本质上是相对位次而非绝对能力值,这一点后面还会再提。
成绩单:四强数据与分维度解读
| 排名 | 产品 | 综合得分 | 亮点 |
|---|---|---|---|
| 1 | 腾讯 WorkBuddy | 7.30 | 9 个维度中 6 项满分;总分与复杂任务得分居全场之首;在生态与开放性、任务表现、工具与技能、多智能体编排、记忆与工作空间、交互体验六个维度居首 |
| 2 | 百度搭子 | 7.10 | 与榜首仅差 0.20 分,整体能力分布均衡 |
| 3 | 中国电信星辰超级智能体 TeleAgent | 6.85 | 任务表现维度获 5 分满分档(其他产品普遍 3 分);成本效率 4 分为本次评测该维度最高分;常规任务 3.49 分(满分 5),与榜首仅差 0.04 分 |
| 4 | TraeWork | 6.74 | 四强尾部,与榜首差 0.56 分 |
三个分维度细节比总分更有信息量。其一,TeleAgent 在常规任务上与 WorkBuddy 只差 0.04 分,差距主要被复杂任务拉开(3.36 分)——与 IDC「常规任务多数产品一次交付即可用、复杂任务大部分能交付但不能直接可用」的总体判断互相印证:复杂任务完成度是当前的分层线。其二,纳米 Work 虽未进入总分四强披露名单,却在多智能体编排、安全可控、生态与开放性三个维度获得满分,其中安全可控的 Top 评级仅由它一家获得——安全能力与综合体验并不同步。其三,TeleAgent 的信创适配(银河麒麟、统信 UOS 兼容认证,Windows/macOS/Linux 多终端覆盖)提示国产化采购场景的隐性权重,这类能力不在九维度计分里,却直接影响部分行业的选型。
Harness 决定论:同一模型,差距来自工程
这份报告在行业层面最有传播价值的判断是 IDC 的一句话:同一模型、同一评测条件下,产品差异很大程度上来自 Harness——也就是围绕模型搭起来的那层工程。报告进一步指出,复杂长链路任务的完成情况,尤其在上下文溢出和过程异常时任务能否继续顺利完成,相关 Harness 工程的设计起决定性作用。
把这句话放进本次评测的设计里看,它不是一个泛泛的判断,而是被实验结构直接支撑的:基座模型统一后,2.7 万分到 6.74 分之间近 0.6 分的差距、以及九维度上悬殊的分维度表现,全部只能归因于产品侧工程——工具编排、上下文管理、异常恢复、权限治理。这与国际评测社区的观察同向:同一模型在不同 Harness 下可以差出几十分的分数带(参见本站对 GAIA 脚手架贡献与 METR 评测鸿沟的分析)。
对买方而言,「Harness 决定论」的实操含义是:选型时考察的重心应从「接了哪个模型」转向「异常路径怎么处理」——工具失败后能否恢复、上下文溢出时能否交付部分结果、权限不足时能否合理停止。IDC 的任务表现维度正是按这三件事打分的:结果准确可信可核验、重复执行稳定、面对模糊指令与异常环境能否恢复或合理停止。
「失败后不追加人工指令」与「任务后核验系统状态和最终文件」这两条闭环标准,实际上把「演示可用」与「生产可用」的界线画在了评测里。五类预埋干扰(尤其权限与密级)测的是企业最关心的越权风险,而 IDC 对企业级产品的建议也指向同一处:为 Agent 建立独立身份和权限体系,配置临时凭证与单独设定的操作范围。
企业侧数据:采用率与驱动因素
报告引用的 2026 年 4 月调研数据,为成绩单提供了需求侧坐标:
| 调研指标 | 数据 |
|---|---|
| 已进入评估、试点或使用阶段的企业 | 48.5%(19.5% 已试点或使用,29.0% 正在评估) |
| 行业采用热度 | 互联网 83.3%、金融 63.3%、电信 55.0%、能源 50.0%、媒体 50.0% |
| 评估通用 Agent 的首要驱动因素 | 53.6% 将「跨系统完成端到端任务」列为首要因素 |
| 规模落地的关键挑战 | 52.0% 认为 ROI 量化和成本治理是关键 |
两组数字放在一起读:近半数企业已在场内,而他们的评估标准高度收敛于「能不能跨系统把任务做完」;与此同时,过半企业把 ROI 量化列为规模化的关键难题。这意味着评测的九维度里,成本效率与可观测两个维度的长期权重会上升——IDC 对成本效率维度的定义也明确要求企业能按任务、用户、部门、Agent 和工具进行统计归因,并设置预算、配额、告警和降级策略。
方法论批判与读表须知
这份报告是国内通用 Agent 评测从无到有的一步,但引用它的数据前,有五条边界必须摆清楚:
- 非公开任务不可复现:防污染与可核验是一对永恒的矛盾。非公开任务集避免了训练集渗透与针对性优化,代价是第三方无法独立复跑验证——榜单的可信度完全押在 IDC 的执行公信力上。
- 结论绑定单一基座:统一 DeepSeek-v4 Pro 让「产品工程」可比,但也意味着排名不能外推到其他基座——换一个模型,Harness 的适配质量可能重排。
- 分数是相对位次:「榜首满分、后续加权」的计分规则决定了 7.30 与 7.10 的差距不等于能力差距的绝对度量;0.2 分的间隔与 0.04 分的任务级差距应分开解读。
- 完整名单与逐维度分值未全公开:公开信息确认了 12 款参评与四强得分,但完整产品名单与各维度明细矩阵目前未见全量披露,跨维度比较受限。
- 传播链的厂商色彩:报告发布后,围绕 TeleAgent、WorkBuddy 的媒体稿件多含厂商通稿背景,引用单一来源的分维度叙述时需要交叉核对——本文的分维度数据均以 IDC 报告口径与多家媒体报道交叉为准。
趋势判断与选型建议
IDC 在报告中给出四条趋势判断,值得原文照录后再解读:通用 Agent 将逐步成为企业任务入口;Agent Harness 将更多围绕具体任务进行动态组合;受控安全沙盒与全链路可观测将成为规模化部署的重要前提;Skill 资产化与成本治理将成为实现 ROI 闭环的重要路径。
结合本站的观察,给出三条选型建议。其一,把评测当筛选器而非判决书:本次四强的差距更多说明「头部产品工程都过关」,而非「榜首全面胜出」——用雷达图找与自身场景匹配的维度结构(例如信创环境看适配、强合规行业看安全可控评级),比只看总分更有用。其二,把复杂任务交付率列为 POC 的核心 KPI:本次评测的分层线就在这里,企业自测时应复制「预埋干扰 + 事后核验」的设计。其三,关注 Skill 资产化路线:当各家工程能力趋同(四强分差不足 0.6 分),知识与技能的可积累性将成为下一阶段的差异化变量——这与本站同期对 Repo-to-Skill 技能蒸馏范式的解构互为印证(见文末相关研究)。
至于本次评测完整 12 款产品名单、逐维度明细分值以及下一期评测的排期,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。