渗透率:生产化跨过半数线
这份调查最重要的单项数字是 57.3%:超过半数受访团队已有 AI 智能体在生产环境运行,另有 30.4% 处于「积极开发、计划上生产」状态。两者相加,接近九成的团队已经或即将把智能体投入使用——无论这个口径里的「智能体」有多大的宽严差异,行业叙事已经从「要不要上」切换到了「上了怎么管」。
规模分层同样有信息量:
| 企业规模 | 已在生产 | 开发中/有明确计划 |
|---|---|---|
| 万人以上企业 | 67% | 24% |
| 较小企业 | 50% | 36% |
大企业的生产化比例高出 17 个百分点,而小企业的「在途」比例更高——这与智能体落地的成本结构一致:验证收益需要工程与治理投入,大组织更付得起「先跑通再复制」的学费。麦肯锡 2026 年全球调查从另一个角度印证了同一趋势:年收入超过 10 亿美元的企业中,40% 的受访者表示已在至少一个业务职能中规模化部署 AI 智能体,一年前这个数字是 27%;小企业则停留在 22%。
2024 年行业在争论「智能体是不是噱头」,2025 年在试点「能不能跑」,2026 年的问卷数据说明主流问题已经变成「跑得好不好、坏了怎么知道」——运维化与评测,取代了能力本身,成为新的竞争面。
核心断层:89% 观测与 29.5% 零评测
整份调查中最值得反复咀嚼的是这组数字的组合:
| 能力项 | 普及率 | 含义 |
|---|---|---|
| 已接入可观测(observability)工具 | 约 89% | 绝大多数团队看得到智能体在做什么 |
| 离线评测(对固定数据集打分) | 52.4% | 约半数团队上线前有系统性验证 |
| 在线评测(对真实流量打分) | 37.3% | 能持续度量线上质量的更少 |
| 不做任何评测 | 约 29.5% | 近三成团队「只看不做卷子」 |
「近 89% 买了望远镜、近三成没买考试卷」是这份调查给出的行业肖像:链路追踪(trace)、token 统计、延迟监控已成标配,因为它们解决「坏了在哪」的排障问题;而评测(eval)回答「输出到底好不好」——这是一个没有捷径、需要构建黄金数据集与评分体系的慢工程。断层恰恰说明多数团队停在快的那半步。
为什么这很危险?智能体的失败模式与单体模型不同:一次多步任务里,智能体可能每一步的选择都「合理」,却在某一步拿错上下文后一路错到终局——中间步骤全绿、最终结果报废。没有评测体系,这类失败只能靠用户投诉来发现。质量以 32% 成为受访者列出的首要障碍,正是这个断层的结果性证据。
模型格局:多模型是常态而非备选
模型使用数据推翻了「单模型绑定」的想象:超过三分之二的团队使用 OpenAI 的 GPT 系模型,但超过四分之三的团队在生产或开发中同时使用多个模型。约三分之一的团队为自托管模型投入了基础设施。微调则明显遇冷:57% 的团队不做微调,多数团队依赖基础模型加提示词与检索增强(RAG)。
这组数据与采购逻辑的变化一脉相承:当任务类型异构(编码、客服、研究、文档处理各有强弱模型)且价格差异可达数倍时,「一个模型打天下」在经济与效果上都不成立。本站此前追踪的 LiveBench 成本效率横评显示,同分段模型之间的成本差可达 5 倍以上——多模型路由本质上是把采购优化做进了运行时。
用例分布:客服与研究领跑
按首要用例统计,客户服务以 26.5% 居首,研究与数据分析以 24.4% 紧随其后。行业案例与这个分布互相支撑:印度航空的 AI.g 据其披露每天处理约 4 万条客户查询、覆盖 1300 多个主题;塔塔钢铁(Tata Steel)据 Google Cloud 披露在 9 个月内部署了 300 多个面向资产维护、信息获取与客户响应的专业化智能体。两者均为厂商自报口径,但用例方向与调查数据一致:客服与研究是智能体收益最明确、工作流最清晰的场景。
安全侧补位:身份、隔离与监管时间表
智能体的自主性放大了安全面。调查之外,2026 年安全与合规侧的几件事值得与问卷数据并排读:
- NIST 智能体标准倡议:2026 年 NIST 把智能体身份与授权列为主要技术议题,核心追问很朴素——是哪个智能体执行了动作、它有哪些权限、能碰哪些数据、动作是否越出了被批准的角色。这些控制同时是缓解提示词注入等攻击的基础
- NVIDIA 开放智能体安全平台(Open Agent Safety Platform):2026 年 9 月发布,组合安全运行时与独立监控系统,据厂商称可在智能体越出授权边界时于毫秒级实施隔离(自报口径)
- 欧盟 AI 法案时间表:自 2026 年 8 月 2 日起,与人类交互或生成内容的特定智能体适用透明度义务;高风险智能体在 2027 年 12 月 2 日或 2028 年 8 月 2 日起面临附加要求(视类别而定)。合规正在成为产品设计的前置条件而非事后补丁
把三件事与「29.5% 零评测」放在一起,结论不难得出:当近三成团队连输出质量都不度量时,谈论权限审计与行为护栏显然更超前——安全治理的成熟度大概率落后于部署速度,这个缺口需要监管时间表来强制收敛。
交叉验证:三家口径拼出的全景
单一调查都可能有样本偏差,把三家口径并排看更接近全景:
| 来源 | 样本/口径 | 关键数字 |
|---|---|---|
| LangChain 调查(2026) | 1300+ AI 从业者 | 57.3% 已生产;质量 32% 首要障碍;89% 可观测 vs 52.4% 离线评测 |
| 麦肯锡全球 AI 调查(2026) | 全球企业受访者 | 十亿美元级企业 40% 规模化智能体(上年 27%);小企业 22% |
| Capgemini 调研(2026) | 全球企业受访者 | 60% 仍在探索、23% 试点、仅 3% 报告跨职能规模化 |
三家口径表面上矛盾——LangChain 说近九成「已生产或在途」,Capgemini 说六成还在探索——但对象不同:前者问的是「团队里有没有智能体在生产」(技术上很小的范围也算),后者问的是「跨职能规模化」。合起来读更准确:单点生产化已经普及,跨业务职能的规模化仍是极少数。这与本站此前「生产鸿沟」「采用鸿沟」两份报告的结论一致,行业的主战场已从验证转向复制。
其一,评测先于扩张:在复制第二个用例之前,先把离线评测集建起来——52.4% 的均值说明你多半落后于同行中位数。其二,可观测的终点是归因:trace 解决排障,还要按模型、按用户做成本归因,否则账单失控无从定位。其三,多模型按任务路由:四分之三的同行已经在这么做,单模型绑定在 2026 年更多是惯性而非理性。
冷思考:调查者的立场与盲区
- 立场相关性必须标注:LangChain 是 LangSmith(可观测与评测平台)的开发商,「89% 有观测、半数缺评测」的断层叙事恰好是其产品的市场叙事。数据本身可以成立,但「断层」的框架选择值得读者保持一份清醒——独立调查机构未必会把评测缺席摆到同样显眼的位置
- 样本构成偏工程侧:受访者以 AI 从业者为主,天然高估工程化程度;大量「业务部门用无代码平台搭智能体」的场景未必被充分覆盖
- 「智能体」定义宽泛:从单次工具调用的工作流到自主多步智能体都在口径内,57.3% 的生产化比例不宜直接等同于「过半企业在跑自主智能体」
- 缺少失败成本数据:调查回答了「有没有评测」,没有回答「没评测的团队付出了什么代价」——这是行业真正缺的数字。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态