跳到主要内容

巨头在造智能体工厂,你先得知道自己走到哪一步:企业智能体落地对照表(2026 年 9 月版)

有企业一年上线几百个智能体,却答不出哪些真创造了价值。这篇把 Gartner、Liferay、CSA、IDC 与网信办的八组公开数据整理成一张对照表,讲清每组数字能回答什么,并给出可以照着填的八行字段、填法与三条自律原则。

默碟研究 2026年9月10日 11 分钟
巨头在造智能体工厂,你先得知道自己走到哪一步:企业智能体落地对照表(2026 年 9 月版)
本文目录

最近和几家企业聊,几个负责人都提到同一件事:智能体上线了不少,可要问哪些真在创造价值,谁也答不上来。会上还能报出数量,问到效果就换话题。

这不是个别现象。9 月初,一位金融 AI 公司的负责人对《中国经营报》说,去年先把智能体接进部分场景,让它们跑起来。一年下来,公司内部上线了几百个,现在他最关心的是怎么评估、怎么管理、怎么判断哪些能创造业务价值(东方财富网转载中国经营报)。

几百个智能体,按理说该有点底气了。可他关心的还是最基础的问题。

放两年前,这个行业发愁的是能不能做一个出来;现在发愁的是做出来这么多,怎么知道哪几个有用。数量早就不是难点,说不清自己在哪一档才是。

先说这张表为什么有用

发布会上的数字,我们建议都别急着信。

不是数字假,是它们答的不是同一个问题。用户数说的是多少人用过,集成率说的是多少软件把它接了进来,部署率说的是多少企业真把它跑起来了,KPI 覆盖率说的是多少企业算得清它的收益。四个数差着好几个阶段,可摆在同一页 PPT 上,看起来就像同一件事。

拿厂商的集成率当自己的完成率,是汇报里我们最常碰到的一种错。想少犯这个错,只要先问三句话:样本是谁,有多少人,什么时候收集的。

我们翻了近半年的公开研究,挑出八组和企业智能体落地有关的数据:

指标 最新数字 来源与口径 它回答什么
已部署 AI 智能体的组织比例 17% Gartner《2026 智能体 AI 技术成熟度曲线》引 2026 CIO 调研(引述来源 营销热度与实际完成之间的落差
AI 跨业务单元规模化率 22% Gartner 2026 年 9 月新闻稿;口径是 AI 整体,不只智能体 跨部门的复制能力
员工 AI 政策覆盖率 24% Liferay 2026 年 8 月,美国 500 名从业者 使用边界是否写成制度
收益 KPI 覆盖率 25% Liferay 2026 年 8 月,同上 价值是否有口径
缺乏智能体身份可见性的企业 92% 2026 CISO AI Risk Report 调查 235 家大型企业,经 CSA 2026 年 4 月笔记转引 企业安全侧对智能体的掌握程度
权限超出任务所需的智能体 74% CSA 与 Aembit 2026 年 1 月实施、3 月发布,228 名 IT 与安全从业者 最小权限是否真正落实
中国企业级 AI Agent 市场规模 212 亿元 → 449 亿元 IDC,2025 年实际与 2026 年预测 采购预算的走向
决策边界要求 划清三类决策 中央网信办等三部门《智能体规范应用与创新发展实施意见》,2026 年 5 月 哪些操作必须留给人拍板

另有几组只作佐证,后面会讲到:95% 怀疑自己事后识别不了被攻破的智能体,68% 无法在日志里区分人的操作和智能体的操作,54% 已经在生产环境运行智能体或正在试点。

17% 那个数还带一个信号:同一份 Gartner 调研里,42% 的组织打算在未来 12 个月内开始部署,另有 22% 打算再往后一年。接下来一年会有大批企业从“没上”跨到“上了”,可验收能力不会跟着自动长出来。

最后一行不是数字,是条硬要求。三类决策的边界要划清:哪些只能由用户本人决策,哪些需要用户授权决策,哪些智能体可以自主决策。在系统权限调用、移动支付这类高敏感场景尤其要分清。这是中央网信办等三部门 2026 年 5 月印发的《智能体规范应用与创新发展实施意见》里说的(中国网信网)。我们后面要填的那张表里,“确认后执行”这一档不是自己发明的分级,它就是“需要用户授权决策”的落地写法。

表里的数字,方向不一样

这张表最容易看错的地方,是把不能比的数放在一起比。

一类是建设做到多少,越高越好。已部署智能体的组织占 17%,能跨业务单元规模化的占 22%,写成 AI 使用政策的占 24%,用 KPI 衡量 AI 影响的占 25%。

另一类是缺口有多大,越低越好。92% 的大型企业看不清自家智能体在以什么身份运行。74% 的安全人员认为智能体拿到的权限超出了任务所需。

前一类问“做到多少”,后一类问“问题有多普遍”,分母和方向都不同。硬放在一起比大小,结论一定是歪的。

顺带说一句,那两行的样本也完全不是一批人。92% 问的是 235 家大型企业的安全负责人,24% 问的是 500 名美国从业者,国家和岗位都对不上。拿它们相减或者对比,得到的都是噪音。

顺序倒是可以从同一份调查里看出来。Liferay 那 500 人里,54% 已经在生产环境跑智能体或正在试点,可写成政策、用 KPI 衡量的都只有四分之一上下。同一批人,同一份问卷,先上能力、治理滞后,这个顺序很清楚。多数新技术进企业的头几年,都会重演一遍。

余下两行不是指标,是背景。市场规模说明钱在往哪走,决策边界要求说明政策划在哪。它们不用来横向比大小,只用来解释其余几行为什么是这个数。

供给端在踩油门

再看看外面,就明白这些数字为什么是反的。

7 月 WAIC 上,蚂蚁数科发布了“智能体超级工厂”平台 Agentar 2.0,首批预置 200 个岗位级数字专家。腾讯的企业级智能体管控平台 ClawPro 走的是“智能体工厂+应用商店”路线(东方财富网转载中国经营报)。

这两家做的事都一样:把智能体变成可以批量生产、统一上架的东西。产能问题他们解决得不错,但企业真正卡住的那一步——怎么判断哪个有用——没有人卖给你。

IDC 的数据显示,中国企业级 AI Agent 市场 2025 年约 212 亿元,2026 年预计达到 449 亿元。到 2029 年,这个数字有望突破 3320 亿元(观点网)。

工厂在扩产。可表里衡量“多少企业算得清收益”的那行——KPI 覆盖率——还停在 25%。供给跑在前面,验收能力没跟上。

这个差不是态度问题,是信息条件的问题。

供给端讲的是采用率的故事,采用率好看、好卖。可企业要验收,靠的不是别人上了多少,而是知道同类任务在哪里失败过。这类信息没人有动力公开:厂商不会讲自己的失败案例,企业也不愿意承认。于是市面上不缺成功故事,缺的是失败样本。

还有一层。省时间和业务变好是两回事。省时间好算,每个人省下多少加起来就行;业务变好要沿着流程追,订单有没有错、返工几遍、客户有没有投诉——这些多数系统一开始根本不记录。KPI 覆盖率长期停在 25%,一部分原因就在这里:不是企业不想测,而是能测的只有最容易的那层。

所以表里那几行数字,用来定位可以,用来考核就跑偏了。真正能决定下一步的,是企业自己记录下来的东西。

剩下六组数字,分别怎么看

17% 和 22%,很多人会放在一起看,但这俩来自两份不同的报告。

17% 出自 Gartner 今年 4 月的《2026 智能体 AI 技术成熟度曲线》。它引的是 Gartner 2026 年 CIO 调研:到目前为止,只有 17% 的组织部署了 AI 智能体。

22% 出自 Gartner 2026 年 9 月 1 日的另一份新闻稿。它量的是 AI 整体跨业务单元的规模化程度,不单指智能体。

两个数并起来看,结论是:智能体本身还没普及;已经用起来 AI 的组织里,能把做法复制到第二个、第三个部门的也只是少数。两条都指向同一件事——从“有人用”到“整个组织用”,中间还隔着很远。

顺便提醒一句,Gartner 报告里还有一个 22%——“计划在第二年内落地”的组织比例。它和新闻稿里那个“跨业务单元规模化”的 22% 完全是两回事,数值撞车,转引时很容易串行。

对内汇报的时候,“我们上线了几个智能体”没什么信息量。换成“有几个场景进了日常流程,其中几个跨了部门”,听的人才知道该松口气还是该追问。

24% 和 25%,说的是同一件事的另一面。 Liferay 调查了 500 名美国从业者。其中只有 24% 的企业有成文的 AI 使用政策,25% 用明确 KPI 衡量 AI 的影响(Automation Magazine)。

同一份调查里,54% 的企业已经在生产环境运行智能体或正在试点。注意这 54% 把试点算了进去,只算生产环境会低不少。用的人在涨,写清边界的不到四分之一。而且这是自报数据,企业通常高估自己的成熟度,真实情况只会更差。

92% 和 74%,这两个数经常被混着引用。 它们看着都出自 CSA,其实来自两份不同的调查,核对时也容易看串。

92% 那组来自 2026 CISO AI Risk Report。报告调查了 235 家大型企业的安全负责人。其中 92% 看不清自家智能体以什么身份在运行,95% 怀疑自己事后识别不了、也隔离不了一个被攻破的智能体。CSA 在 2026 年 4 月 3 日的笔记里转引了这组数(CSA Lab Space)。

74% 那组来自 CSA 受 Aembit 委托做的调查。调查 2026 年 1 月实施,3 月 24 日发布,收到 228 份 IT 与安全从业者的回复。74% 认为智能体拿到的权限常常超出任务所需,68% 无法在日志里可靠区分智能体活动与人的活动(CSA 新闻稿)。

这两组数字把问题从“模型准不准”挪到了“我们看不看得见”。模型准不准,业务部门能用结果判断;看不看得见,只有安全和技术团队能回答。多数企业的现状是:业务部门催着上线,技术团队答不出这些智能体到底在干什么。

为什么盯住日志还不够

CSA 在 8 月 31 日的研究笔记里把这一层往下挖了一格,值得单独讲(CSA Lab Space)。

CSA 在 8 月 31 日的研究笔记里指出:身份、凭据、日志、工具权限都管住了,智能体的推理过程却仍然没人管。用原文的说法,治理了智能体周围的一切,唯独没有治理智能体本身。

笔记里列了五类失败模式,共同点是都不需要越权:

  • 把一笔会触发阈值的大额操作,拆成几笔各自合规的小操作
  • 把多条单独授权的查询聚合起来,做成一次超额导出
  • 多个智能体各自合规,合起来违反组织级政策
  • 向上级汇报时,选择性省略不利信息
  • 任务执行到一半,悄悄改变决策标准

每一步都在授权范围内,所以现有的访问控制和日志检查不会报警。这五类分法来自 CSA 转引 Forrester 分析师 Leslie Joseph 提出的五项诊断测试。名单不是我们拟的,是他们归纳的。

这也是我们认为表里那些身份和监控指标只是及格线的原因:它们能证明数据被记下来了,证明不了该做的判断做过了。

想再往下看一层,就得补行为层面的数,比如:

  • 计划有没有在执行前被审阅
  • 升级到人的决定,有没有带上完整上下文
  • 跑长任务时,有没有做漂移检测

只盯基础设施指标,很容易把“有日志”当成“有治理”。

行业数字是背景,自己那八行才是正事

公开数据能帮你定位,但真正要维护的,是企业自己那张表。下面这八行字段建议固定下来,按任务填,不要按厂商或部门填:

字段 取值方式 为什么保留
任务 流程名,写到动作 避免把“客服”这类范围当成一个任务
阶段 未开始/只读/草稿/确认后执行/自动执行 阶段比时间更能说明真实进度
调用量 月调用次数 判断是否真的有人用
写回成功率 一次通过比例 写回是风险分界线
人工修改率 修改后通过比例 衡量返工成本
单任务成本 含 Token 与人工的总成本 算出真实投入
越界事件 次数与处置结果 治理是否有效
业务结果 一个业务指标 最容易缺的一行,也最该有

填的时候有三个坑。一是混口径,这个月按调用次数算,下个月改成按任务算,趋势就没意义了。二是只挑好看的填,只报成功率不报修改率,等于把返工藏起来。三是写回成功率没有基线。同一个任务,人手工做一次通过的比率如果不记,这个数字算高算低其实无从判断。

这套字段和我们写过的东西一脉相承。成本口径讲怎么算总成本,影子模式讲怎么先不碰生产地验证,验收指标讲阈值怎么定。

只强调一点:季度末要拍板的扩大、维持还是回退,依据是这张表,不是厂商的最新发布会。

惯例比完整更重要

更新成惯例,比一次写全更有用。我们自己的做法分四步。

第一,固定更新时点,放在季度结束后的第一周,跟预算、编制这类例会绑在一起,免得被日常事务挤掉。

第二,行业数字只保留能核实的来源。每条记下来源、样本量、发布时间,三项缺一就不进表。找不到就留空,不估算。

第三,企业自己的八行按任务更新。新任务加行,老行保留,趋势比当期数值有信息量。

第四,记一行口径变化。这条最容易被跳过,可换了统计方式却不标注,两个季度的数字放在一起就容易得出错误结论。

除这四步,还有三条自律。行业数字和内部数字分开放,不混。核实不了来源的数字不写进正文,宁可空着。表里的数字变了,跟着改结论——只改数字不改结论,这表就成装饰了。

说了这么多,其实就一件事:自己那张表里,最该盯着看的是填不出来的那几行。多数企业填得出调用量和成功率,填不出人有没有返工、业务结果动没动——而这两行才是决定去留的依据。下个季度开会前,先看看这两行有没有数。

专题:评测与治理#AI Agent#企业 AI#落地评测#AI 治理#行业数据

相关阅读

下一步

有一个具体流程需要判断?

先说明现状、工作量和期望结果,我们一起判断是否值得验证。

描述一个流程