跳到主要内容

OpenAI 发布 AI 价值计分卡:企业该如何重算投入产出

从 Token 单价转向每个合格任务的总成本,拆解企业 AI 项目真正需要追踪的工作量、质量、人工投入与规模收益。本文提供计量公式、数据口径和价值评分表。

默碟研究 2026年7月18日 5 分钟
OpenAI 发布 AI 价值计分卡:企业该如何重算投入产出
本文目录

7 月 17 日,OpenAI 发布了一套面向企业管理者的 AI 价值计分卡。它没有把 Token 用量、调用次数或活跃席位放在中心,而是提出四个问题:AI 完成了多少有用工作,每个成功任务的完整成本是多少,结果是否可靠,以及规模扩大后每一笔投入能否换来更多合格产出。

这是一家模型供应商提出的衡量框架,并非独立行业标准。原文中的模型比较和产品表述也不能直接代替企业自己的测试。不过,它把企业 AI 讨论中的一个常见错位说得很清楚:投入产出的计算单位,应从“调用一次模型”改成“完成一个达到质量门槛的业务任务”。

Token 单价为什么容易把账算错

算经济账,单位选错了就全错了。

Token 是采购与容量规划需要关注的技术计量单位,却不是业务结果。一条客服工单可能经过检索、两次模型调用、一次工具查询和人工修改;一份经营报告可能生成很快,核对数据却花了更多时间。只比较每百万 Token 的价格,会遗漏重试、等待、复核和返工。

更实用的计算方式是:

单个合格任务成本 = 模型、工具、基础设施、重试、人工复核与返工的总成本 ÷ 达到质量门槛的任务数

分母不能写成“发起的任务数”。系统生成了回复,不等于客户问题已经得到解决;Agent 显示执行成功,也不等于数据已经正确写回业务系统。质量不合格的结果如果也进入分母,成本看起来会很低,实际只是把返工藏到了别处。

这并非只有 OpenAI 在强调。Google Cloud 对生产 Agent 的指标建议同样把“每个成功任务的成本”与任务成功率放在一起,提醒团队不要孤立地看 Token 成本。AWS 的 Agentic AI 经济性指南则建议同时考虑总经济影响、风险、决策质量和长期价值。三者的产品立场不同,但都指向同一个管理动作:把技术消耗接回业务结果。

先定义“完成”,再讨论便宜还是贵

同一个词在不同部门里可能有完全不同的含义。客服团队的“完成”可以是问题按政策解决并正确留档;财务团队的“完成”可能要求数字勾稽一致、来源可追溯且按时提交;销售团队的“完成”则可能是有效线索完成分级,并由销售确认后写回 CRM。

因此,每条工作流都需要单独定义下面四项:

项目 需要写清的内容 常见误区
业务完成 什么状态才算任务结束,去哪个系统核验 把“模型已回复”当成“业务已完成”
质量门槛 必填字段、证据、准确性和严重错误标准 只做平均分,不区分致命错误
人工状态 可直接使用、需要修正、需要接管 把人工修正当成免费资源
成本边界 模型、工具、运行、复核、返工和维护 只统计模型账单

OpenAI 原文把结果分成可直接使用、需要修正和需要升级处理三类。企业可以沿用这个思路,但分类规则必须由具体业务负责人与一线人员共同确定。模型供应商无法替一家公司的客服、法务或财务部门定义什么叫合格。

一张好看的总分,仍然可能误导决策

指标选对了,解读仍然可能跑偏。

“每个合格任务的成本”比 Token 单价接近业务,但它也不是万能指标。

首先,低成本不等于高价值。AI 如果只完成大量低价值整理工作,单个任务成本可能持续下降,却未必缓解业务瓶颈。成本指标要与处理周期、积压、收入、客户体验或风险结果一起看。

其次,不同任务不能混成一个平均数。批量分类与复杂例外处理的质量门槛、人工投入和错误后果差别很大。把它们合并后,数量多的简单任务会掩盖少量但昂贵的失败。

再次,可靠性本身有经济价值。结果越不稳定,团队越需要扩大抽查、保留备用流程和处理异常。账面上的模型费用可能没有变化,真实运营成本已经上升。

所以,这套计分卡更适合作为一组互相约束的指标,而不是再造一个可以独自决定预算的分数。

企业可以怎样把现有报表改过来

不必先建设新的数据平台。选择一条已经进入试运行的工作流,在现有日志和业务系统之间建立最小闭环即可。

  1. 确定核验位置。 指明哪个系统状态代表任务真实完成,例如工单关闭、字段写入成功或报告通过复核。
  2. 记录一次任务的完整轨迹。 用同一个任务标识关联模型调用、工具执行、重试、人工处理和最终结果。
  3. 给结果分类。 至少区分可直接使用、需要修改、转人工和失败,并记录主要原因。
  4. 补齐成本边界。 除模型费用外,加入工具、基础设施、人工复核和返工时间。
  5. 按任务类型拆分。 分别观察常规任务、例外情况和高后果动作,不用一个平均数覆盖所有场景。
  6. 比较趋势而非单次快照。 版本变更后同时看质量、总成本和业务结果,确认优化没有把问题转移到下游。

如果生产日志还不能回答这些问题,可以先参考站内的 AI Agent 生产监控表,把业务结果、人工接管、版本和成本关联起来;项目仍在立项阶段,则先用 AI 场景筛选表判断流程是否值得改。

真正改变的是预算对话

计量单位的改变,会倒逼决策方式跟着变。

当企业用合格任务而不是 Token 作为单位,模型选型也会随之变化。高单价模型如果减少重试和人工修正,可能带来更低的结果成本;轻量模型如果在边界明确的高频任务上稳定通过,也可能是更合适的选择。这个口径并不天然偏向更贵或更便宜的模型,它要求每个选择都接受业务结果检验。

OpenAI 这次发布值得关注的地方,不是给出了一个可以直接抄走的总分,而是把 CFO、业务负责人和技术团队拉回了同一张账:AI 到底完成了什么,做到什么质量,为此付出了多少完整成本。能持续回答这三个问题,投入产出才从演示中的估算变成可运营的事实。

专题:组织与价值#AI ROI#成本治理#业务价值#行业观察

相关阅读