跳到主要内容

一个流程值不值得上 AI?先做这张场景筛选表

用一张 18 分筛选表,从业务价值、数据条件、风险和实施成本判断企业 AI 场景的优先级。本文提供评分维度、判断问题和结果解释,帮助团队选出适合先验证的流程。

默碟团队 2026年7月14日 4 分钟· 更新于 2026年7月19日
一个流程值不值得上 AI?先做这张场景筛选表
本文目录

企业讨论 AI 项目时,很容易从工具开始:选哪个模型、要不要 Agent、知识库放在哪里。更该先问的是:这个流程到底值不值得改?

模型能力再强,也无法让低频、无标准、责任不清的流程真正跑起来。下面这张表用于第一次筛选候选场景。它不负责预测项目成败,也不自命为行业标准;它的作用,是让业务、技术和管理者用同一套问题讨论优先级。

一张 18 分场景筛选表

打分前先记住一条原则。

每项按 0—3 分评分。不要凭印象打分,最好让实际执行流程的人提供数据或样本。

维度 0 分 1 分 2 分 3 分
频率与耗时 偶发,成本可忽略 低频或耗时不稳定 经常发生,占用可见工时 高频重复,已形成积压或瓶颈
输入可用性 输入不存在或无法取得 大量依赖口头信息 主要输入已电子化 输入稳定、结构清楚、可授权访问
流程边界 每次做法都不同 依赖少数人的隐性经验 主流程明确,异常较多 步骤、责任和异常路径都清楚
结果可验证性 无法定义好坏 只能主观判断 可抽样复核 有明确字段、规则或业务结果可比对
失败可恢复性 错误难发现且不可逆 发现较晚,修复成本高 可人工复核或回退 全程可追踪,错误容易拦截和重做
接入与责任 无系统接口,也无人负责 需大规模改造 有接口或替代方案,责任人待明确 系统可接入,业务负责人和技术负责人明确

总分只是排序工具,可以先按以下区间处理:

  • 14—18 分:适合进入小范围验证;
  • 9—13 分:先补数据、规则或接口,再决定是否做;
  • 0—8 分:暂缓,不要用模型掩盖流程问题。

这些分界线同样不是成功率承诺。若某一项是 0 分,即使总分不低,也要单独解释为什么可以继续。

先排除四类”伪场景”

有些场景看起来诱人,一做就塌。

第一类是只在演示里成立。输入由演示者精心准备,真实业务里却充满缺字段、旧模板和例外。

第二类是无法验收。团队只说“回答要更智能”,却说不出正确样本、可接受错误和人工复核方式。这样的项目上线后只能靠感觉争论。

第三类是高风险终局决策。授信、用工、付款、法律承诺等动作可以让 AI 辅助整理信息,但不应在责任和审批机制缺失时直接自动执行。

第四类是低频定制需求。半年发生一次、每次规则又不同,通常不值得先做复杂系统。用现成工具辅助一次,可能比建设长期工作流更合算。

一个假设例子:把会议纪要写回 CRM

用上面的表实战一遍。

假设某销售团队每天有多场客户会议,会后需要整理要点、提取下一步动作,再录入 CRM。按上表初评:

  • 频率与耗时 3 分:每天重复,挤占销售时间;
  • 输入可用性 2 分:已有录音和会议记录,但格式不完全统一;
  • 流程边界 2 分:主字段明确,少数行业有特殊要求;
  • 结果可验证性 3 分:可与原始记录和 CRM 必填字段比对;
  • 失败可恢复性 3 分:提交前由销售确认,记录可以修改;
  • 接入与责任 2 分:CRM 有接口,但权限和负责人仍需落实。

合计 15 分,值得验证。但第一版不必自动写入 CRM,可以先生成结构化草稿,由销售确认后提交。这样既能测出节省的时间,也能收集模型最常出错的字段。

验证阶段只回答四个问题

进入原型后,不要一口气做完整平台。先拿一批脱敏的真实样本,回答四个问题:

  1. 哪些步骤能稳定交给 AI,哪些必须保留人工判断?
  2. 相比现有做法,完成时间、返工量或积压是否改善?
  3. 最常见的失败类型是什么,能否在产生后果前被发现?
  4. 运行一次的模型、系统和人工复核成本是否可以接受?

Anthropic 对工作流与 Agent 的区分很有参考价值:路径明确、可预期的任务,优先使用预先定义的工作流;只有当任务确实需要动态决策时,才增加 Agent 的自主性。复杂度本身不是成果。

最后看”谁愿意负责”

评分之外,还有一个更关键的变量。

一个 16 分但没有业务负责人的场景,往往不如一个 13 分、负责人清楚且愿意提供样本的场景。AI 项目需要有人定义结果、判断例外、接受或拒绝流程变化。技术团队无法代替业务完成这些决定。

场景筛选的目标不是找到最炫的想法,而是找到一个边界清楚、能被验证、失败可接管的流程。把第一步选对,后面的模型和工程选择才有意义。

专题:工作流设计#场景诊断#AI 工作流#ROI#需求分析

相关阅读