// learning_article

工作流自动化从哪切入:识别可自动化环节的四个信号

AI 工作流自动化从哪切入、流程自动化怎么开始?本文给出识别可自动化环节的四个信号与四个反信号,以及候选环节打分排序、人工审核节点设计与效果评估口径的方法。

开发指南流程自动化 15分钟2026-09-020 阅读
工作流自动化流程自动化Workflow人工审核

一个常见的起点困境

决定要做工作流自动化之后,第一个动作往往是拉着业务部门开需求会。会开完,得到一份三十项的清单,每一项都有人说"这个很重要"。清单交给技术团队,技术团队问"先做哪个",会议再开一轮,结论通常是"都很重要,先做最急的那个"——而"最急"往往等于"最近被投诉过的那个",未必等于"最适合自动化的那个"。

本文提供一套替代方案:用四个信号识别真正适合切入的环节,用四个反信号排除陷阱,再用一套打分方法把三十项清单排成有序队列。整套方法不需要技术背景,业务负责人可以直接用。

一、四个正向信号

一个环节同时满足下面四个信号时,它是理想的自动化起点。满足三个也可以做,只满足两个建议先放一放。

1.1 信号一:高频重复,且规则能被说出来

频次决定收益规模,规则可述性决定实现难度。两者缺一不可。每月只发生两次的事,即使完全自动化,节省的工时也不足以支撑一个项目;而每天发生两百次但判断依据说不清的事,则会在实现阶段反复卡壳。

一个实用的检验方法:让做这件事的老员工给新人写一份操作说明。如果他能在半天内写出来,规则就是可述的;如果他写了三页还在补充例外,说明这件事的判断逻辑尚未成型,先梳理流程比先上 AI 更有价值。

1.2 信号二:输入形态的结构化程度尚可

注意用词是"尚可"而不是"结构化"。完全结构化的数据(数据库字段)通常用传统程序处理就够了,未必需要 AI;完全非结构化且噪声极大的输入(模糊的手机翻拍、多语言混排的自由文本)则会显著抬高难度。AI 最有价值的区间是中间地带:格式不统一但语义清晰的文档、有固定要素但表述自由的文本、来源多样但字段可提取的单据。

1.3 信号三:存在现成的对错样本

这是决定项目能不能被验收的信号。历史工单、已归档审批、老员工整理好的台账,都是现成的对错样本。它们的作用有三个:作为效果评估的测试集、作为提示词调优的参考、作为向管理层证明效果的证据。

如果一个环节连一百条历史样本都拿不出来,先不要选它。不是技术上做不了,是你无法在项目结束时说清"它到底做得对不对"。

1.4 信号四:出错代价可控,且可回滚

把第一批自动化放在"错了能被发现、发现了能改回来"的位置。生成初稿供人修改、给出建议供人采纳、做预筛后交人复核——这些都是可回滚的位置。直接对外发送、直接变更系统状态、直接触发资金动作——这些不是。

这条信号常被误读成"保守"。它其实是效率考虑:可回滚的位置允许你快速试错,不可回滚的位置每一次调整都要走审批。前者的迭代速度可以快一个量级。

二、四个反向信号

下面四种情况,即使前面四个正向信号看起来都满足,也建议推迟。

  • 反信号一:流程本身正在变。业务规则处在调整期时做自动化,会一边建一边废。等规则稳定一个季度再动手,成本低得多。
  • 反信号二:跨部门权责未定。如果自动化之后"结果由谁负责"没有答案,上线时一定会卡在这里。权责问题必须在方案阶段解决,而不是在上线阶段。
  • 反信号三:数据拿不到。需要的数据存在,但要走三个月的审批才能接入——那么项目周期的大头会花在数据获取上,而不是能力建设上。这类环节应当排在数据可及性更好的环节之后。
  • 反信号四:现有人工环节本身就是低效的临时方案。有些人工步骤存在的原因是系统对接没做好。把这类步骤自动化,等于用 AI 固化一个本该消失的环节。正确做法是先修系统,而不是先上 AI。

三、把清单排成有序队列

有了信号,接下来是排序。推荐一个简单可操作的打分方法,四个维度各按 1 到 5 打分,业务方与技术方各打一轮再对齐差异。

  • 收益规模:该环节每月消耗的人工工时,或它造成的差错成本。
  • 实现确定性:规则可述性 + 输入结构化程度 + 样本可得性的综合判断。
  • 风险可控度:出错能否被发现、能否回滚、是否触及不可逆动作。
  • 组织就绪度:流程是否稳定、权责是否清晰、数据是否可及。

四项相加得总分,按总分排序。这里有一条经验:两方打分差异最大的那几项,值得单独讨论——差异通常来自信息不对称,业务方知道流程的例外,技术方知道数据的坑,把这些说清楚本身就是有价值的产出。

四、人工审核节点该放在哪里

工作流自动化的核心设计不是"把步骤连起来",而是决定人在哪里介入。三条放置规则:

4.1 规则一:不可逆动作之前必设人审

对外发送、发布上线、状态变更、资金动作——这四类动作之前必须有人确认。这一条没有例外,即使准确率很高也应保留,因为它的作用不是纠错,而是明确责任归属。

4.2 规则二:准确率最低的环节之后设人审

试点数据会告诉你哪个环节最容易出错。把人审放在它后面,可以用最少的人力拦住最多的错误。人审节点的位置应当由数据决定,而不是由直觉决定——直觉倾向于把人审放在"看起来最重要"的环节,数据常常指向另一个地方。

4.3 规则三:把人从"全部处理"变成"处理例外"

成熟的工作流通常不会取消人审,而是改变人审的形态:从逐条审批,变成只审系统标记为低置信度的部分。这需要能力本身能输出置信度或给出判断依据。设计能力时就要求它给出依据,而不是只给结论,这一点在后期会显著降低人审成本。

五、评估口径:三项对比与一条基线

工作流上线后的效果评估,建议固定为三项对比加一条基线。

  • 准确率对比:与人工结果逐条对照,明确统计口径是字段级还是整单级。
  • 耗时对比:端到端周期,包含人审等待时间——只统计 AI 处理时间会得出失真的结论。
  • 成本结构对比:人力投入、算力消耗、运维投入三项的构成变化,关注结构而非绝对值。
  • 一条基线:上线前把当前状态的三项数据记录下来。没有基线的效果报告,说服力会大打折扣。

菲咏造智的六步交付方法论把"试点"单列一步,交付物正是准确率、耗时、成本三项对比,并把"不达标不扩大"写成明确纪律。这个设计的目的是让扩大范围的决定建立在证据上,而不是建立在项目进度压力上。

六、从一条流程到一批流程

第一条工作流跑通之后,扩展的方式有两种,效率相差很大。

低效方式:把第二条流程当作全新项目重做一遍。高效方式:先盘点第一条流程里用到的能力,看有哪些能被第二条直接复用。经验上,同一行业内相邻流程的能力复用率往往不低——单据识别、要素抽取、合规检查、文案生成这类能力,在多条流程里反复出现。

这也是"先建能力库,再建流程"这个顺序的价值所在。菲咏造智把产品线与行业场景合并拆解为 70+ 项原子能力,按 Skill / Workflow / Agent 三层组织,覆盖金融、教育、物流、餐饮、零售五个方向,每条能力都标注了输入与输出形态。做流程盘点时对照这份清单,能较快识别出哪些环节已有现成能力可以组装。清单在菲咏造智 · 能力库页面,入口在 /agent-services 下。

总结

工作流自动化的切入点选择,是一个可以被结构化的判断,不需要依赖直觉。四个正向信号识别候选,四个反向信号排除陷阱,四维打分排出队列,三条规则确定人审位置,三项对比加一条基线完成评估。

整套方法的共同点是:把模糊的判断变成可以被讨论、被记录、被复盘的显式标准。这比选对第一个场景更重要——因为选对一次可能靠运气,而有了标准,第二次、第三次都能选对。