Skip to content

审批指标体系专题

版本:v1.1

最后更新:2026-07-06

适用对象:负责 AI 系统上线审批、安全审批、人工复核、策略门禁、运营看板和治理闭环的产品、算法、平台、运营与安全团队。


1. 为什么需要审批指标体系

很多团队给 AI 系统加了审批链,但运行一段时间后会发现:

  • 审批流程是有了,但不知道是否真的更安全
  • 风险确实少了,但业务处理速度明显变慢
  • 人工审核量越来越大,却说不清哪些审核是必要的
  • 通过率变化了,但不知道是策略变严、样本变难,还是模型变差
  • 审批异常时只能看 dashboard,无法下钻到具体样例

审批指标体系的目的不是堆很多图表,而是回答 4 个问题:

  1. 审批是否挡住了真正高风险请求
  2. 审批是否误伤了本来应该放行的请求
  3. 审批链是否拖慢了业务
  4. 指标变化是否能反哺策略、模型、Prompt 和人工流程

OpenAI 的评测实践强调:上线前后都需要用稳定样本和指标验证模型行为;NIST AI RMF 强调 AI 风险管理要覆盖治理、映射、测量和管理;Google SRE 的 SLI/SLO 思路也适用于审批运营:不能只说“系统更安全”,要定义可观测、可追踪、可决策的指标。


2. 什么是审批指标体系

审批指标体系可以理解为:

  • 用一组持续跟踪的指标,衡量审批链在效果、效率、负担和风险控制上的表现

它不是单个通过率,也不是一张简单日报。

一套完整指标体系应该覆盖:

  • 结果是否正确
  • 流程是否高效
  • 人工负担是否可控
  • 风险是否被拦住
  • 异常是否能归因
  • 策略变化是否能评估

审批指标的价值在于帮助团队做决策:

  • 是否可以降低某类请求的人工审批比例
  • 是否需要提高高风险场景的拦截阈值
  • 是否需要拆分审批队列
  • 是否需要增加二级审批
  • 是否需要回滚某个策略版本
  • 是否需要补充评测样例

3. 审批不能只看通过率

通过率是最直观的指标,但单独看很危险。

3.1 高通过率不一定好

通过率高可能意味着:

  • 请求整体风险低
  • 审批策略合理
  • 审批规则过松
  • 高风险请求被误放
  • 人工审核为了追求效率而过度放行

如果只看通过率,可能把“误放风险”误判成“流程顺畅”。

3.2 低通过率也不一定好

通过率低可能意味着:

  • 风险请求确实变多
  • 策略变严
  • 模型误判变多
  • 规则过度保守
  • 人工审核标准不一致

如果只看低通过率,可能把“策略有效”误判成“系统安全”。

3.3 审批指标要同时看两类错误

审批系统最核心的两类错误是:

错误类型含义业务影响
误放本应拦截或升级,却被放行安全、合规、资金、品牌风险
误拦本应放行,却被拦截或升级用户体验下降、人工成本增加、业务变慢

很多高风险场景宁愿多一些误拦,也不能接受误放;但高频低风险场景如果误拦太高,系统会失去效率价值。


4. 审批指标的四层结构

建议把审批指标分为四层。

4.1 结果指标

回答:审批最终判得对不对。

典型指标:

  • 通过率
  • 拒绝率
  • 升级率
  • 误放率
  • 误拦率
  • 高风险召回率
  • 复核一致率
  • 申诉成功率

结果指标用于判断策略是否有效。

4.2 过程指标

回答:审批链是怎么跑的。

典型指标:

  • 平均审批时长
  • P95 审批时长
  • P99 审批时长
  • 队列等待时长
  • 各审批节点耗时
  • 审批层级数
  • 自动审批占比
  • 人工审批占比
  • 二级审批占比

过程指标用于发现卡点。

4.3 负担指标

回答:审批给团队带来了多少运营压力。

典型指标:

  • 每日人工审批量
  • 人均处理量
  • 待审批积压量
  • 超时未处理量
  • 值班峰值压力
  • 重复审批比例
  • 无效升级比例

负担指标用于判断流程是否可持续。

4.4 风险指标

回答:审批链是否真的控制了风险。

典型指标:

  • 高风险样本拦截率
  • 安全事件数
  • 违规输出数
  • 敏感操作未确认数
  • 越权请求放行数
  • 事后追责样本数
  • 审计证据完整率

风险指标用于连接安全治理和审计。


5. 核心指标定义与公式

5.1 审批通过率

text
审批通过率 = 通过请求数 / 总审批请求数

用途:

  • 观察整体放行趋势
  • 对比策略版本
  • 发现异常收紧或放松

注意:

  • 必须按场景、风险等级、队列拆分
  • 不要单独作为策略好坏判断依据

5.2 误放率

text
误放率 = 被错误放行的请求数 / 应被拦截或升级的请求数

误放是高风险指标。

常见来源:

  • 模型低估风险
  • 规则缺失
  • 人工判断失误
  • 证据不足却放行
  • 高风险标签漏标

误放率通常要作为门禁指标。

5.3 误拦率

text
误拦率 = 被错误拦截或升级的请求数 / 应被放行的请求数

误拦主要影响效率和体验。

常见来源:

  • 策略过严
  • 风险规则覆盖太宽
  • 模型置信度阈值过高
  • 人工审核标准不一致

误拦率过高会让审批系统变成业务瓶颈。

5.4 高风险召回率

text
高风险召回率 = 被正确拦截或升级的高风险请求数 / 全部高风险请求数

这是安全类审批最重要的指标之一。

如果高风险召回率低,说明系统没有挡住真正危险的请求。

5.5 人工审批占比

text
人工审批占比 = 进入人工审批的请求数 / 总请求数

用途:

  • 衡量自动化策略是否有效
  • 评估人工成本
  • 观察策略变更对运营团队的影响

5.6 审批处理时长

建议同时看:

  • 平均时长
  • P50
  • P95
  • P99
  • 超时率

平均值容易掩盖长尾问题。Google SRE 的 SLO 思路里非常强调用用户可感知的指标来定义可靠性,审批链也一样:少数长尾请求可能造成明显体验问题。

5.7 审批积压量

text
审批积压量 = 当前待处理审批请求数

建议拆分:

  • 总积压
  • 高风险积压
  • 超时积压
  • 各队列积压
  • 各审批人积压

积压是审批系统失稳的早期信号。

5.8 复核一致率

text
复核一致率 = 二次复核结论与初审结论一致的样本数 / 复核样本数

用途:

  • 衡量人工审核标准是否一致
  • 发现规则解释不清的问题
  • 判断是否需要培训或规则细化

5.9 申诉成功率

text
申诉成功率 = 申诉后被改判的请求数 / 总申诉请求数

申诉成功率高,通常说明误拦偏多或规则解释不清。


6. 审批混淆矩阵

审批本质上可以看成一个分类问题。

实际情况审批放行审批拦截/升级
应该放行正确放行误拦
应该拦截/升级误放正确拦截

从这个矩阵可以推导:

  • 通过率
  • 拦截率
  • 误放率
  • 误拦率
  • 高风险召回率
  • 放行准确率
  • 拦截准确率

审批指标体系一定要有 ground truth 来源。

常见 ground truth 来源:

  • 人工复核
  • 事后申诉
  • 事故复盘
  • 合规审计
  • 专家标注
  • 业务最终结果

如果没有 ground truth,只看通过率和拦截率,只能看到流程结果,看不到审批质量。


7. 按场景拆分指标

审批指标必须分场景看。

7.1 按风险等级拆分

建议至少拆成:

  • 低风险
  • 中风险
  • 高风险
  • 禁止类

不同风险等级的优化目标不同:

风险等级优先目标
低风险提高自动通过率,降低人工成本
中风险控制误放,同时保持可接受效率
高风险优先降低误放,提高召回和人工复核
禁止类稳定拦截,保留审计证据

7.2 按业务场景拆分

例如:

  • 内容发布
  • 资金操作
  • 权限变更
  • 数据导出
  • 用户通知
  • 工单关闭
  • 自动化执行
  • 模型输出上线

同一个审批策略在不同场景里容忍度不同。

7.3 按触发原因拆分

审批触发原因包括:

  • 模型低置信度
  • 命中安全规则
  • 涉及敏感数据
  • 涉及高风险工具
  • 输出不符合 schema
  • 检索证据不足
  • 用户越权请求
  • 金额或权限超过阈值

拆分触发原因可以帮助判断:

  • 哪类规则贡献了最多审批量
  • 哪类规则误拦最多
  • 哪类规则真正减少了事故

8. 指标与策略版本绑定

审批策略一旦变更,团队最关心的是:

  • 新策略是否更安全
  • 是否拖慢业务
  • 是否增加人工负担
  • 是否引入新误伤

如果指标不绑定策略版本,就很难归因。

8.1 需要记录的版本

建议记录:

  • approval_policy_version
  • prompt_version
  • model_version
  • tool_schema_version
  • retrieval_config_version
  • risk_rule_version
  • threshold_version
  • reviewer_guideline_version

8.2 策略对比表

指标v1v2变化解释
误放率1.2%0.4%下降高风险规则增强
误拦率4.8%7.3%上升低置信度阈值过高
P95 时长3.2m5.6m上升人工审批量增加
人工占比18%31%上升中风险请求大量升级

策略对比不能只看单项指标。安全收益和效率代价要一起看。


9. 审批指标看板设计

一张审批看板建议分成 5 块。

9.1 总览区

展示:

  • 总请求数
  • 审批请求数
  • 自动通过率
  • 人工审批占比
  • 拒绝率
  • 升级率
  • 误放率
  • 误拦率

9.2 风险区

展示:

  • 高风险召回率
  • 高风险误放数
  • 越权请求放行数
  • 安全事件数
  • 审计证据缺失数

9.3 效率区

展示:

  • 平均处理时长
  • P95/P99 处理时长
  • 超时率
  • 队列等待时长
  • 各节点耗时

9.4 负担区

展示:

  • 人工审批量
  • 审批人负载
  • 积压量
  • 超时积压
  • 二级审批量

9.5 归因区

展示:

  • 按策略版本拆分
  • 按场景拆分
  • 按触发规则拆分
  • 按失败类型拆分
  • 典型样例链接

没有归因区的 dashboard 很容易只停留在“看到了异常”,无法进入“为什么异常”。


10. 审批 SLO 与告警

审批系统也应该有 SLO。

10.1 示例 SLO

类型SLO 示例
安全高风险召回率 >= 99%
质量误放率 <= 0.5%
效率95% 审批在 5 分钟内完成
负担人工审批占比 <= 25%
积压高风险积压量 = 0
审计审计证据完整率 >= 99.5%

10.2 告警规则

可以设置:

  • 高风险误放数 > 0 立即告警
  • P95 审批时长超过阈值告警
  • 高风险队列积压超过阈值告警
  • 人工审批占比异常升高告警
  • 某策略版本误拦率突然升高告警
  • 审计证据缺失率超过阈值告警

10.3 Error Budget 思路

Google SRE 的 error budget 思路可以类比到审批:

  • 如果误放预算耗尽,停止放宽策略
  • 如果延迟预算耗尽,优先优化流程和队列
  • 如果人工负担预算耗尽,优先做自动化分流

这样能避免安全、效率和人力之间互相甩锅。


11. 从指标到样例归因

指标异常只是入口,真正有价值的是样例归因。

11.1 异常下钻路径

建议路径:

text
指标异常
 -> 定位场景
 -> 定位策略版本
 -> 定位触发规则
 -> 查看样例
 -> 标注失败类型
 -> 形成修复动作

11.2 失败类型标签

常见标签:

  • risk_missed:风险漏识别
  • over_blocked:过度拦截
  • evidence_missing:证据不足
  • reviewer_inconsistent:审核人标准不一致
  • policy_ambiguous:策略规则模糊
  • threshold_too_strict:阈值过严
  • threshold_too_loose:阈值过松
  • tool_result_uncertain:工具结果不确定
  • prompt_injection:提示注入
  • pii_sensitive:敏感信息

11.3 样例记录结构

json
{
  "case_id": "approval-20260706-001",
  "scenario": "data_export",
  "risk_level": "high",
  "policy_version": "approval_policy_v2.3",
  "model_version": "model_x_2026_07",
  "decision": "approved",
  "ground_truth": "should_escalate",
  "error_type": "risk_missed",
  "trigger_rules": ["large_export", "external_email"],
  "latency_ms": 184000,
  "reviewer_id": "masked_reviewer",
  "evidence_complete": true,
  "notes": "外部邮箱导出未触发二级审批"
}

样例结构化后,才能把失败沉淀回评测集。


12. 审批指标如何驱动策略优化

12.1 误放升高

可能原因:

  • 阈值过松
  • 新场景未覆盖
  • 模型能力退化
  • 高风险规则缺失
  • 人工审核疲劳

处理方式:

  • 补充高风险样例
  • 提高高风险阈值
  • 增加二级审批
  • 回滚策略版本
  • 加强证据要求

12.2 误拦升高

可能原因:

  • 阈值过严
  • 规则覆盖过宽
  • 低风险场景未豁免
  • Prompt 过度保守
  • 审核指南不清楚

处理方式:

  • 拆分低风险自动通过策略
  • 优化规则边界
  • 调整阈值
  • 增加反例样本
  • 更新审核手册

12.3 审批时长升高

可能原因:

  • 人工队列不足
  • 二级审批过多
  • 策略升级条件过宽
  • 工具返回慢
  • 审批 UI 信息不足

处理方式:

  • 优先处理高风险队列
  • 拆分队列
  • 自动填充证据摘要
  • 减少无效升级
  • 对低风险请求自动放行

12.4 人工负担升高

可能原因:

  • 规则过严
  • 评测未覆盖真实流量
  • 自动审批能力不足
  • 重复审批
  • 缺少批量处理

处理方式:

  • 建立自动审批白名单
  • 合并重复审批
  • 按风险分层
  • 引入批量审核
  • 优化模型置信度策略

13. 审批策略灰度与回放

审批策略不能直接全量替换。

推荐流程:

  1. 固定历史审批样本
  2. 用新策略离线回放
  3. 对比误放、误拦、时长和人工占比
  4. 分析典型差异样例
  5. 小流量灰度
  6. 观察指标
  7. 决定放量、调整或回滚

13.1 离线回放要看什么

指标目的
决策变化率看新策略改动范围
新增拦截数看是否变严
新增放行数看是否变松
高风险误放一票否决
误拦变化看业务代价
人工审批变化看运营压力

13.2 灰度期间要看什么

  • 是否出现高风险误放
  • P95 审批时长是否恶化
  • 人工审批量是否超过承载能力
  • 申诉成功率是否升高
  • 审核人是否反馈规则不清
  • 是否有新类型失败样例

14. 审批指标与评测集的关系

审批指标不应该只服务 dashboard,也应该反哺评测。

14.1 从线上指标回流评测

这些样例必须回流:

  • 误放样例
  • 高风险拦截样例
  • 申诉成功样例
  • 审核分歧样例
  • 超时积压样例
  • 规则冲突样例
  • 提示注入样例

14.2 评测集分层

建议至少有:

  • 正常通过样例
  • 正常拦截样例
  • 边界样例
  • 误放回流样例
  • 误拦回流样例
  • 安全攻击样例
  • 低质量输入样例

OpenAI 的 eval 思路强调,评测样例和评分规则要与真实目标绑定。审批场景同样如此:如果 eval 只测普通样例,就无法证明策略能挡住高风险请求。


15. 审批指标报告模板

可以按周生成一份审批运营报告。

markdown
# 审批指标周报

## 1. 总览
- 总请求数:
- 审批请求数:
- 自动通过率:
- 人工审批占比:
- 误放率:
- 误拦率:
- P95 审批时长:
- 当前积压:

## 2. 风险表现
- 高风险召回率:
- 高风险误放样例:
- 安全事件:
- 审计证据缺失:

## 3. 效率表现
- 各队列处理时长:
- 超时样例:
- 积压变化:

## 4. 策略版本对比
| 策略版本 | 误放率 | 误拦率 | 人工占比 | P95 时长 |
|---|---|---|---|---|

## 5. 典型样例
- 误放样例:
- 误拦样例:
- 审核分歧样例:

## 6. 下周动作
- 策略调整:
- 样例补充:
- 流程优化:
- 风险跟进:

16. 常见反模式

16.1 只看通过率

问题:

  • 看不到误放和误拦

修正:

  • 用混淆矩阵拆解审批质量

16.2 不区分场景

问题:

  • 高频低风险请求掩盖高风险问题

修正:

  • 按风险等级、业务场景、触发原因拆分

16.3 不看长尾延迟

问题:

  • 平均时长正常,但少数用户等很久

修正:

  • 看 P95/P99 和超时率

16.4 没有 ground truth

问题:

  • 无法判断审批对错

修正:

  • 建立人工复核、申诉、审计和事故复盘机制

16.5 指标不绑定版本

问题:

  • 策略变化无法归因

修正:

  • 记录策略、模型、Prompt、工具和阈值版本

16.6 异常不下钻样例

问题:

  • 只能看到趋势,不能修复问题

修正:

  • 每个异常指标必须能跳到样例和失败标签

17. 落地检查清单

17.1 指标定义

  • 是否定义通过率、误放率、误拦率、高风险召回率
  • 是否定义人工审批占比和升级审批占比
  • 是否定义平均时长、P95、P99、超时率
  • 是否定义积压量和高风险积压量
  • 是否定义审计证据完整率

17.2 数据采集

  • 是否记录审批输入
  • 是否记录审批输出
  • 是否记录触发规则
  • 是否记录策略版本
  • 是否记录模型和 Prompt 版本
  • 是否记录审批人和处理时长
  • 是否记录 ground truth 来源

17.3 看板与告警

  • 是否按场景拆分看板
  • 是否有高风险误放告警
  • 是否有审批超时告警
  • 是否有积压告警
  • 是否能下钻样例

17.4 治理闭环

  • 是否用指标驱动策略回放
  • 是否把失败样例沉淀到评测集
  • 是否定期复盘审核一致性
  • 是否能灰度和回滚审批策略
  • 是否能证明策略变更带来的收益和代价

18. 推荐搭配阅读


19. 推荐资料

以下资料在 2026-07-06 检查时可访问。

官方文档


20. 一句话总结

审批指标体系的核心不是证明审批链“更严格”,而是同时衡量误放、误拦、效率、负担和风险控制效果,并把指标异常追溯到具体样例、策略版本和改进动作。