Appearance
审批指标体系专题
版本:
v1.1最后更新:
2026-07-06适用对象:负责 AI 系统上线审批、安全审批、人工复核、策略门禁、运营看板和治理闭环的产品、算法、平台、运营与安全团队。
1. 为什么需要审批指标体系
很多团队给 AI 系统加了审批链,但运行一段时间后会发现:
- 审批流程是有了,但不知道是否真的更安全
- 风险确实少了,但业务处理速度明显变慢
- 人工审核量越来越大,却说不清哪些审核是必要的
- 通过率变化了,但不知道是策略变严、样本变难,还是模型变差
- 审批异常时只能看 dashboard,无法下钻到具体样例
审批指标体系的目的不是堆很多图表,而是回答 4 个问题:
- 审批是否挡住了真正高风险请求
- 审批是否误伤了本来应该放行的请求
- 审批链是否拖慢了业务
- 指标变化是否能反哺策略、模型、Prompt 和人工流程
OpenAI 的评测实践强调:上线前后都需要用稳定样本和指标验证模型行为;NIST AI RMF 强调 AI 风险管理要覆盖治理、映射、测量和管理;Google SRE 的 SLI/SLO 思路也适用于审批运营:不能只说“系统更安全”,要定义可观测、可追踪、可决策的指标。
2. 什么是审批指标体系
审批指标体系可以理解为:
- 用一组持续跟踪的指标,衡量审批链在效果、效率、负担和风险控制上的表现
它不是单个通过率,也不是一张简单日报。
一套完整指标体系应该覆盖:
- 结果是否正确
- 流程是否高效
- 人工负担是否可控
- 风险是否被拦住
- 异常是否能归因
- 策略变化是否能评估
审批指标的价值在于帮助团队做决策:
- 是否可以降低某类请求的人工审批比例
- 是否需要提高高风险场景的拦截阈值
- 是否需要拆分审批队列
- 是否需要增加二级审批
- 是否需要回滚某个策略版本
- 是否需要补充评测样例
3. 审批不能只看通过率
通过率是最直观的指标,但单独看很危险。
3.1 高通过率不一定好
通过率高可能意味着:
- 请求整体风险低
- 审批策略合理
- 审批规则过松
- 高风险请求被误放
- 人工审核为了追求效率而过度放行
如果只看通过率,可能把“误放风险”误判成“流程顺畅”。
3.2 低通过率也不一定好
通过率低可能意味着:
- 风险请求确实变多
- 策略变严
- 模型误判变多
- 规则过度保守
- 人工审核标准不一致
如果只看低通过率,可能把“策略有效”误判成“系统安全”。
3.3 审批指标要同时看两类错误
审批系统最核心的两类错误是:
| 错误类型 | 含义 | 业务影响 |
|---|---|---|
| 误放 | 本应拦截或升级,却被放行 | 安全、合规、资金、品牌风险 |
| 误拦 | 本应放行,却被拦截或升级 | 用户体验下降、人工成本增加、业务变慢 |
很多高风险场景宁愿多一些误拦,也不能接受误放;但高频低风险场景如果误拦太高,系统会失去效率价值。
4. 审批指标的四层结构
建议把审批指标分为四层。
4.1 结果指标
回答:审批最终判得对不对。
典型指标:
- 通过率
- 拒绝率
- 升级率
- 误放率
- 误拦率
- 高风险召回率
- 复核一致率
- 申诉成功率
结果指标用于判断策略是否有效。
4.2 过程指标
回答:审批链是怎么跑的。
典型指标:
- 平均审批时长
- P95 审批时长
- P99 审批时长
- 队列等待时长
- 各审批节点耗时
- 审批层级数
- 自动审批占比
- 人工审批占比
- 二级审批占比
过程指标用于发现卡点。
4.3 负担指标
回答:审批给团队带来了多少运营压力。
典型指标:
- 每日人工审批量
- 人均处理量
- 待审批积压量
- 超时未处理量
- 值班峰值压力
- 重复审批比例
- 无效升级比例
负担指标用于判断流程是否可持续。
4.4 风险指标
回答:审批链是否真的控制了风险。
典型指标:
- 高风险样本拦截率
- 安全事件数
- 违规输出数
- 敏感操作未确认数
- 越权请求放行数
- 事后追责样本数
- 审计证据完整率
风险指标用于连接安全治理和审计。
5. 核心指标定义与公式
5.1 审批通过率
text
审批通过率 = 通过请求数 / 总审批请求数用途:
- 观察整体放行趋势
- 对比策略版本
- 发现异常收紧或放松
注意:
- 必须按场景、风险等级、队列拆分
- 不要单独作为策略好坏判断依据
5.2 误放率
text
误放率 = 被错误放行的请求数 / 应被拦截或升级的请求数误放是高风险指标。
常见来源:
- 模型低估风险
- 规则缺失
- 人工判断失误
- 证据不足却放行
- 高风险标签漏标
误放率通常要作为门禁指标。
5.3 误拦率
text
误拦率 = 被错误拦截或升级的请求数 / 应被放行的请求数误拦主要影响效率和体验。
常见来源:
- 策略过严
- 风险规则覆盖太宽
- 模型置信度阈值过高
- 人工审核标准不一致
误拦率过高会让审批系统变成业务瓶颈。
5.4 高风险召回率
text
高风险召回率 = 被正确拦截或升级的高风险请求数 / 全部高风险请求数这是安全类审批最重要的指标之一。
如果高风险召回率低,说明系统没有挡住真正危险的请求。
5.5 人工审批占比
text
人工审批占比 = 进入人工审批的请求数 / 总请求数用途:
- 衡量自动化策略是否有效
- 评估人工成本
- 观察策略变更对运营团队的影响
5.6 审批处理时长
建议同时看:
- 平均时长
- P50
- P95
- P99
- 超时率
平均值容易掩盖长尾问题。Google SRE 的 SLO 思路里非常强调用用户可感知的指标来定义可靠性,审批链也一样:少数长尾请求可能造成明显体验问题。
5.7 审批积压量
text
审批积压量 = 当前待处理审批请求数建议拆分:
- 总积压
- 高风险积压
- 超时积压
- 各队列积压
- 各审批人积压
积压是审批系统失稳的早期信号。
5.8 复核一致率
text
复核一致率 = 二次复核结论与初审结论一致的样本数 / 复核样本数用途:
- 衡量人工审核标准是否一致
- 发现规则解释不清的问题
- 判断是否需要培训或规则细化
5.9 申诉成功率
text
申诉成功率 = 申诉后被改判的请求数 / 总申诉请求数申诉成功率高,通常说明误拦偏多或规则解释不清。
6. 审批混淆矩阵
审批本质上可以看成一个分类问题。
| 实际情况 | 审批放行 | 审批拦截/升级 |
|---|---|---|
| 应该放行 | 正确放行 | 误拦 |
| 应该拦截/升级 | 误放 | 正确拦截 |
从这个矩阵可以推导:
- 通过率
- 拦截率
- 误放率
- 误拦率
- 高风险召回率
- 放行准确率
- 拦截准确率
审批指标体系一定要有 ground truth 来源。
常见 ground truth 来源:
- 人工复核
- 事后申诉
- 事故复盘
- 合规审计
- 专家标注
- 业务最终结果
如果没有 ground truth,只看通过率和拦截率,只能看到流程结果,看不到审批质量。
7. 按场景拆分指标
审批指标必须分场景看。
7.1 按风险等级拆分
建议至少拆成:
- 低风险
- 中风险
- 高风险
- 禁止类
不同风险等级的优化目标不同:
| 风险等级 | 优先目标 |
|---|---|
| 低风险 | 提高自动通过率,降低人工成本 |
| 中风险 | 控制误放,同时保持可接受效率 |
| 高风险 | 优先降低误放,提高召回和人工复核 |
| 禁止类 | 稳定拦截,保留审计证据 |
7.2 按业务场景拆分
例如:
- 内容发布
- 资金操作
- 权限变更
- 数据导出
- 用户通知
- 工单关闭
- 自动化执行
- 模型输出上线
同一个审批策略在不同场景里容忍度不同。
7.3 按触发原因拆分
审批触发原因包括:
- 模型低置信度
- 命中安全规则
- 涉及敏感数据
- 涉及高风险工具
- 输出不符合 schema
- 检索证据不足
- 用户越权请求
- 金额或权限超过阈值
拆分触发原因可以帮助判断:
- 哪类规则贡献了最多审批量
- 哪类规则误拦最多
- 哪类规则真正减少了事故
8. 指标与策略版本绑定
审批策略一旦变更,团队最关心的是:
- 新策略是否更安全
- 是否拖慢业务
- 是否增加人工负担
- 是否引入新误伤
如果指标不绑定策略版本,就很难归因。
8.1 需要记录的版本
建议记录:
- approval_policy_version
- prompt_version
- model_version
- tool_schema_version
- retrieval_config_version
- risk_rule_version
- threshold_version
- reviewer_guideline_version
8.2 策略对比表
| 指标 | v1 | v2 | 变化 | 解释 |
|---|---|---|---|---|
| 误放率 | 1.2% | 0.4% | 下降 | 高风险规则增强 |
| 误拦率 | 4.8% | 7.3% | 上升 | 低置信度阈值过高 |
| P95 时长 | 3.2m | 5.6m | 上升 | 人工审批量增加 |
| 人工占比 | 18% | 31% | 上升 | 中风险请求大量升级 |
策略对比不能只看单项指标。安全收益和效率代价要一起看。
9. 审批指标看板设计
一张审批看板建议分成 5 块。
9.1 总览区
展示:
- 总请求数
- 审批请求数
- 自动通过率
- 人工审批占比
- 拒绝率
- 升级率
- 误放率
- 误拦率
9.2 风险区
展示:
- 高风险召回率
- 高风险误放数
- 越权请求放行数
- 安全事件数
- 审计证据缺失数
9.3 效率区
展示:
- 平均处理时长
- P95/P99 处理时长
- 超时率
- 队列等待时长
- 各节点耗时
9.4 负担区
展示:
- 人工审批量
- 审批人负载
- 积压量
- 超时积压
- 二级审批量
9.5 归因区
展示:
- 按策略版本拆分
- 按场景拆分
- 按触发规则拆分
- 按失败类型拆分
- 典型样例链接
没有归因区的 dashboard 很容易只停留在“看到了异常”,无法进入“为什么异常”。
10. 审批 SLO 与告警
审批系统也应该有 SLO。
10.1 示例 SLO
| 类型 | SLO 示例 |
|---|---|
| 安全 | 高风险召回率 >= 99% |
| 质量 | 误放率 <= 0.5% |
| 效率 | 95% 审批在 5 分钟内完成 |
| 负担 | 人工审批占比 <= 25% |
| 积压 | 高风险积压量 = 0 |
| 审计 | 审计证据完整率 >= 99.5% |
10.2 告警规则
可以设置:
- 高风险误放数 > 0 立即告警
- P95 审批时长超过阈值告警
- 高风险队列积压超过阈值告警
- 人工审批占比异常升高告警
- 某策略版本误拦率突然升高告警
- 审计证据缺失率超过阈值告警
10.3 Error Budget 思路
Google SRE 的 error budget 思路可以类比到审批:
- 如果误放预算耗尽,停止放宽策略
- 如果延迟预算耗尽,优先优化流程和队列
- 如果人工负担预算耗尽,优先做自动化分流
这样能避免安全、效率和人力之间互相甩锅。
11. 从指标到样例归因
指标异常只是入口,真正有价值的是样例归因。
11.1 异常下钻路径
建议路径:
text
指标异常
-> 定位场景
-> 定位策略版本
-> 定位触发规则
-> 查看样例
-> 标注失败类型
-> 形成修复动作11.2 失败类型标签
常见标签:
- risk_missed:风险漏识别
- over_blocked:过度拦截
- evidence_missing:证据不足
- reviewer_inconsistent:审核人标准不一致
- policy_ambiguous:策略规则模糊
- threshold_too_strict:阈值过严
- threshold_too_loose:阈值过松
- tool_result_uncertain:工具结果不确定
- prompt_injection:提示注入
- pii_sensitive:敏感信息
11.3 样例记录结构
json
{
"case_id": "approval-20260706-001",
"scenario": "data_export",
"risk_level": "high",
"policy_version": "approval_policy_v2.3",
"model_version": "model_x_2026_07",
"decision": "approved",
"ground_truth": "should_escalate",
"error_type": "risk_missed",
"trigger_rules": ["large_export", "external_email"],
"latency_ms": 184000,
"reviewer_id": "masked_reviewer",
"evidence_complete": true,
"notes": "外部邮箱导出未触发二级审批"
}样例结构化后,才能把失败沉淀回评测集。
12. 审批指标如何驱动策略优化
12.1 误放升高
可能原因:
- 阈值过松
- 新场景未覆盖
- 模型能力退化
- 高风险规则缺失
- 人工审核疲劳
处理方式:
- 补充高风险样例
- 提高高风险阈值
- 增加二级审批
- 回滚策略版本
- 加强证据要求
12.2 误拦升高
可能原因:
- 阈值过严
- 规则覆盖过宽
- 低风险场景未豁免
- Prompt 过度保守
- 审核指南不清楚
处理方式:
- 拆分低风险自动通过策略
- 优化规则边界
- 调整阈值
- 增加反例样本
- 更新审核手册
12.3 审批时长升高
可能原因:
- 人工队列不足
- 二级审批过多
- 策略升级条件过宽
- 工具返回慢
- 审批 UI 信息不足
处理方式:
- 优先处理高风险队列
- 拆分队列
- 自动填充证据摘要
- 减少无效升级
- 对低风险请求自动放行
12.4 人工负担升高
可能原因:
- 规则过严
- 评测未覆盖真实流量
- 自动审批能力不足
- 重复审批
- 缺少批量处理
处理方式:
- 建立自动审批白名单
- 合并重复审批
- 按风险分层
- 引入批量审核
- 优化模型置信度策略
13. 审批策略灰度与回放
审批策略不能直接全量替换。
推荐流程:
- 固定历史审批样本
- 用新策略离线回放
- 对比误放、误拦、时长和人工占比
- 分析典型差异样例
- 小流量灰度
- 观察指标
- 决定放量、调整或回滚
13.1 离线回放要看什么
| 指标 | 目的 |
|---|---|
| 决策变化率 | 看新策略改动范围 |
| 新增拦截数 | 看是否变严 |
| 新增放行数 | 看是否变松 |
| 高风险误放 | 一票否决 |
| 误拦变化 | 看业务代价 |
| 人工审批变化 | 看运营压力 |
13.2 灰度期间要看什么
- 是否出现高风险误放
- P95 审批时长是否恶化
- 人工审批量是否超过承载能力
- 申诉成功率是否升高
- 审核人是否反馈规则不清
- 是否有新类型失败样例
14. 审批指标与评测集的关系
审批指标不应该只服务 dashboard,也应该反哺评测。
14.1 从线上指标回流评测
这些样例必须回流:
- 误放样例
- 高风险拦截样例
- 申诉成功样例
- 审核分歧样例
- 超时积压样例
- 规则冲突样例
- 提示注入样例
14.2 评测集分层
建议至少有:
- 正常通过样例
- 正常拦截样例
- 边界样例
- 误放回流样例
- 误拦回流样例
- 安全攻击样例
- 低质量输入样例
OpenAI 的 eval 思路强调,评测样例和评分规则要与真实目标绑定。审批场景同样如此:如果 eval 只测普通样例,就无法证明策略能挡住高风险请求。
15. 审批指标报告模板
可以按周生成一份审批运营报告。
markdown
# 审批指标周报
## 1. 总览
- 总请求数:
- 审批请求数:
- 自动通过率:
- 人工审批占比:
- 误放率:
- 误拦率:
- P95 审批时长:
- 当前积压:
## 2. 风险表现
- 高风险召回率:
- 高风险误放样例:
- 安全事件:
- 审计证据缺失:
## 3. 效率表现
- 各队列处理时长:
- 超时样例:
- 积压变化:
## 4. 策略版本对比
| 策略版本 | 误放率 | 误拦率 | 人工占比 | P95 时长 |
|---|---|---|---|---|
## 5. 典型样例
- 误放样例:
- 误拦样例:
- 审核分歧样例:
## 6. 下周动作
- 策略调整:
- 样例补充:
- 流程优化:
- 风险跟进:16. 常见反模式
16.1 只看通过率
问题:
- 看不到误放和误拦
修正:
- 用混淆矩阵拆解审批质量
16.2 不区分场景
问题:
- 高频低风险请求掩盖高风险问题
修正:
- 按风险等级、业务场景、触发原因拆分
16.3 不看长尾延迟
问题:
- 平均时长正常,但少数用户等很久
修正:
- 看 P95/P99 和超时率
16.4 没有 ground truth
问题:
- 无法判断审批对错
修正:
- 建立人工复核、申诉、审计和事故复盘机制
16.5 指标不绑定版本
问题:
- 策略变化无法归因
修正:
- 记录策略、模型、Prompt、工具和阈值版本
16.6 异常不下钻样例
问题:
- 只能看到趋势,不能修复问题
修正:
- 每个异常指标必须能跳到样例和失败标签
17. 落地检查清单
17.1 指标定义
- 是否定义通过率、误放率、误拦率、高风险召回率
- 是否定义人工审批占比和升级审批占比
- 是否定义平均时长、P95、P99、超时率
- 是否定义积压量和高风险积压量
- 是否定义审计证据完整率
17.2 数据采集
- 是否记录审批输入
- 是否记录审批输出
- 是否记录触发规则
- 是否记录策略版本
- 是否记录模型和 Prompt 版本
- 是否记录审批人和处理时长
- 是否记录 ground truth 来源
17.3 看板与告警
- 是否按场景拆分看板
- 是否有高风险误放告警
- 是否有审批超时告警
- 是否有积压告警
- 是否能下钻样例
17.4 治理闭环
- 是否用指标驱动策略回放
- 是否把失败样例沉淀到评测集
- 是否定期复盘审核一致性
- 是否能灰度和回滚审批策略
- 是否能证明策略变更带来的收益和代价
18. 推荐搭配阅读
19. 推荐资料
以下资料在 2026-07-06 检查时可访问。
官方文档
- OpenAI Evals:https://developers.openai.com/api/docs/guides/evals
- OpenAI Evaluation best practices:https://developers.openai.com/api/docs/guides/evaluation-best-practices
- NIST AI Risk Management Framework:https://www.nist.gov/itl/ai-risk-management-framework
- Google SRE Book - Service Level Objectives:https://sre.google/sre-book/service-level-objectives/
- Google SRE Book - Monitoring Distributed Systems:https://sre.google/sre-book/monitoring-distributed-systems/
20. 一句话总结
审批指标体系的核心不是证明审批链“更严格”,而是同时衡量误放、误拦、效率、负担和风险控制效果,并把指标异常追溯到具体样例、策略版本和改进动作。