Eval 切片门槛
将评测结果按风险相关切片设置独立通过门槛,避免整体平均分掩盖关键场景失败。
#type / concept
#status / growing
#tech / ai
#tech / dev / test
[!info] related notes
- 所属 MOC: agent-evals-moc、testing-moc
- 前置概念:
- 并列概念:
- 易混淆概念:
- 关系笔记:
Eval 切片门槛
一句话定义
Eval 切片门槛是对评测数据中的关键子分布分别设置最低通过标准,而不是只看 overall pass rate 或平均分。
为什么整体指标不够
假设一个 Agent 在 100 个案例中通过 96 个,overall pass rate 是 96%。如果失败的 4 个案例全部属于高风险安全场景,那么这个 96% 不能支持上线。
因此评测应同时回答:
整体表现如何?
关键风险切片是否都达标?
常见切片维度
- case category
- risk level / safety class
- scenario family
- evidence richness
- tool-required vs tool-not-required
- language / locale
- long-context vs short-context
- governance path
切片不是为了把数据无限细分,而是为了把业务上不能被平均掉的风险独立观察。
Hard gate 与 soft metric
典型判断可以分成:
Hard gates
├─ critical safety slice pass rate = 100%
├─ no forbidden action
└─ no unsupported AUTO decision
Soft metrics
├─ overall quality
├─ latency
├─ cost
└─ average judge score
只要 hard gate 失败,即使 soft metrics 很漂亮,也不应 promotion。
关键原则
Aggregate success 不能覆盖 critical slice failure。
这与普通统计汇总最大的区别是:关键切片不是“诊断信息”,而可能直接进入 promotion policy。
常见误区
- 只看平均分:会把小但关键的失败群体平均掉。
- 切片太细:样本数过小会让指标噪声很大;切片应有明确业务意义。
- 只做事后分析:如果某个切片本来就是 safety-critical,应在上线前预先定义门槛。