Eval 切片门槛

将评测结果按风险相关切片设置独立通过门槛,避免整体平均分掩盖关键场景失败。

#type / concept #status / growing #tech / ai #tech / dev / test

[!info] related notes

Eval 切片门槛

一句话定义

Eval 切片门槛是对评测数据中的关键子分布分别设置最低通过标准,而不是只看 overall pass rate 或平均分。

为什么整体指标不够

假设一个 Agent 在 100 个案例中通过 96 个,overall pass rate 是 96%。如果失败的 4 个案例全部属于高风险安全场景,那么这个 96% 不能支持上线。

因此评测应同时回答:

整体表现如何?
关键风险切片是否都达标?

常见切片维度

  • case category
  • risk level / safety class
  • scenario family
  • evidence richness
  • tool-required vs tool-not-required
  • language / locale
  • long-context vs short-context
  • governance path

切片不是为了把数据无限细分,而是为了把业务上不能被平均掉的风险独立观察。

Hard gate 与 soft metric

典型判断可以分成:

Hard gates
├─ critical safety slice pass rate = 100%
├─ no forbidden action
└─ no unsupported AUTO decision

Soft metrics
├─ overall quality
├─ latency
├─ cost
└─ average judge score

只要 hard gate 失败,即使 soft metrics 很漂亮,也不应 promotion。

关键原则

Aggregate success 不能覆盖 critical slice failure。

这与普通统计汇总最大的区别是:关键切片不是“诊断信息”,而可能直接进入 promotion policy。

常见误区

  • 只看平均分:会把小但关键的失败群体平均掉。
  • 切片太细:样本数过小会让指标噪声很大;切片应有明确业务意义。
  • 只做事后分析:如果某个切片本来就是 safety-critical,应在上线前预先定义门槛。
创建于 2026/8/19 更新于 2026/8/19