Eval 非劣性门槛
用预先定义的可接受退化边界比较候选配置与已批准基线,判断候选是否在关键质量上没有实质性变差。
#type / concept
#status / growing
#tech / ai
#tech / dev / test
[!info] related notes
- 所属 MOC: agent-evals-moc、testing-moc
- 前置概念: agent-configuration-bundle、eval-slice-gates
- 并列概念:
- 易混淆概念:
- 关系笔记: bodysense-diagnosis-model-governance-eval-loop
Eval 非劣性门槛
一句话定义
Eval 非劣性门槛用于回答:候选配置虽然未必比当前基线分数更高,但能否证明它在关键质量与安全指标上没有实质性变差。
为什么不是只比较平均分
在生产替换中,候选版本常见目标是降低成本、延迟或提高容量,而不是追求所有质量分数都更高。
因此真正的问题常常是:
Candidate 的关键质量退化
是否仍小于预先允许的 margin?
例如:
Baseline quality = 94.0
Candidate quality = 92.8
non-inferiority margin = -2.0
仅看点估计时 -1.2 好像可接受,但还需要结合 paired comparison、样本量、方差和 confidence interval 判断不确定性。
核心规则
- 先定义 margin,再看 holdout 结果:不能看到候选差多少以后再移动及格线。
- 关键 safety gate 仍优先:non-inferiority 不能替代 hard blocking condition;候选若触发关键安全失败,不能因为总体差异落在 margin 内就通过。
- 优先 paired eval:同一批 case 比较 Champion 与 Challenger,可以减少样本组成差异带来的噪声。
- 报告 delta 的不确定性:不仅记录候选和基线各自分数,还要记录差值及其置信区间。
与 superiority 的区别
Superiority
→ 证明 Candidate 更好
Non-Inferiority
→ 证明 Candidate 没有差到超过可接受边界
当质量已经达到足够高的生产门槛,而候选能显著降低成本或延迟时,non-inferiority 往往比“必须更高分”更符合真实决策问题。
常见误解
- 候选平均分更高就自动通过:关键切片仍可能回归。
- 差值落在 margin 内就够了:还必须考虑统计不确定性。
- margin 可以动态调整:如果根据结果修改 margin,它就失去独立门槛的意义。