Agent Evals MOC
Agent 评测、证据治理与上线验证主题入口,组织 configuration qualification、Behavioral Contract、EvidenceGap/Admissibility、DecisionAuthority、Replay、Shadow/Canary 与故障归因。
#tech / ai
#tech / dev / test
#type / moc
#status / growing
[!info] related notes
Agent Evals MOC
这张地图覆盖什么
这张地图聚焦 Agent 的质量、资格、证据边界与最终授权行为,而不只是传统服务测试。
重点包括:
- deterministic checks 与 LLM Judge 的职责边界;
- configuration-level qualification;
- dataset split、critical slice 与 non-inferiority;
- EvidenceGap、Acquisition Policy 与 Evidence Admissibility;
- SafetyEnvelope 与 DecisionAuthority;
- Behavioral Contract;
- DecisionTrace、provenance 与 replay;
- shadow / canary / rollout verification;
- production failure attribution;
- 人类 review、abstention 与 escalation。
推荐阅读顺序 / 从这里开始
1. 先建立整体质量体系
2. 再理解“评测的到底是什么”
- Agent 配置组合
- Agent Model Capability Policy
- Eval Dataset 的分层与 Grouped Split
- Eval 切片门槛
- Eval 非劣性门槛
- Agent Configuration 的 Interaction Effect
- Agent Behavioral Contract
3. 然后进入运行时 Evidence / Safety 决策
- Decision-Relevant Evidence Gap
- Evidence Acquisition Policy
- Agent Evidence Admissibility
- Agent Safety Envelope
- Deny-Overrides Policy Composition
- Agent DecisionAuthority
- Agent 中的 Stopping Conditions
- Agent 的 Fallback、Abstain 与 Escalate
4. 最后理解审计、复现、发布与故障定位
- Agent DecisionTrace
- Agent 的 Configuration Provenance 与 Execution Provenance
- Agent 的 Historical Replay 与 Counterfactual Replay
- Agent Failure Attribution
- Release and Runtime Verification
- BodySense Diagnosis 的模型治理与 Eval 生产闭环
- BodySense Diagnosis Agent Architecture
核心概念分组
Eval 对象与资格
- Agent 配置组合
- Agent Model Capability Policy
- Eval 非劣性门槛
- Agent Configuration 的 Interaction Effect
- Agent Behavioral Contract
Dataset 与 Evaluator
- Eval Dataset
- Eval Dataset 的分层与 Grouped Split
- Eval 切片门槛
- LLM-as-a-Judge
- Agent 中的 Ground Truth Feedback
Evidence 与风险控制
- Decision-Relevant Evidence Gap
- Evidence Acquisition Policy
- Agent Evidence Admissibility
- Agent Safety Envelope
- Deny-Overrides Policy Composition
- Agent DecisionAuthority
- Agent Guardrails
- Agent 中的人类监督
- Agent 中的 Approval Checkpoints
- Agent 中的 Stopping Conditions
- Agent 的 Fallback、Abstain 与 Escalate
决策可审计性与 Replay
- Agent DecisionTrace
- Agent 的 Configuration Provenance 与 Execution Provenance
- Agent 的 Historical Replay 与 Counterfactual Replay
- Trace
Production Failure Attribution
- Agent Failure Attribution — 从 Input/Context 到 Delivery 找第一个 contract violation
- Hypothesis-Driven Debugging
发布与线上验证
- Release and Runtime Verification
- BodySense Diagnosis 的模型治理与 Eval 生产闭环
- BodySense Diagnosis Agent Architecture
一个最重要的 Eval 观念
Agent Eval 不应该只验证:
“最终答案是不是对的?”
还要验证:
输入/身份是否正确
Evidence 是否合法
Tool/Budget 是否越界
Hard Safety invariant 是否被遵守
Configuration 是否匹配
DecisionAuthority 是否符合 policy
Persistence/Delivery 是否保持授权结果
因此:
Correct answer ≠ valid Agent execution.