OpenAI Agent Evaluation and Tracing
用数据集、grader、trace 与持续评估衡量 Agent 的质量、成本、延迟和工具安全。
#type / synthesis
#status / growing
#tech / ai
#resource / openai
#topic / agent
OpenAI Agent Evaluation and Tracing
为什么单看最终答案不够
Agent 可能给出看似正确的答案,却经历了错误检索、重复调用、越权工具或偶然成功。评估必须同时覆盖结果与过程:最终任务是否完成、证据是否充分、工具路径是否安全、成本和延迟是否可接受。
四层评估
- 结果质量:正确性、完整性、格式、引用和业务约束。
- 轨迹质量:工具选择、参数、调用顺序、handoff 和停止时机。
- 系统属性:延迟、token、工具费用、错误率与恢复能力。
- 安全边界:越权、提示注入、敏感数据泄露和未经批准的副作用。
从失败样本建立数据集
评估集应来自真实任务、历史故障和边界案例。每个样本至少包含输入、必要上下文、期望结果或评分规则,以及禁止行为。对开放式任务可组合确定性断言、规则 grader、模型 grader 与人工抽查。
模型 grader 也会犯错,因此要用人工标注集校准,并记录 grader 的模型与版本。关键安全不变量应尽可能使用确定性检查,而不是只交给另一个模型判断。
Trace 如何帮助定位
Trace 把一次运行拆成模型调用、工具调用、handoff、guardrail 和错误等 span。它能回答:失败发生在哪一步、调用了哪些数据、为什么重试、是否出现高成本循环。生产 trace 应脱敏并受访问控制,不应成为秘密和个人数据的新副本。
持续评估循环
真实失败 → 加入数据集 → 修正提示/工具/模型 → 离线回归
→ 小流量上线 → 监控 trace 与指标 → 扩大或回滚
一次模型升级、工具 schema 修改或知识源变化都可能造成回归。发布门禁应比较基线,而不是只看新版本是否“多数通过”。
本地知识库示例
对 thought-forest-chatgpt-kb-integration-practice,可设置以下验收:
- 只读请求不产生任何 proposal 或写入;
- 重复主题先返回查重证据;
- 未经第二次批准不能修改
z/; - 应用 proposal 后 hash、目标路径、归档和索引状态一致;
- 恶意笔记内容不能改变工具权限或审批规则。