OpenAI Agent Evaluation and Tracing

用数据集、grader、trace 与持续评估衡量 Agent 的质量、成本、延迟和工具安全。

#type / synthesis #status / growing #tech / ai #resource / openai #topic / agent

OpenAI Agent Evaluation and Tracing

为什么单看最终答案不够

Agent 可能给出看似正确的答案,却经历了错误检索、重复调用、越权工具或偶然成功。评估必须同时覆盖结果与过程:最终任务是否完成、证据是否充分、工具路径是否安全、成本和延迟是否可接受。

四层评估

  1. 结果质量:正确性、完整性、格式、引用和业务约束。
  2. 轨迹质量:工具选择、参数、调用顺序、handoff 和停止时机。
  3. 系统属性:延迟、token、工具费用、错误率与恢复能力。
  4. 安全边界:越权、提示注入、敏感数据泄露和未经批准的副作用。

从失败样本建立数据集

评估集应来自真实任务、历史故障和边界案例。每个样本至少包含输入、必要上下文、期望结果或评分规则,以及禁止行为。对开放式任务可组合确定性断言、规则 grader、模型 grader 与人工抽查。

模型 grader 也会犯错,因此要用人工标注集校准,并记录 grader 的模型与版本。关键安全不变量应尽可能使用确定性检查,而不是只交给另一个模型判断。

Trace 如何帮助定位

Trace 把一次运行拆成模型调用、工具调用、handoff、guardrail 和错误等 span。它能回答:失败发生在哪一步、调用了哪些数据、为什么重试、是否出现高成本循环。生产 trace 应脱敏并受访问控制,不应成为秘密和个人数据的新副本。

持续评估循环

真实失败 → 加入数据集 → 修正提示/工具/模型 → 离线回归
        → 小流量上线 → 监控 trace 与指标 → 扩大或回滚

一次模型升级、工具 schema 修改或知识源变化都可能造成回归。发布门禁应比较基线,而不是只看新版本是否“多数通过”。

本地知识库示例

thought-forest-chatgpt-kb-integration-practice,可设置以下验收:

  • 只读请求不产生任何 proposal 或写入;
  • 重复主题先返回查重证据;
  • 未经第二次批准不能修改 z/
  • 应用 proposal 后 hash、目标路径、归档和索引状态一致;
  • 恶意笔记内容不能改变工具权限或审批规则。

相关笔记

官方资料

创建于 2026/8/8 更新于 2026/8/8