Observability Engineering MOC

AI Agent 可观测性与质量治理知识地图:Tracing、Metrics、Logging、Token 用量追踪、成本监控、延迟监控、Prompt 调试、评估体系、LLM-as-a-Judge。

#type / moc #status / growing #tech / ai #tech / ops

[!info] related notes

Observability Engineering MOC

AI 服务的可观测性不只是”请求成功没有、延迟多少”。还需要回答:LLM 花了多少钱、回答得好不好、流式管道断在哪、RAG 检索质量如何。

这张地图覆盖什么

  • OpenTelemetry 三大信号:Traces、Metrics、Logs
  • AI 服务特有的可观测性需求
  • Token 用量与成本追踪
  • Agent Trace 的可视化与调试
  • 评估体系:Eval Dataset、Golden Test、LLM-as-a-Judge
  • RAG 质量指标:Recall、Precision、Faithfulness

推荐阅读顺序

  1. AI 服务可观测性 — AI 服务特有的可观测性需求
  2. Trace — 执行链路追踪
  3. OpenTelemetry — 可观测性标准框架
  4. Token 用量追踪 — 每次 LLM 调用的 token 消耗
  5. 成本追踪 — 将 token 用量转化为成本
  6. Agent Trace Viewer — Trace 的可视化查看
  7. Agent 评估工程化 — 评估体系设计
  8. LLM-as-a-Judge — 用模型评估模型

核心概念分组

基础信号

AI 特有指标

评估体系

RAG 质量

工具与平台

安全治理

相关 MOC

创建于 2026/6/30 更新于 2026/8/8