Observability Engineering MOC
AI Agent 可观测性与质量治理知识地图:Tracing、Metrics、Logging、Token 用量追踪、成本监控、延迟监控、Prompt 调试、评估体系、LLM-as-a-Judge。
#type / moc
#status / growing
#tech / ai
#tech / ops
[!info] related notes
- 上层 MOC: AI Agent Application MOC, AI MOC
- 实践: AI 服务可观测性, BodySense 可观测性
- 工具: LangSmith
Observability Engineering MOC
AI 服务的可观测性不只是”请求成功没有、延迟多少”。还需要回答:LLM 花了多少钱、回答得好不好、流式管道断在哪、RAG 检索质量如何。
这张地图覆盖什么
- OpenTelemetry 三大信号:Traces、Metrics、Logs
- AI 服务特有的可观测性需求
- Token 用量与成本追踪
- Agent Trace 的可视化与调试
- 评估体系:Eval Dataset、Golden Test、LLM-as-a-Judge
- RAG 质量指标:Recall、Precision、Faithfulness
推荐阅读顺序
- AI 服务可观测性 — AI 服务特有的可观测性需求
- Trace — 执行链路追踪
- OpenTelemetry — 可观测性标准框架
- Token 用量追踪 — 每次 LLM 调用的 token 消耗
- 成本追踪 — 将 token 用量转化为成本
- Agent Trace Viewer — Trace 的可视化查看
- Agent 评估工程化 — 评估体系设计
- LLM-as-a-Judge — 用模型评估模型
核心概念分组
基础信号
- OpenTelemetry — 可观测性标准框架
- Trace — 分布式追踪
- 延迟监控 — 端到端延迟监控
- Prompt Debugging — Prompt 调试方法
AI 特有指标
- Token 用量追踪 — 输入/输出 token 消耗
- 成本追踪 — token 用量 × 单价
- Agent Trace Viewer — Agent 执行过程的可视化
评估体系
- Agent 评估工程化 — 评估体系设计
- Eval Dataset — 评估数据集
- Golden Test — 金标测试
- LLM-as-a-Judge — 用模型评估模型
- Human Feedback — 人工反馈
RAG 质量
- RAG Faithfulness 校验 — 回答与知识库的一致性
- 意图感知 RAG 重排 — 检索质量优化
工具与平台
- LangSmith — LangChain 生态的 tracing、eval、monitoring 平台
- BodySense 可观测性 — 实战参考
- 在 Oracle VPS 上通过 Caddy 部署 Token Monitor Hub — 多设备 Token 用量同步、SSE 与网关隔离实战
安全治理
- Prompt Injection Defense — Prompt 注入防御
- Data Access Control — 数据访问控制
- PII Redaction — 个人信息脱敏
- Content Safety — 内容安全
- Output Validation — 输出校验
- Policy Engine — 策略引擎
- Secret Management — 密钥管理
- Tenant Isolation — 租户隔离
- Approval Workflow — 审批工作流