哪吒监控
介绍哪吒监控的工作模型、适用场景、能力边界与选型判断。
#type / resource
#status / evergreen
#tech / ops
#resource / nezha
#platform / server
#interface / web
哪吒监控
[!info] related notes
[!abstract] 一句话理解 哪吒监控是一套面向个人和小型服务器集群的自托管监控与运维系统:Dashboard 保存资产与规则,Agent 在每台服务器采集状态并通过 gRPC 主动连接 Dashboard。
它解决什么问题
当服务器分散在不同云厂商、地区和 CPU 架构时,仅靠逐台 SSH 很难回答这些问题:哪些机器在线、资源是否异常、网站证书是否临近过期、网络是否可达、故障发生在何时。哪吒把这些观察集中到一个 Web 面板,并允许配置服务监控、通知、定时任务和有限的远程运维能力。
工作模型
| 组件 | 主要责任 | 典型状态 |
|---|---|---|
| Dashboard | 身份鉴权、服务器记录、指标展示、任务与告警 | 集中部署一份 |
| Agent | 采集 CPU、内存、磁盘、网络等数据并主动上报 | 每台被监控机器一份 |
| 反向代理 | TLS 终止、HTTP/2/gRPC 与 Web 流量转发 | Caddy、Nginx 等 |
| SQLite | 保存用户、服务器、规则和配置数据 | Dashboard 数据目录 |
Agent 主动发起出站连接,因此被监控服务器通常不需要为哪吒额外开放入站端口。Dashboard 的通信入口必须能接受 HTTP/2 与 gRPC。
适合的场景
- 个人 VPS、家用服务器和小型实验集群的资源概览。
- HTTP、TCP、ICMP Ping 与 TLS 证书等可用性检查。
- 对低成本、单机部署和自托管数据有要求的场景。
- 希望通过同一面板分发有限运维任务,但愿意单独管理高权限风险的场景。
不应把它当成什么
- 它不是 Prometheus、VictoriaMetrics 这类通用时序数据平台的完整替代品。
- Dashboard 与被监控机同机时,整机宕机会让“裁判”和“选手”一起离线,不能作为最终外部存活证明。
- 在线终端、命令执行与文件管理会扩大控制面权限;不需要时应在 Agent 配置中关闭。
- CDN 能保护 Web 入口,但可能改变 gRPC、真实 IP 和长连接行为,必须单独验证通信路径。
选型判断
如果你的目标是“快速知道几台 VPS 是否健康”,哪吒的部署和维护成本通常较低。如果目标是长期保留高基数指标、复杂查询、跨团队告警治理或合规审计,应把哪吒作为轻量入口,而不是唯一监控系统。