跳转到内容

节点观测与告警

读者:需要掌握节点健康度、及时发现异常的运维人员。

Master 通过各 Host 上 Client 的 WebSocket 心跳与主机指标上报,在控制台实时展示在线状态、CPU / 内存 / 磁盘与同步概况;结合阈值可触发节点实时预警观测(套餐全档包含)。

  • 一眼查看哪些 Host 离线、哪些逻辑节点 drift
  • 磁盘将满、内存异常时提前处理
  • Telegram 通知 联动推送告警
指标说明
在线 / 离线Client WebSocket 连接状态
CPU / 内存 / 磁盘心跳附带快照,WebSocket 推送更新
版本Client 与 XUI 版本号
最后见到时间辅助判断抖动离线

每台 Host 上的 sync_statusinbound_client_count、流量观测字段(若上报)帮助判断线路是否健康。

无需手动刷新页面;断线后浏览器会显示离线状态。

预警规则(具体阈值以控制台 设置 / 观测 为准)可能包括:

  • Host 离线超过 N 分钟
  • CPU / 内存 / 磁盘超过阈值
  • 配置同步连续失败
  • Client 版本过旧

触发后:

  1. 控制台告警列表 / 仪表盘高亮
  2. 可选 Telegram 推送
  3. 写入 审计日志 便于追溯

观测告诉你「节点活着且资源够」;配置同步 告诉你「配置对不对」。两者独立:

  • 在线但 drift → 配置问题,查同步队列
  • 同步成功但 CPU 100% → 容量或攻击,查业务流量与系统负载
  • 心跳间隔与展示精度有限,秒级抖动不代表服务不可用
  • 内网 / NAT 环境可能影响「在线设备」类指标,与 设备限制 配合解读
  • Prometheus 指标:Master 可暴露 observability.prom_bind(默认 :9100),供自建 Grafana(高级用法)

Q:显示离线但 SSH 能连?
A:多为 xctl-client 停掉或连不上 Master;systemctl status xctl-clientWeb SSH

Q:指标长期不更新?
A:WebSocket 被代理断开;检查反代 idle timeout 与 Upgrade 头。