节点观测与告警
读者:需要掌握节点健康度、及时发现异常的运维人员。
Master 通过各 Host 上 Client 的 WebSocket 心跳与主机指标上报,在控制台实时展示在线状态、CPU / 内存 / 磁盘与同步概况;结合阈值可触发节点实时预警观测(套餐全档包含)。
1. 适用场景
Section titled “1. 适用场景”- 一眼查看哪些 Host 离线、哪些逻辑节点
drift - 磁盘将满、内存异常时提前处理
- 与 Telegram 通知 联动推送告警
2. 控制台观测
Section titled “2. 控制台观测”| 指标 | 说明 |
|---|---|
| 在线 / 离线 | Client WebSocket 连接状态 |
| CPU / 内存 / 磁盘 | 心跳附带快照,WebSocket 推送更新 |
| 版本 | Client 与 XUI 版本号 |
| 最后见到时间 | 辅助判断抖动离线 |
逻辑节点绑定视图
Section titled “逻辑节点绑定视图”每台 Host 上的 sync_status、inbound_client_count、流量观测字段(若上报)帮助判断线路是否健康。
无需手动刷新页面;断线后浏览器会显示离线状态。
3. 告警与预警
Section titled “3. 告警与预警”预警规则(具体阈值以控制台 设置 / 观测 为准)可能包括:
- Host 离线超过 N 分钟
- CPU / 内存 / 磁盘超过阈值
- 配置同步连续失败
- Client 版本过旧
触发后:
4. 与配置同步的关系
Section titled “4. 与配置同步的关系”观测告诉你「节点活着且资源够」;配置同步 告诉你「配置对不对」。两者独立:
- 在线但
drift→ 配置问题,查同步队列 - 同步成功但 CPU 100% → 容量或攻击,查业务流量与系统负载
5. 注意事项
Section titled “5. 注意事项”- 心跳间隔与展示精度有限,秒级抖动不代表服务不可用
- 内网 / NAT 环境可能影响「在线设备」类指标,与 设备限制 配合解读
- Prometheus 指标:Master 可暴露
observability.prom_bind(默认:9100),供自建 Grafana(高级用法)
6. 常见问题
Section titled “6. 常见问题”Q:显示离线但 SSH 能连?
A:多为 xctl-client 停掉或连不上 Master;systemctl status xctl-client 与 Web SSH。
Q:指标长期不更新?
A:WebSocket 被代理断开;检查反代 idle timeout 与 Upgrade 头。