Server-Guard · 智能运维引擎

上线之后智能运维24小时守护

全天候监控与快速响应,把风险挡在用户感知之前。

从告警到闭环的值守流水线

  1. 01

    巡检

    31 项巡检定时执行、多机并发采集,异常第一时间浮现。

  2. 02

    告警

    对接 Prometheus / Zabbix,去重富化三阶段处理,拒绝告警风暴。

  3. 03

    诊断

    LLM 根因分析与 Playbook 规则诊断互为补充,输出结构化修复建议。

  4. 04

    自愈

    低风险操作自动执行,SSH 远程、可回滚,修复后自动触发验证巡检。

  5. 05

    审批

    高风险操作人工把关,移动端 / 控制台双通道审批,AI 绝不越权。

server-guard console
Server-Guard 值守控制台(系统实拍)
Server-Guard 值守控制台(系统实拍)

31 项自动巡检矩阵

3131 项巡检 · 三大类全覆盖

  • 系统资源

    • CPU 健康(二次采样)
    • 系统负载
    • 内存
    • Swap
    • 磁盘挂载点
    • 进程 / 端口存活
    • 内核 OOM / Panic
    • systemd 服务
  • 应用层

    • JVM 堆与 GC
    • Nginx 配置与错误日志
    • Redis 慢查询
    • Docker 容器与镜像年龄
    • MySQL 状态
    • Java 线程
  • 安全审计

    • OS 生命周期(EOL 预警)
    • 可登录用户体系
    • 僵尸进程

定时调度 + 分布式锁多机并发采集;解析器自动适配——有对应组件就采集,没有则智能跳过,绝不误报。

四级风险分级响应

  • LOW

    处置方式
    自动批准执行
    典型场景
    日志清理、临时文件清理、非核心服务重启
  • MEDIUM

    处置方式
    人工审批(移动端通知)
    典型场景
    重启数据库、修改配置并重载
  • HIGH

    处置方式
    人工审批(双通道确认)
    典型场景
    多服务影响、数据变更、批量操作
  • CRITICAL

    关键

    处置方式
    控制台审批 + 强制回滚方案
    典型场景
    可能导致服务中断 / 数据丢失的操作

三层风险评估 + 时间感知:业务高峰时段自动升级风险等级。

人在回路 HITL 审批闭环

关键操作由人拍板:四级风险状态机全程留痕,移动端 IM 与 Web 控制台双通道,随时随地掌控关键操作。

  1. 创建
  2. 通知
  3. 待决
  4. 批准 / 拒绝
  • 超时自动拒绝
  • 崩溃可恢复
  • 双通道通知与审批

纵深安全防线

  • 危险命令硬拦截

    7 大危险类别、21+ 条致命命令永远封堵,文件系统破坏、权限放开等高危操作无机会执行。

  • 5 级角色权限 · 默认拒绝

    从只读到批量执行分级授权、白名单正则精确管控;任何未被明确允许的命令一律不放行。

  • 全链路审计留痕

    巡检、告警、诊断、审批、执行全部落库加 JSONL 审计日志,最长 365 天可追溯。

AI 智能诊断内核

  • 双 LLM 诊断大脑

    双提供商自动故障切换、熔断保护;批量诊断、每条异常独立根因分析。

  • Playbook 规则诊断

    内置磁盘、CPU、Nginx 等运维手册,规则匹配 + 步骤执行,与 LLM 互为补充。

  • 多 Agent 智能调度

    巡检、告警、诊断、执行、批量五类角色按场景调度,支持任务分解、并发与重试。

  • RAG 知识检索

    语义向量检索历史案例与运维手册,让每一次处置都站在过往经验之上。

零外部依赖

  • 无需 MySQL / Redis / 消息队列
  • SQLite + JSONL 开箱即用
  • 单机部署,运维成本极低
  • 一台节点守护数十台服务器

证书全生命周期管理

  1. 01

    到期分级预警

    30 / 14 / 7 天与已过期分级预警,漂移与缺失检测,定时扫描。

  2. 02

    ACME 自动续期

    自研 RFC 8555 客户端自动签发续期,支持私有 CA 与人工上传兜底。

  3. 03

    审批门控部署

    高风险审批门控,原子替换 + 前置 / 重载 / 后置三段校验,失败自动回滚。

  4. 04

    私钥安全

    0600 / 0700 权限强校验(fail-closed),滚动备份保留 7 份,访问全程审计。

真实处置场景

  • 磁盘告警 · 凌晨自动处置

    监控推送磁盘 95% 告警,AI 诊断为日志暴涨,评估为低风险后自动清理旧日志,磁盘回落——全程无需人工介入。

  • Java 服务 OOM · 一键诊断

    巡检发现 JVM 老年代 95%,自动触发堆转储申请并推送审批,你在手机点“同意”即自动执行并回执——无需登服务器敲命令。

  • 配置错误 · 安全兜底

    AI 建议重载网关,但配置语法检查未通过:安全过滤识别为高危并拦截执行,推送审批附回滚方案——避免一次线上事故。

  • 证书到期 · 自动续期部署

    提前 30 天预警,ACME 自动续期,审批通过后原子替换 + 健康校验,失败自动回滚——续期部署全程无忧。

核心能力

  • 全天候监控告警

    系统、应用与业务指标统一监控,异常第一时间通知到人。

  • 故障快速响应

    分级响应机制与处置预案齐备,恢复优先、复盘随后。

  • 例行巡检维护

    补丁、备份、证书与容量定期巡检,隐患提前消除。

  • 安全加固防护

    基线核查与安全补丁持续跟进,不断缩小暴露面。

  • 容量与成本优化

    资源用量持续观测与调优,让性能更稳、成本更省。

交付流程

  1. 1

    现状评估

    盘点系统资产与风险基线,明确守护范围与优先级。

  2. 2

    监控接入

    部署监控与告警体系,关键指标全量可见。

  3. 3

    流程建立

    建立分级响应与变更管理流程,分工与时限事先约定。

  4. 4

    日常守护

    巡检、值守与优化常态化运转,异常按流程处置。

  5. 5

    复盘改进

    定期输出健康报告,复盘改进项滚动落地。

获取方案