Pro 和 Business 功能

比用户更早发现问题

实时指标、即时告警、公共状态页面。sh0 监控每个容器,您无需整天盯着仪表盘。

包含什么

生产工作负载所需的每个指标,自动采集。

CPU 指标
每个容器的 CPU 使用率及历史趋势
内存指标
内存消耗、限制和 OOM 追踪
磁盘 I/O
每个卷的读写吞吐量和 IOPS
网络流量
每个容器的入站/出站带宽
容器健康
运行中、已停止、重启中、OOM 终止状态
响应时间
HTTP 延迟百分位数(p50、p95、p99)

工作原理

01

按应用启用监控

在仪表盘中为任何应用启用监控。sh0 立即开始采集指标 -- 无需安装代理,无需编写配置文件。

02

设置告警阈值

定义何时需要通知:CPU 超过 90%、内存超过 80%、响应时间超过 500 毫秒。按应用或设置服务器级别的默认值。

03

选择通知渠道

将告警路由到 Slack、Discord、Telegram、邮件或任何 webhook 端点。不同应用可以使用不同渠道。

04

放心 -- sh0 全天候监控

指标每 15 秒采集。阈值突破后一分钟内触发告警。您安心休息,sh0 持续监控。

监控流水线

应用容器
指标采集器
阈值检查
告警路由
Slack / Discord / 邮件

每 15 秒采集指标 -- 阈值突破后一分钟内触发告警

一应俱全

实时仪表盘

实时 CPU、内存、磁盘和网络图表,每 15 秒更新。缩放到任何时间范围 -- 过去一小时、一天、一周。

5 个告警渠道

Slack、Discord、Telegram、邮件和通用 webhook。配置一次,按应用或严重级别路由告警。

正常运行时间检查

从服务器进行 HTTP 和 TCP 健康检查。在用户发现之前知道应用是否宕机。

公共状态页面

为您的服务生成公共状态页面,带实时正常运行指示器。分享给团队或客户。

事件追踪

每个告警创建一个事件,带有时间线:何时开始、何时确认、何时解决。完整的审计追踪。

历史指标

指标保留 30 天(Pro)或 90 天(Business)。发现趋势,规划容量,调试上周二发生的问题。

传统方式

  • x 安装 Prometheus + Grafana
  • x 为每个服务配置导出器
  • x 用 YAML 编写告警规则
  • x 设置 Alertmanager
  • x 维护单独的状态页面
  • x 祈祷凌晨 3 点不出问题

sh0 的方式

  • 按应用启用监控
  • 在仪表盘中设置阈值
  • 5 个内置渠道
  • 包含状态页面
  • 事件时间线自动生成
  • 安心入睡

常见问题

采集哪些指标? +
CPU 使用率、内存消耗、磁盘 I/O、网络流量、容器健康状态和 HTTP 响应时间。所有指标按容器采集,让您精确了解哪个应用在消耗资源。
多久采集一次指标? +
默认每 15 秒一次。告警在每个采集周期进行评估,因此在阈值突破后一分钟内收到通知。
可以设置自定义阈值吗? +
可以。每个指标支持按应用自定义阈值。例如,API 服务器可以在 CPU 80% 时告警,而后台 worker 可以安全运行到 95%。您也可以设置服务器级别的默认值。
有公共状态页面吗? +
可以。sh0 可以生成一个公共状态页面,显示您选定服务的正常运行时间。您获得一个可分享的 URL,显示实时状态和事件历史 -- 无需外部工具。
告警渠道如何工作? +
在仪表盘中配置一次渠道(如 Slack webhook URL、Discord 频道、邮件地址),然后将渠道分配给应用或告警规则。当阈值被突破时,sh0 向所有分配的渠道发送通知。
监控会影响性能吗? +
影响可忽略不计。sh0 从 Docker stats API 和 Linux /proc 文件系统读取指标 -- 容器内没有运行任何代理。开销低于 1% CPU 和几兆字节内存。

不再盲目运维

实时指标,即时告警,零配置。精确了解服务器上发生的一切。