包含什么
生产工作负载所需的每个指标,自动采集。
CPU 指标
每个容器的 CPU 使用率及历史趋势
内存指标
内存消耗、限制和 OOM 追踪
磁盘 I/O
每个卷的读写吞吐量和 IOPS
网络流量
每个容器的入站/出站带宽
容器健康
运行中、已停止、重启中、OOM 终止状态
响应时间
HTTP 延迟百分位数(p50、p95、p99)
工作原理
01
按应用启用监控
在仪表盘中为任何应用启用监控。sh0 立即开始采集指标 -- 无需安装代理,无需编写配置文件。
02
设置告警阈值
定义何时需要通知:CPU 超过 90%、内存超过 80%、响应时间超过 500 毫秒。按应用或设置服务器级别的默认值。
03
选择通知渠道
将告警路由到 Slack、Discord、Telegram、邮件或任何 webhook 端点。不同应用可以使用不同渠道。
04
放心 -- sh0 全天候监控
指标每 15 秒采集。阈值突破后一分钟内触发告警。您安心休息,sh0 持续监控。
监控流水线
应用容器
指标采集器
阈值检查
告警路由
Slack / Discord / 邮件
每 15 秒采集指标 -- 阈值突破后一分钟内触发告警
一应俱全
实时仪表盘
实时 CPU、内存、磁盘和网络图表,每 15 秒更新。缩放到任何时间范围 -- 过去一小时、一天、一周。
5 个告警渠道
Slack、Discord、Telegram、邮件和通用 webhook。配置一次,按应用或严重级别路由告警。
正常运行时间检查
从服务器进行 HTTP 和 TCP 健康检查。在用户发现之前知道应用是否宕机。
公共状态页面
为您的服务生成公共状态页面,带实时正常运行指示器。分享给团队或客户。
事件追踪
每个告警创建一个事件,带有时间线:何时开始、何时确认、何时解决。完整的审计追踪。
历史指标
指标保留 30 天(Pro)或 90 天(Business)。发现趋势,规划容量,调试上周二发生的问题。
传统方式
- x 安装 Prometheus + Grafana
- x 为每个服务配置导出器
- x 用 YAML 编写告警规则
- x 设置 Alertmanager
- x 维护单独的状态页面
- x 祈祷凌晨 3 点不出问题
sh0 的方式
- 按应用启用监控
- 在仪表盘中设置阈值
- 5 个内置渠道
- 包含状态页面
- 事件时间线自动生成
- 安心入睡
常见问题
采集哪些指标? +
CPU 使用率、内存消耗、磁盘 I/O、网络流量、容器健康状态和 HTTP 响应时间。所有指标按容器采集,让您精确了解哪个应用在消耗资源。
多久采集一次指标? +
默认每 15 秒一次。告警在每个采集周期进行评估,因此在阈值突破后一分钟内收到通知。
可以设置自定义阈值吗? +
可以。每个指标支持按应用自定义阈值。例如,API 服务器可以在 CPU 80% 时告警,而后台 worker 可以安全运行到 95%。您也可以设置服务器级别的默认值。
有公共状态页面吗? +
可以。sh0 可以生成一个公共状态页面,显示您选定服务的正常运行时间。您获得一个可分享的 URL,显示实时状态和事件历史 -- 无需外部工具。
告警渠道如何工作? +
在仪表盘中配置一次渠道(如 Slack webhook URL、Discord 频道、邮件地址),然后将渠道分配给应用或告警规则。当阈值被突破时,sh0 向所有分配的渠道发送通知。
监控会影响性能吗? +
影响可忽略不计。sh0 从 Docker stats API 和 Linux /proc 文件系统读取指标 -- 容器内没有运行任何代理。开销低于 1% CPU 和几兆字节内存。