Recurso Business & Enterprise

Escale quando importa, reduza quando não importa

Defina limites de CPU e memória uma vez. sh0 adiciona réplicas quando a carga aumenta, remove quando diminui e faz load balance do tráfego automaticamente. Sem orquestrador. Sem YAML. Sem alertas às 3h da manhã.

O que você recebe

Escala baseada em métricas, gerenciamento de réplicas e load balancing inteligente -- tudo integrado.

Escala baseada em CPU
Escale réplicas para cima ou para baixo baseado no uso médio de CPU entre containers
Escala baseada em memória
Dispare eventos de escala quando o consumo de memória ultrapassa seus limites
Limites mín/máx de réplicas
Defina limites rígidos para nunca escalar demais ou subprovisionar
Períodos de cooldown
Previna oscilações com cooldown configurável entre eventos de escala
Load balancing
Round-robin, least-connections ou distribuição aleatória entre réplicas
Roteamento consciente de saúde
Roteie tráfego apenas para réplicas saudáveis que passam nos health checks

Como funciona

01

Defina limites de CPU/memória

Defina a porcentagem em que a escala deve ser disparada -- por exemplo, escale para cima quando a CPU exceder 70% ou a memória passar de 80%.

02

Defina mín e máx de réplicas

Defina o piso e o teto para a contagem de réplicas. Mínimo garante disponibilidade; máximo limita o uso de recursos.

03

Configure o período de cooldown

Defina o tempo mínimo entre eventos de escala (ex.: 60 segundos) para prevenir oscilação rápida sob carga flutuante.

04

sh0 escala automaticamente baseado na carga

O autoscaler monitora métricas continuamente e ajusta a contagem de réplicas em tempo real. Sem intervenção manual necessária.

O pipeline de escala

Pico de Tráfego
Coletor de Métricas
Limite Ultrapassado
Escalar Réplicas
Load Balancer
Distribuir Tráfego

Todo o ciclo completa em segundos -- sem overhead de orquestrador, sem atrasos de agendamento de pod

Tudo o que você precisa

Limites de CPU e memória

Defina limites independentes para utilização de CPU e memória. A escala é disparada quando qualquer métrica ultrapassa a linha.

Limites mín/máx de réplicas

Defina uma contagem mínima de réplicas para alta disponibilidade e uma máxima para controlar custos. sh0 fica dentro dos seus limites.

Cooldown configurável

Previna oscilação de escala com uma janela de cooldown. Após um evento de escala, sh0 aguarda antes de avaliar novamente.

3 estratégias de load balancing

Escolha round-robin para distribuição uniforme, least-connections para roteamento inteligente ou random para simplicidade. Troque a qualquer momento.

Consciente de health-check

Réplicas que falham nos health checks são automaticamente removidas do pool do load balancer. O tráfego só vai para instâncias saudáveis.

Capaz de scale-to-zero

Defina réplicas mínimas como zero e sh0 desliga todas as instâncias quando ociosas. Perfeito para staging, dev e apps com pouco tráfego.

O jeito antigo

  • x SSH manual e iniciar containers
  • x Adivinhar padrões de tráfego
  • x Sem resposta automática a picos
  • x Superprovisionar para garantir
  • x Pagar por recursos ociosos
  • x Acordar às 3h da manhã para escalar

O jeito sh0

  • Defina limites uma vez
  • Escala automática para cima sob carga
  • Escala para baixo quando calmo
  • Load balanced automaticamente
  • Health checks roteiam tráfego
  • Durma durante picos de tráfego

Perguntas e respostas

Quais métricas disparam a escala? +
Utilização de CPU e uso de memória, medidos como porcentagem entre todas as réplicas em execução. Você define o limite para cada independentemente -- por exemplo, escale ao atingir 70% de CPU ou 80% de memória, o que acontecer primeiro.
Quão rápido é a escala? +
Novas réplicas são iniciadas em segundos após a violação de um limite (sujeito ao seu período de cooldown). Como sh0 usa imagens Docker pré-compiladas, não há etapa de build -- containers sobem imediatamente a partir da imagem existente.
Quais estratégias de load balancing estão disponíveis? +
Três estratégias: round-robin (requisições distribuídas uniformemente em ordem), least-connections (enviada para a réplica com menos requisições ativas) e random (distribuída aleatoriamente). Você pode mudar a estratégia a qualquer momento sem downtime.
Posso definir scale-to-zero? +
Sim. Defina suas réplicas mínimas como 0 e sh0 desligará todas as instâncias quando as métricas ficarem abaixo do limite. A primeira requisição recebida dispara um cold start. Ideal para ambientes de staging ou serviços com pouco tráfego.
Como funciona o cooldown? +
Após um evento de escala (para cima ou para baixo), sh0 aguarda o período de cooldown antes de avaliar métricas novamente. Isso previne oscilação rápida quando a carga está flutuando em torno do limite. O padrão é 60 segundos, configurável por app.
Funciona com bancos de dados? +
Auto-scaling é projetado para containers de aplicação stateless. Bancos de dados e outros serviços stateful não devem ser auto-escalados -- sh0 impede que você habilite isso em containers de banco de dados para proteger a integridade dos dados.

Lide com qualquer tráfego, automaticamente

Auto-scaling baseado em CPU e memória com load balancing integrado. Sem orquestrador necessário.