0 XP

Boss Battles

Incidentes que você vai encontrar de verdade

Leia os sintomas, monte a hipótese e só depois abra a investigação. Isso treina exatamente o que uma entrevista técnica testa.

  • Processo Zumbi

    +750 XP Nível 3

    Depois de um deploy manual, o serviço da API não sobe: a porta 3000 está ocupada, o systemd reporta falha e há processos órfãos na árvore. O time pede a API de volta em dez minutos.

    Sintomas

    • • systemctl start falha com 'Address already in use'
    • • ps mostra processos node em estado Z (zumbi) e um pai antigo ainda vivo
    • • journalctl registra reinícios sucessivos
  • Dragão 502

    +750 XP Nível 8

    Usuários recebem 502 em rajadas de dois minutos, várias vezes por hora. O time de aplicação garante que 'não mudou nada'. Você tem acesso ao proxy e ao host da API.

    Sintomas

    • • Nginx retorna 502 intermitente; entre as rajadas, tudo normal
    • • error.log traz 'connect() failed (111: Connection refused) while connecting to upstream'
    • • Uso de memória do host cresce até o momento das rajadas
  • Conflito de Merge

    +750 XP Nível 10

    Uma correção urgente precisa entrar na main, mas sua branch está três dias atrás e conflita em dois arquivos, incluindo um de configuração de timeout que outra pessoa também alterou.

    Sintomas

    • • git rebase interrompe com CONFLICT em dois arquivos
    • • A branch tem commits já enviados e revisados no PR
    • • Um dos conflitos é semântico: os dois valores são plausíveis
  • Container CrashLoop

    +750 XP Nível 15

    Após adicionar o banco ao Compose, a API entra em laço de reinício. O frontend responde, mas nenhuma rota que usa dados funciona.

    Sintomas

    • • docker compose ps mostra api reiniciando continuamente
    • • Logs terminam sempre com ECONNREFUSED 127.0.0.1:5432
    • • O banco está healthy
  • Pipeline Quebrado

    +750 XP Nível 19

    O CI está verde nos PRs e vermelho na main desde ontem à noite. Ninguém alterou o workflow, e o time está bloqueado para publicar a versão.

    Sintomas

    • • Job de integração falha apenas na main, na etapa de migração
    • • Log mostra 'password authentication failed for user'
    • • Localmente tudo passa
  • Security Group Exposto

    +750 XP Nível 24

    Uma varredura de segurança encontrou a porta 5432 do banco acessível de 0.0.0.0/0 e SSH aberto ao mundo. Você tem uma hora para corrigir sem derrubar a aplicação.

    Sintomas

    • • Regra 0.0.0.0/0 na porta 5432 do SG do banco
    • • Regra 0.0.0.0/0 na porta 22 do SG da aplicação
    • • CloudTrail registra tentativas de autenticação de IPs desconhecidos
  • Drift Terraform

    +750 XP Nível 29

    O plan de rotina quer destruir uma regra de firewall e alterar tags que ninguém mudou no código. Houve uma correção emergencial no console na madrugada anterior.

    Sintomas

    • • terraform plan retorna exit code 2 com mudanças inesperadas
    • • Uma regra criada manualmente resolveu um incidente e não está no código
    • • Tags de um recurso divergem do padrão do projeto
  • CrashLoopBackOff

    +750 XP Nível 34

    Após um upgrade, dois pods da API ficam em CrashLoopBackOff com 14 restarts. A versão anterior funcionava e o cluster está com recursos disponíveis.

    Sintomas

    • • kubectl get pods mostra CrashLoopBackOff e contagem crescente de restarts
    • • describe indica Last State: Terminated, Reason: OOMKilled em um pod e falha de liveness no outro
    • • Logs do container terminam durante a inicialização
  • Deployment Fora de Sincronia

    +750 XP Nível 38

    A Application de produção está OutOfSync há horas e o self-heal fica desfazendo o número de réplicas ajustado pelo autoscaling, oscilando a capacidade em horário de pico.

    Sintomas

    • • ArgoCD reporta OutOfSync no campo spec.replicas
    • • Réplicas oscilam entre o valor do Git e o valor do HPA
    • • Latência sobe durante as oscilações
  • Queda em Produção

    +750 XP Nível 43

    14:03. Alerta crítico: 78% das requisições falhando após o deploy da v1.4.0. Você é o comandante do incidente. Cada minuto consome error budget de um SLO de 99,9%.

    Sintomas

    • • Taxa de 5xx acima de 70%, p95 acima de 8 segundos
    • • Traces mostram espera longa antes da consulta ao banco
    • • Logs do banco indicam limite de conexões atingido