Boss Battles
Incidentes que você vai encontrar de verdade
Leia os sintomas, monte a hipótese e só depois abra a investigação. Isso treina exatamente o que uma entrevista técnica testa.
Processo Zumbi
+750 XP Nível 3Depois de um deploy manual, o serviço da API não sobe: a porta 3000 está ocupada, o systemd reporta falha e há processos órfãos na árvore. O time pede a API de volta em dez minutos.
Sintomas
- • systemctl start falha com 'Address already in use'
- • ps mostra processos node em estado Z (zumbi) e um pai antigo ainda vivo
- • journalctl registra reinícios sucessivos
Dragão 502
+750 XP Nível 8Usuários recebem 502 em rajadas de dois minutos, várias vezes por hora. O time de aplicação garante que 'não mudou nada'. Você tem acesso ao proxy e ao host da API.
Sintomas
- • Nginx retorna 502 intermitente; entre as rajadas, tudo normal
- • error.log traz 'connect() failed (111: Connection refused) while connecting to upstream'
- • Uso de memória do host cresce até o momento das rajadas
Conflito de Merge
+750 XP Nível 10Uma correção urgente precisa entrar na main, mas sua branch está três dias atrás e conflita em dois arquivos, incluindo um de configuração de timeout que outra pessoa também alterou.
Sintomas
- • git rebase interrompe com CONFLICT em dois arquivos
- • A branch tem commits já enviados e revisados no PR
- • Um dos conflitos é semântico: os dois valores são plausíveis
Container CrashLoop
+750 XP Nível 15Após adicionar o banco ao Compose, a API entra em laço de reinício. O frontend responde, mas nenhuma rota que usa dados funciona.
Sintomas
- • docker compose ps mostra api reiniciando continuamente
- • Logs terminam sempre com ECONNREFUSED 127.0.0.1:5432
- • O banco está healthy
Pipeline Quebrado
+750 XP Nível 19O CI está verde nos PRs e vermelho na main desde ontem à noite. Ninguém alterou o workflow, e o time está bloqueado para publicar a versão.
Sintomas
- • Job de integração falha apenas na main, na etapa de migração
- • Log mostra 'password authentication failed for user'
- • Localmente tudo passa
Security Group Exposto
+750 XP Nível 24Uma varredura de segurança encontrou a porta 5432 do banco acessível de 0.0.0.0/0 e SSH aberto ao mundo. Você tem uma hora para corrigir sem derrubar a aplicação.
Sintomas
- • Regra 0.0.0.0/0 na porta 5432 do SG do banco
- • Regra 0.0.0.0/0 na porta 22 do SG da aplicação
- • CloudTrail registra tentativas de autenticação de IPs desconhecidos
Drift Terraform
+750 XP Nível 29O plan de rotina quer destruir uma regra de firewall e alterar tags que ninguém mudou no código. Houve uma correção emergencial no console na madrugada anterior.
Sintomas
- • terraform plan retorna exit code 2 com mudanças inesperadas
- • Uma regra criada manualmente resolveu um incidente e não está no código
- • Tags de um recurso divergem do padrão do projeto
CrashLoopBackOff
+750 XP Nível 34Após um upgrade, dois pods da API ficam em CrashLoopBackOff com 14 restarts. A versão anterior funcionava e o cluster está com recursos disponíveis.
Sintomas
- • kubectl get pods mostra CrashLoopBackOff e contagem crescente de restarts
- • describe indica Last State: Terminated, Reason: OOMKilled em um pod e falha de liveness no outro
- • Logs do container terminam durante a inicialização
Deployment Fora de Sincronia
+750 XP Nível 38A Application de produção está OutOfSync há horas e o self-heal fica desfazendo o número de réplicas ajustado pelo autoscaling, oscilando a capacidade em horário de pico.
Sintomas
- • ArgoCD reporta OutOfSync no campo spec.replicas
- • Réplicas oscilam entre o valor do Git e o valor do HPA
- • Latência sobe durante as oscilações
Queda em Produção
+750 XP Nível 4314:03. Alerta crítico: 78% das requisições falhando após o deploy da v1.4.0. Você é o comandante do incidente. Cada minuto consome error budget de um SLO de 99,9%.
Sintomas
- • Taxa de 5xx acima de 70%, p95 acima de 8 segundos
- • Traces mostram espera longa antes da consulta ao banco
- • Logs do banco indicam limite de conexões atingido