0 XP

Módulo 10

Observabilidade e SRE

Observabilidade não é instalar Grafana: é conseguir responder perguntas novas sobre o sistema sem novo deploy. Você vai instrumentar o CloudShop com métricas Prometheus, centralizar logs com Loki, distribuir traces com OpenTelemetry, construir dashboards que respondem 'está tudo bem?' em cinco segundos, definir SLI/SLO com error budget e conduzir um incidente até o postmortem sem culpa.

3 semanas2500 XPBadge: SRE Guardian

0/9 itens concluídos

O que você vai saber fazer

  • Diferenciar logs, métricas e traces e saber quando usar cada um
  • Escrever consultas PromQL úteis e regras de alerta acionáveis
  • Montar dashboards guiados por RED e USE
  • Definir SLI, SLO e error budget para o CloudShop
  • Conduzir incidente e escrever postmortem sem culpa

Pré-requisitos

  • • Módulo 8 concluído

Tópicos

LogsMétricasTracesPrometheusGrafanaLokiOpenTelemetryAlertmanagerREDUSESLI/SLOIncidentes

Entrega do módulo

Dashboard, alertas por sintoma, SLO documentado, runbook de incidente e postmortem de um evento real.

Checklist

  • ☐ Métricas de latência, taxa de erro e throughput expostas pela API
  • ☐ Dashboard responde 'está tudo bem?' sem interpretação
  • ☐ Alertas baseados em sintoma do usuário, não em CPU
  • ☐ SLO com error budget calculado e documentado
  • ☐ Postmortem publicado com ações e responsáveis

Módulo bloqueado

Aprove o exame do módulo anterior para liberar este conteúdo.

Prática

Laboratórios do módulo

  • Stack de observabilidade e dashboard do CloudShop

    Avançado

    Subir Prometheus, Grafana e Loki e construir o dashboard que responde 'está tudo bem?'.

    Ver passo a passo
  • Alertas acionáveis com runbook vinculado

    Avançado

    Criar alertas por sintoma do usuário e testar o disparo de verdade.

    Ver passo a passo
  • Traces distribuídos com OpenTelemetry

    Avançado

    Rastrear uma requisição do frontend até o banco e achar o gargalo.

    Ver passo a passo
  • SLO, error budget e postmortem

    Avançado

    Definir o SLO do CloudShop, medir o budget e escrever um postmortem real.

    Ver passo a passo

Troubleshooting típico

Quando quebra

Sintoma: usuários relatam lentidão, CPU normal. Investigação: métrica de latência p95 subiu, traces mostram 80% do tempo em uma consulta ao banco, logs do banco indicam lock. Causa raiz: migração criando índice em tabela grande durante horário de pico. Correção: abortar a migração, reagendar com criação concorrente e alertar por p95, não por CPU.

No CloudShop

Instrumentar o CloudShop com métricas, logs, traces, SLO e alertas úteis.

Perguntas de entrevista

  • Diferença entre SLI, SLO e SLA?
  • O que é error budget e como ele muda decisões de produto?
  • Como você evitaria fadiga de alertas em um time de plantão?
Boss do módulo: Queda em Produção