Módulo 10
Observabilidade e SRE
Observabilidade não é instalar Grafana: é conseguir responder perguntas novas sobre o sistema sem novo deploy. Você vai instrumentar o CloudShop com métricas Prometheus, centralizar logs com Loki, distribuir traces com OpenTelemetry, construir dashboards que respondem 'está tudo bem?' em cinco segundos, definir SLI/SLO com error budget e conduzir um incidente até o postmortem sem culpa.
0/9 itens concluídos
O que você vai saber fazer
- Diferenciar logs, métricas e traces e saber quando usar cada um
- Escrever consultas PromQL úteis e regras de alerta acionáveis
- Montar dashboards guiados por RED e USE
- Definir SLI, SLO e error budget para o CloudShop
- Conduzir incidente e escrever postmortem sem culpa
Pré-requisitos
- • Módulo 8 concluído
Tópicos
Entrega do módulo
Dashboard, alertas por sintoma, SLO documentado, runbook de incidente e postmortem de um evento real.
Checklist
- ☐ Métricas de latência, taxa de erro e throughput expostas pela API
- ☐ Dashboard responde 'está tudo bem?' sem interpretação
- ☐ Alertas baseados em sintoma do usuário, não em CPU
- ☐ SLO com error budget calculado e documentado
- ☐ Postmortem publicado com ações e responsáveis
Módulo bloqueado
Aprove o exame do módulo anterior para liberar este conteúdo.
Aulas
5 aulas neste módulo
- 1Os três pilares e o que instrumentar primeiro40 min · Prometheus, Loki, OpenTelemetryIntermediário+25 XP
- 2Prometheus e PromQL: consultas e alertas que valem plantão50 min · Prometheus, PromQL, AlertmanagerAvançado+25 XP
- 3Grafana e Loki: dashboards e logs centralizados45 min · Grafana, Loki, LogQLIntermediário+25 XP
- 4OpenTelemetry: traces distribuídos45 min · OpenTelemetry, Collector, Tempo/JaegerAvançado+25 XP
- 5SLI, SLO, error budget e postmortem sem culpa50 min · SRE, Grafana, RunbooksAvançado+25 XP
Prática
Laboratórios do módulo
Stack de observabilidade e dashboard do CloudShop
AvançadoSubir Prometheus, Grafana e Loki e construir o dashboard que responde 'está tudo bem?'.
Ver passo a passoAlertas acionáveis com runbook vinculado
AvançadoCriar alertas por sintoma do usuário e testar o disparo de verdade.
Ver passo a passoTraces distribuídos com OpenTelemetry
AvançadoRastrear uma requisição do frontend até o banco e achar o gargalo.
Ver passo a passoSLO, error budget e postmortem
AvançadoDefinir o SLO do CloudShop, medir o budget e escrever um postmortem real.
Ver passo a passo
Troubleshooting típico
Quando quebra
Sintoma: usuários relatam lentidão, CPU normal. Investigação: métrica de latência p95 subiu, traces mostram 80% do tempo em uma consulta ao banco, logs do banco indicam lock. Causa raiz: migração criando índice em tabela grande durante horário de pico. Correção: abortar a migração, reagendar com criação concorrente e alertar por p95, não por CPU.
No CloudShop
Instrumentar o CloudShop com métricas, logs, traces, SLO e alertas úteis.
Perguntas de entrevista
- Diferença entre SLI, SLO e SLA?
- O que é error budget e como ele muda decisões de produto?
- Como você evitaria fadiga de alertas em um time de plantão?