Observability

Логи, метрики, трейсы: понимаем что происходит в продакшене

Уровень: Продвинутый · около 4 ч · после курса: Настроишь логи, метрики и трейсы, сформулируешь SLO и заведёшь алерты, которые будят по делу

Чему научишься

  • Структурное логирование через slog
  • Метрики через Prometheus
  • Distributed tracing через OpenTelemetry
  • Анализ через Grafana
  • Алерты на симптомы, а не причины
  • Понимать SLI / SLO

Уроки курса (5)

Модуль 1 · Логи и метрики

Структурное логирование (slog) и Prometheus

  1. Структурированное логирование с slog - slog из stdlib, уровни логов, JSON вывод, correlation ID, агрегация в Loki/ELK
  2. Метрики с Prometheus - Counter, gauge, histogram, summary, naming, PromQL, RED/USE, Grafana

Модуль 2 · Трассировка и алерты

OpenTelemetry, SLO и бюджет ошибок, алерты и дежурство

  1. Distributed Tracing с OpenTelemetry - Spans, traces, context propagation, Jaeger, sampling strategies
  2. SLO и бюджет ошибок: как измерить надёжность - SLI, SLO и SLA, error budget как валюта, burn rate и алерты по нескольким окнам
  3. Алерты, дежурство и разбор инцидентов - Правила Prometheus, Alertmanager, подавление лишнего, дашборды, runbooks, on-call и blameless post-mortem