Observability
Логи, метрики, трейсы: понимаем что происходит в продакшене
Уровень: Продвинутый · около 4 ч · после курса: Настроишь логи, метрики и трейсы, сформулируешь SLO и заведёшь алерты, которые будят по делу
Чему научишься
- Структурное логирование через slog
- Метрики через Prometheus
- Distributed tracing через OpenTelemetry
- Анализ через Grafana
- Алерты на симптомы, а не причины
- Понимать SLI / SLO
Уроки курса (5)
Модуль 1 · Логи и метрики
Структурное логирование (slog) и Prometheus
- Структурированное логирование с slog - slog из stdlib, уровни логов, JSON вывод, correlation ID, агрегация в Loki/ELK
- Метрики с Prometheus - Counter, gauge, histogram, summary, naming, PromQL, RED/USE, Grafana
Модуль 2 · Трассировка и алерты
OpenTelemetry, SLO и бюджет ошибок, алерты и дежурство
- Distributed Tracing с OpenTelemetry - Spans, traces, context propagation, Jaeger, sampling strategies
- SLO и бюджет ошибок: как измерить надёжность - SLI, SLO и SLA, error budget как валюта, burn rate и алерты по нескольким окнам
- Алерты, дежурство и разбор инцидентов - Правила Prometheus, Alertmanager, подавление лишнего, дашборды, runbooks, on-call и blameless post-mortem