User Tools

Site Tools


prometheus_grafana_loki_-_observability

Prometheus, Grafana, Loki - Observability

Реклама

  • Мониторинг не нужен, если он формален и не нацелен на бизнес-результат
  • Observability — переход от простого сбора метрик к пониманию влияния ИТ-решений на бизнес-показатели, прогнозированию сбоев и автоматизации реагирования
  • Бизнес-метрики - мониторинг не сервисов, а действий пользователя (например, количество успешных подключений)
  • Умные оповещения - должны приходить только при реальной угрозе для сервиса а не по каждому незначительному отклонению
  • Автоматизация - запуск процедур восстановления параллельно с уведомлениями инженеров

Техническое задание

  • Настроить учет работы систем, сервисов и сетей предприятия с точки зрения: метрик (Service Level Indicator - SLI), целей команды предприятия (Service Level Objective - SLO) и гарантий для клиентов (Service Level Agreement - SLA)

Модуль 1. Основы наблюдаемости и архитектура стека

Теория

  • SLA (Service Level Agreement) и SLO (Service Level Objective)
  • Метрики, Логи, Трейсы, Чем отличается мониторинг от наблюдаемости
  • Роль каждого компонента (Prometheus, Grafana, Loki) в экосистеме

Модуль 2. Сбор и анализ метрик с Prometheus

Модуль 3. Централизация логов с Loki

  • Установка Loki
  • Установка и настройка Promtail для доставки логов приложений и системных журналов
  • Язык LogQL, фильтрация и анализ логов (поиск ошибок, парсинг JSON, агрегация статистики по логам)

Модуль 4. Визуализация данных и дашборды в Grafana

  • Установка Сервис Grafana
  • Создание Grafana dashboard, типы панелей (Time series, Table, Stat, Logs), настройка внешнего вида и переменных, интерактивные дашборды
  • Пример дашборда “Мониторинг сервиса” с метриками приложения, статусами сервисов от которыых оно зависит и виджетами последних ошибок из логов

Модуль 5. Алертинг и обнаружение проблем

Идеи для курса

  • Процент и время задержки писем через greylist

Черновик

prometheus_grafana_loki_-_observability.txt · Last modified: 2026/05/14 13:07 by val · Currently locked by: val