Шаблоны стандартных дашбордов¶
Готовые дашборды для типичных ситуаций, которые можно взять за основу и приспособить под себя.
Мониторинг CPU (процессор)¶
Что показываем: загрузка CPU по узлам, распределение по режимам (user, system, iowait, softirq, idle).
Панели:
-
Stat gauge — текущая загрузка по каждому узлу. Пороги: жёлтый при 70%, красный при 90%.
-
Time series — история загрузки с разбивкой по режимам для выбранного узла.
# Загрузка CPU в процентах
100 - rate(node_cpu_seconds_total{mode="idle"}[$__interval])
* 100 / count by(instance) (node_cpu_seconds_total{mode="idle"})
Мониторинг памяти¶
Что показываем: использование памяти по узлам, доступная память.
# Процент использования памяти
100 - (node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes) * 100
Панель "Available Memory за 24 часа" — линия с единицами bytes (SI), помогает обнаружить утечку памяти.
Ошибки HTTP-запросов¶
sum(rate(http_requests_total{status=~"5..|4.."}[5m])) by (status)
Визуализация: стековый график (stacked), слой 4xx и 5xx разными цветами.
Использование диска по узлам¶
Метрика: node_filesystem_avail_bytes / node_filesystem_size_bytes для дисков.
Панель: Gauge с порогами.
Медленные запросы в базе¶
Источник данных: PostgreSQL + Table-панель.
SELECT query, calls, mean_time
FROM pg_stat_statements
ORDER BY calls DESC
LIMIT 10
Автообновление: каждые 5 минут.
Аннотации деплоев из Prometheus¶
Запрос аннотации: kube_deployment_status_observed_generation{namespace="production"}
Каждый деплоймент отображается маркером на всех графиках.
Конец приложений. Спасибо за чтение.