08

Monitoring

Spark UI, History Server, Prometheus + Grafana, SparkMeasure.

platform optimization monitoring
Monitoring

Контрольные задания

Найти долгую task в Spark UI
Объяснить высокий GC time
Собрать baseline Grafana dashboard

Уроки модуля

1 Spark UI: вкладка Jobs — DAG визуализация и поиск узкого места 2 Spark UI: вкладка Stages — Task Skew, Shuffle Write/Read и GC Time 3 Spark UI: вкладка SQL — чтение Physical Plan и метрики операторов 4 Spark UI: вкладка Executors — Memory Breakdown и Task сводка 5 History Server: настройка event log на S3/HDFS и retention политика 6 Spark Metrics System: Sources, Sinks и namespace таксономия 7 JMX + Prometheus: pull-based сбор метрик через jmx_exporter 8 Grafana Dashboard: ключевые метрики Spark для production-алертинга 9 SparkMeasure: programmatic сбор Stage и Task метрик в коде 10 Алерты: SLO для job duration, failure rate и executor OOM 11 Профилирование PySpark: Java Stack Traces, PySpark Profiler и WholeStageCodegen
Начать модуль