08
Monitoring
Spark UI, History Server, Prometheus + Grafana, SparkMeasure.
platform
optimization
monitoring
Контрольные задания
✓
Найти долгую task в Spark UI
✓
Объяснить высокий GC time
✓
Собрать baseline Grafana dashboard
Уроки модуля
1
Spark UI: вкладка Jobs — DAG визуализация и поиск узкого места
2
Spark UI: вкладка Stages — Task Skew, Shuffle Write/Read и GC Time
3
Spark UI: вкладка SQL — чтение Physical Plan и метрики операторов
4
Spark UI: вкладка Executors — Memory Breakdown и Task сводка
5
History Server: настройка event log на S3/HDFS и retention политика
6
Spark Metrics System: Sources, Sinks и namespace таксономия
7
JMX + Prometheus: pull-based сбор метрик через jmx_exporter
8
Grafana Dashboard: ключевые метрики Spark для production-алертинга
9
SparkMeasure: programmatic сбор Stage и Task метрик в коде
10
Алерты: SLO для job duration, failure rate и executor OOM
11
Профилирование PySpark: Java Stack Traces, PySpark Profiler и WholeStageCodegen