23
AI-Assisted PySpark Development
Эффективная разработка PySpark с LLM-ассистентами: schema-first prompting, Dev Guides, AI-readable репозиторий и безопасные зоны применения AI.
platform
core
aiagent
Контрольные задания
✓
Написать cursorrules / CLAUDE.md для PySpark-проекта с правилами Spark
✓
Получить корректный PySpark join через schema-first prompt (схема + 3 строки данных)
✓
Сгенерировать pytest + chispa тесты для трансформации через AI
✓
Провести AI code review job'а на наличие shuffle/cartesian/hardcoded paths
Уроки модуля
1
Schema-first prompting: printSchema(), DDL и sample data как обязательный контекст для LLM - почему AI 'галлюцинирует' без схемы
2
Dev Guides и System Prompt: cursorrules / CLAUDE.md со Spark-специфичными правилами (no collect(), prefer broadcast, no Python UDF без аппрувала)
3
AI-readable репозиторий: README hierarchy, ADRs (Architecture Decision Records), каталог /examples с join_patterns / cdc_patterns / scd2_patterns
4
Итеративный промптинг для Spark задач: разбивка ETL на шаги - чтение+фильтрация → трансформация → оптимизация (bucketing/partitioning) → запись
5
AI-assisted testing: генерация pytest + chispa тестов, автоматическое написание Great Expectations rules по схеме таблицы
6
AI для рефакторинга: legacy notebooks → production modules, SQL optimization, deduplication, SQL-first mindset почему декларативный код лучше для агентов
7
Опасные зоны LLM в Spark: что AI делает плохо - skew, cluster economics, data semantics, hidden assumptions, необходимость human review