23

AI-Assisted PySpark Development

Эффективная разработка PySpark с LLM-ассистентами: schema-first prompting, Dev Guides, AI-readable репозиторий и безопасные зоны применения AI.

platform core aiagent

Контрольные задания

Написать cursorrules / CLAUDE.md для PySpark-проекта с правилами Spark
Получить корректный PySpark join через schema-first prompt (схема + 3 строки данных)
Сгенерировать pytest + chispa тесты для трансформации через AI
Провести AI code review job'а на наличие shuffle/cartesian/hardcoded paths

Уроки модуля

1 Schema-first prompting: printSchema(), DDL и sample data как обязательный контекст для LLM - почему AI 'галлюцинирует' без схемы 2 Dev Guides и System Prompt: cursorrules / CLAUDE.md со Spark-специфичными правилами (no collect(), prefer broadcast, no Python UDF без аппрувала) 3 AI-readable репозиторий: README hierarchy, ADRs (Architecture Decision Records), каталог /examples с join_patterns / cdc_patterns / scd2_patterns 4 Итеративный промптинг для Spark задач: разбивка ETL на шаги - чтение+фильтрация → трансформация → оптимизация (bucketing/partitioning) → запись 5 AI-assisted testing: генерация pytest + chispa тестов, автоматическое написание Great Expectations rules по схеме таблицы 6 AI для рефакторинга: legacy notebooks → production modules, SQL optimization, deduplication, SQL-first mindset почему декларативный код лучше для агентов 7 Опасные зоны LLM в Spark: что AI делает плохо - skew, cluster economics, data semantics, hidden assumptions, необходимость human review
Начать модуль