Data Warehouse
Централизованное, реляционное, оптимизированное для аналитики. Schema-on-write обеспечивает качество данных при загрузке. Основа enterprise BI на протяжении десятилетий.
Специализированные знания, оформленные как инструкции контекста — загружаются в AI-агентов для решения реальных задач data engineering.
skill:
Забудьте о статичных вики. Agent Skills — структурированные блоки знаний, которые напрямую инжектируются в контекст LLM, давая ему экспертный уровень для любой задачи data engineering.
DE Agent Skills охватывает все основные подходы к архитектуре данных — от классического DWH до современного Lakehouse — со специализированными skills для каждого.
Централизованное, реляционное, оптимизированное для аналитики. Schema-on-write обеспечивает качество данных при загрузке. Основа enterprise BI на протяжении десятилетий.
Сырые данные в нативных форматах на дешёвом object storage. Schema-on-read даёт гибкость. Идеально для ML, ad-hoc аналитики и разнородных типов данных.
Сочетает гибкость Data Lake с надёжностью Data Warehouse. Открытые table formats привносят ACID-транзакции, time travel и schema evolution в object storage.
Ищите и фильтруйте полную коллекцию. Каждый skill — самодостаточный модуль знаний, готовый к инжекции в любой LLM-агент.
Тематические группы из десятков специализированных skills — для глубокой работы с одной технологией.
Каждый слой data-платформы — от сырой загрузки до аналитической выдачи — с production-quality инструментами.
Три battle-tested reference architectures из библиотеки skills. Берите, адаптируйте, разворачивайте.
Полностью open-source стек на MinIO. Batch-загрузка через Spark, формат Iceberg, Trino для интерактивных запросов, ClickHouse для real-time выдачи. Без привязки к облачному провайдеру.
Единый streaming-слой на Kafka и Flink. Batch смоделирован как воспроизведение потока. Iceberg нативно обрабатывает upserts, ClickHouse отдаёт OLAP-запросы за миллисекунды.
Классический ELT-паттерн с современными инструментами. Сырые данные приземляются в Bronze, dbt-модели трансформируют через Silver в Gold. Trino даёт SQL-доступ ко всем слоям.
Enterprise-grade спецификации, загружаемые напрямую в контекст агента. Протестированные в production, версионные справочники для каждого инструмента.
Практические руководства, написанные для людей, а не агентов. Изучайте стек с нуля через практические 101-туториалы.
Modern Data Stack перегружен рутиной. Следующий шаг — платформа, где автономные AI-агенты самостоятельно проектируют, разворачивают и оптимизируют корпоративные DWH и Data Lakehouse.
Традиционный Data SDLC устарел. Каждый этап — от сбора требований до оптимизации затрат — теперь управляется проактивными AI-агентами, которые понимают контекст, адаптивно обучаются на результатах и самостоятельно устраняют инциденты. Дата-инженер смещается от рутинного ETL-кода к стратегическому управлению бизнес-логикой.
Агент проактивно сканирует Jira, Confluence и Slack-треды, понимает бизнес-контекст и сопоставляет требования с Data Catalog и Lineage-графом. Учитывает governance-политики и накопленные паттерны предыдущих проектов.
Оркестратор на LangGraph/CrewAI запускает параллельные агенты: Архитектор декомпозирует пайплайн на dbt-модели и Spark-трансформации, Кодер генерирует идемпотентный код с контекстом DE Agent Skills. Адаптивное обучение на ревью ускоряет качество итераций.
Сканирует входящий поток на Data Drift и Schema Evolution. Генерирует контракты для Great Expectations и dbt-tests. Self-healing агент автоматически адаптирует downstream-трансформации при обнаружении аномалий — без ручного вмешательства.
Интегрируется в Airflow/Prefect. При OOM на Spark, Schema Mismatch или конфигурационных ошибках агент перехватывает лог, переписывает код, обновляет конфиги кластера и перезапускает задачу. Адаптивное обучение снижает повторяемость инцидентов.
Мониторит Cost Per Inference (inference costs ÷ requests) и token consumption по тегам Project/Team/Workload. Аномальные всплески токенов блокируются через quota & throttling. Агент оптимизирует модели через pruning, quantization и distillation — снижая GPU-затраты без потери качества.
Мы входим в эпоху автономных data-систем — пайплайны сами пишутся, тестируются, чинятся и оптимизируют свою стоимость. DE-инженер становится архитектором систем.
Open source. Бесплатно навсегда. Поставьте звезду на GitHub и начните строить умные data pipeline уже сегодня.