Agent Skills — новый способ
передачи экспертизы

Забудьте о статичных вики. Agent Skills — структурированные блоки знаний, которые напрямую инжектируются в контекст LLM, давая ему экспертный уровень для любой задачи data engineering.

Что такое Agent Skill?
Предметно-ориентированный файл инструкций, загружаемый в контекст AI-агента. Кодирует лучшие практики, паттерны инструментов и правила принятия решений — превращает универсальный LLM в специалиста по data engineering.
# Загрузка PySpark ETL skill в контекст агента from agent_sdk import Agent
agent = Agent(
  "pyspark_etl": load_skill("skills/pyspark_etl"),
  "trino_iceberg": load_skill("skills/trino_iceberg"),
)
# Агент теперь знает DataFrame API, joins, Iceberg DDL... result = agent.run("Оптимизируй Spark join для скошенных ключей")
🧠
Зачем нужны Agent Skills?
  • Стабильное и воспроизводимое поведение AI на data-задачах
  • Кодирует накопленный production-опыт
  • Компонуемые — смешивайте skills под задачу
  • Open source — расширяется сообществом
  • Работает с любым LLM-провайдером
🔄
Как это работает
Skills загружаются в момент постановки задачи. Агент выбирает нужные skills, инжектирует их в контекст и выполняет pipeline с экспертными знаниями.
Задача
Выбор Skills
Инжекция контекста
Выполнение
📦
Что охвачено
  • Batch- и streaming-обработка данных
  • Форматы таблиц Lakehouse и хранилища
  • Оркестровка и планирование pipeline
  • Паттерны моделирования Enterprise DWH
  • Оптимизация запросов и производительность
  • dbt-трансформации и тестирование
🗺️
Охваченные архитектурные парадигмы
Data Warehouse
Schema-on-write, реляционное, оптимизировано для аналитических запросов. ClickHouse, Redshift, Vertica, Snowflake.
Data Lake
Schema-on-read, сырые форматы в object storage. HDFS, MinIO, S3. Гибко, но требует управления.
Data Lakehouse
Лучшее от обоих подходов. Apache Iceberg, Delta Lake, Hudi в object storage с ACID-транзакциями.

Три парадигмы.
Одна база знаний.

DE Agent Skills охватывает все основные подходы к архитектуре данных — от классического DWH до современного Lakehouse — со специализированными skills для каждого.

01
🏛️

Data Warehouse

Централизованное, реляционное, оптимизированное для аналитики. Schema-on-write обеспечивает качество данных при загрузке. Основа enterprise BI на протяжении десятилетий.

ClickHouse Vertica Redshift Snowflake Kimball Data Vault 2.0
02
🏞️

Data Lake

Сырые данные в нативных форматах на дешёвом object storage. Schema-on-read даёт гибкость. Идеально для ML, ad-hoc аналитики и разнородных типов данных.

MinIO HDFS Parquet Hive Apache Spark Medallion
03
💎

Data Lakehouse

Сочетает гибкость Data Lake с надёжностью Data Warehouse. Открытые table formats привносят ACID-транзакции, time travel и schema evolution в object storage.

Apache Iceberg Delta Lake Hudi Trino dbt Nessie

47 специализированных agent skills
для любой data-задачи

Ищите и фильтруйте полную коллекцию. Каждый skill — самодостаточный модуль знаний, готовый к инжекции в любой LLM-агент.

Показаны все 47 skills
Коллекции Group Skills

Тематические группы из десятков специализированных skills — для глубокой работы с одной технологией.

✦ NEW

Полный современный
data stack под рукой

Каждый слой data-платформы — от сырой загрузки до аналитической выдачи — с production-quality инструментами.

Проверенные в production
паттерны data-платформ

Три battle-tested reference architectures из библиотеки skills. Берите, адаптируйте, разворачивайте.

// REF-01

Self-hosted Open Source Lakehouse

Полностью open-source стек на MinIO. Batch-загрузка через Spark, формат Iceberg, Trino для интерактивных запросов, ClickHouse для real-time выдачи. Без привязки к облачному провайдеру.

Kafka
Spark
MinIO/Iceberg
Trino
ClickHouse
// REF-02

Streaming Lakehouse (Kappa)

Единый streaming-слой на Kafka и Flink. Batch смоделирован как воспроизведение потока. Iceberg нативно обрабатывает upserts, ClickHouse отдаёт OLAP-запросы за миллисекунды.

Kafka
Flink
Iceberg
ClickHouse
// REF-03

Batch ELT с dbt + Trino

Классический ELT-паттерн с современными инструментами. Сырые данные приземляются в Bronze, dbt-модели трансформируют через Silver в Gold. Trino даёт SQL-доступ ко всем слоям.

Источник
Bronze
dbt Silver
Gold
Trino

Технические спецификации
и документация

Enterprise-grade спецификации, загружаемые напрямую в контекст агента. Протестированные в production, версионные справочники для каждого инструмента.

Пошаговые туториалы
для инженеров

Практические руководства, написанные для людей, а не агентов. Изучайте стек с нуля через практические 101-туториалы.

Эволюция в
Agentic Data Platform

Modern Data Stack перегружен рутиной. Следующий шаг — платформа, где автономные AI-агенты самостоятельно проектируют, разворачивают и оптимизируют корпоративные DWH и Data Lakehouse.

🚀
От Modern Data Stack к Agentic Platform
Современный стек данных перегружен рутиной: написание однотипных dbt-моделей, ручная настройка Airflow пайплайнов, бесконечный дебаг Spark-сессий. Agentic Data Platform кардинально меняет подход — вместо жёстко закодированных сценариев платформа использует автономных AI-агентов, способных самостоятельно проектировать, разворачивать и оптимизировать корпоративные DWH и Data Lakehouse.
MDS рутина
Agent Skills
Agentic Platform
Автономный DWH
📈
Автоматизация рутины
80%
рутинных операций дата-инженера поддаются автоматизации при переходе к агентской архитектуре управления данными.
  • Проектирование схем и моделей данных
  • Генерация и оптимизация ETL/ELT
  • Настройка тестов качества данных
  • Адаптация архитектуры под требования
🧠
DE Agent Skills — ключевой инфраструктурный слой
В основе Agentic Data Platform — синергия LLM и специализированных баз знаний. DE Agent Skills инжектирует проверенные production-quality инструкции прямо в контекст агента, нивелируя проблему галлюцинаций ИИ.
  • Senior-уровень экспертизы по каждому инструменту
  • Iceberg, ClickHouse, Trino — без галлюцинаций
  • Версионные, production-tested спецификации
  • Совместимо с любым LLM-провайдером
🔌
MCP — протокол связи агента с данными
Model Context Protocol (MCP) — открытый стандарт, превращающий любой источник данных в нативный инструмент для AI-агента. В связке с DE Agent Skills агент получает не только экспертизу, но и прямой доступ к данным через стандартизированный интерфейс.
🗄️
Data Sources
PostgreSQL · DuckDB
ClickHouse · Trino
Iceberg · Delta Lake
MCP Server
Стандартизированный
интерфейс · Tools API
Resources · Prompts
🤖
AI Agent + Skills
Claude · GPT · Gemini
+ DE Agent Skills
контекст и экспертиза
🤖
Агент как цифровой сотрудник
AI-агент не просто генерирует SQL-код — он действует как полноценный цифровой инженер данных, комплексно решающий задачи на всём стеке.
🔍
Анализ схем данных
Schema-on-read и Schema-on-write — агент понимает оба подхода и выбирает оптимальный под задачу автоматически.
⚙️
Идемпотентные ETL/ELT
Строит отказоустойчивые, повторно запускаемые процессы обработки данных с полным контролем состояния.
Data Quality встроено
Автоматически внедряет тесты качества данных на каждом этапе pipeline — от ingestion до presentation layer.
🔄
Адаптивная архитектура
Адаптирует data-архитектуру под изменяющиеся бизнес-требования в реальном времени, без ручного рефакторинга.

Жизненный цикл разработки данных
в эпоху AI

Традиционный Data SDLC устарел. Каждый этап — от сбора требований до оптимизации затрат — теперь управляется проактивными AI-агентами, которые понимают контекст, адаптивно обучаются на результатах и самостоятельно устраняют инциденты. Дата-инженер смещается от рутинного ETL-кода к стратегическому управлению бизнес-логикой.

01
Discovery
02
Code Gen
03
Quality
04
CI/CD
05
FinOps
01
Agentic Discovery
🔍
Контекстный анализ требований

Агент проактивно сканирует Jira, Confluence и Slack-треды, понимает бизнес-контекст и сопоставляет требования с Data Catalog и Lineage-графом. Учитывает governance-политики и накопленные паттерны предыдущих проектов.

Результат агента
Концептуальная ERD-схема с рекомендациями по партиционированию Iceberg/ClickHouse. Минимальное вмешательство человека — только финальное согласование.
02
Multi-Agent Code Gen
⚙️
Декларативная генерация кода

Оркестратор на LangGraph/CrewAI запускает параллельные агенты: Архитектор декомпозирует пайплайн на dbt-модели и Spark-трансформации, Кодер генерирует идемпотентный код с контекстом DE Agent Skills. Адаптивное обучение на ревью ускоряет качество итераций.

Результат агента
Готовый к деплою код пайплайна. Accelerated delivery: цикл разработки ускоряется в 3–5× при минимальном участии человека.
03
Self-Healing Quality
Автономное тестирование данных

Сканирует входящий поток на Data Drift и Schema Evolution. Генерирует контракты для Great Expectations и dbt-tests. Self-healing агент автоматически адаптирует downstream-трансформации при обнаружении аномалий — без ручного вмешательства.

Результат агента
Схема upstream изменилась — агент скорректировал тесты, контракты и downstream-модели. Продакшен не падает.
04
Self-Healing CI/CD
🔧
Автономный деплой и самовосстановление

Интегрируется в Airflow/Prefect. При OOM на Spark, Schema Mismatch или конфигурационных ошибках агент перехватывает лог, переписывает код, обновляет конфиги кластера и перезапускает задачу. Адаптивное обучение снижает повторяемость инцидентов.

Результат агента
MTTR → 0 для типовых инцидентов. Self-healing CI/CD обеспечивает непрерывную доставку с минимальным участием человека.
05
FinOps for AI
💰
AI-Driven FinOps

Мониторит Cost Per Inference (inference costs ÷ requests) и token consumption по тегам Project/Team/Workload. Аномальные всплески токенов блокируются через quota & throttling. Агент оптимизирует модели через pruning, quantization и distillation — снижая GPU-затраты без потери качества.

Результат агента
GPU rightsizing и управление дефицитом ресурсов. FinOps Crawl-Walk-Run: от ручного учёта токенов до autonomous cost optimization.
Прорывные тезисы · Capgemini Research

Agentic AI переписывает
правила Data Engineering

Мы входим в эпоху автономных data-систем — пайплайны сами пишутся, тестируются, чинятся и оптимизируют свою стоимость. DE-инженер становится архитектором систем.

80%
сокращение ручного труда
data-инженеров при Autonomous AI
ускорение Time-to-Insight
от требования до продакшена
3
уровня зрелости:
Assisted → Augmented → Autonomous
0
ручных интервенций
в Self-Healing пайплайнах
Было · Traditional DE
Дата-инженер пишет ETL-код вручную
Баги находят после падения продакшена
Schema-изменения вызывают инциденты
Cost-оптимизация раз в квартал вручную
Data quality — отдельная команда
Требования → месяцы реализации
Стало · Agentic DE
Агент генерирует код из намерений (Intent-to-Pipeline)
Аномалии предсказываются до падения
Self-healing агент адаптирует схемы автономно
Cost Per Inference мониторится real-time
Quality встроена в каждый шаг пайплайна
Требования → готовый пайплайн за часы
🧠
Intent-to-Pipeline
Новая парадигма: DE-инженер описывает бизнес-намерение на естественном языке, агент самостоятельно строит весь пайплайн от ingestion до marts с учётом Data Catalog и governance-политик.
🔄
Continuous Data Contract
Агенты отслеживают Data Contracts в real-time. При нарушении контракта downstream-потребители получают уведомление, а агент предлагает migration-план до того, как сломается продакшен.
🏗️
Autonomous Data Mesh
Каждый Data Product получает собственного агента-владельца: он следит за SLA, обновляет документацию, тестирует совместимость с потребителями и оптимизирует стоимость хранения.
💎
Adaptive Learning Pipelines
Пайплайны обучаются на собственной истории: агент анализирует прошлые инциденты, паттерны нагрузки и результаты оптимизаций — каждый следующий деплой умнее предыдущего.
🔌
MCP как новый стандарт
Model Context Protocol становится универсальным контрактом между AI-агентами и data-системами: Spark, dbt, Airflow, Iceberg — всё доступно агентам через единый протокол вместо кастомных интеграций.
📊
FinOps for AI: новые метрики
GPU-дефицит и token-metering меняют экономику DE. Cost Per Inference, Token Efficiency Ratio и GPU Utilization становятся KPI data-команды наравне с query performance и data freshness.

Дайте вашим AI-агентам
суперспособности в data engineering

Open source. Бесплатно навсегда. Поставьте звезду на GitHub и начните строить умные data pipeline уже сегодня.