Data engineer
гибрид, Москва
Команда развивает платформу для формирования профилей и рекомендаций по развитию IT‑специалистов. Вы будете проектировать и поддерживать ETL/ELT‑пайплайны, DWH и Data Lake, обеспечивая точные и доступные данные для аналитиков и продуктовых решений
ГрейдMiddle
Стек
PythonPySpark / Spark SQLHadoop/HDFSKafkaApache AirflowDagsterPrefectSpark Structured StreamingApache FlinkDockerKubernetesCI/CDGitdbtJSON Schema
Задачи
- •Проектировать и разрабатывать ETL/ELT‑пайплайны
- •Строить и поддерживать DWH и Data Lake
- •Обеспечивать качество, идемпотентность и доступность данных
- •Оптимизировать производительность обработки и партиционирование данных
- •Взаимодействовать с дата‑аналитиками и дата‑сайентистами
Обязательно
- •Высшее образование
- •Опыт работы в роли data engineer
- •Уверенное знание Python
- •Продвинутый SQL (оконные функции, CTE, оптимизация планов)
- •Опыт с Apache Airflow / Dagster / Prefect и DAG‑подходом
- •Опыт с PySpark / Spark SQL и распределёнными вычислениями
- •Опыт с Kafka / Kafka Streams / Flink и потоковой обработкой
Будет плюсом
- •Опыт применения LLM для генерации/рефакторинга ETL и автогенерации тестов
- •Опыт описания схем и контрактов (dbt‑контракты, JSON Schema, Data Contracts)
- •Опыт деплоя пайплайнов с Docker и Kubernetes