Инженер данных
гибрид, Москва
Команда отвечает за пайплайны загрузки, трансформации и витрины HR‑данных; задача — обеспечить консистентные, масштабируемые и экономичные данные для аналитики и бизнес‑процессов компании
ГрейдMiddle/Senior
Стек
PythonGreenplumClickHouseKafkaMS SQL ServerS3REST API
Задачи
- •Разработка и поддержка ETL/ELT пайплайнов загрузки и трансформации данных
- •Интеграция источников: API, Kafka, БД и файловые хранилища
- •Построение и поддержка витрин данных, обеспечение консистентности
- •Оптимизация производительности и стоимости обработки данных
- •Обеспечение стабильности: обработка сбоев, ретраи и мониторинг
- •Выстраивание архитектурных решений для хранения и обработки данных
Обязательно
- •Уверенная разработка на Python для ETL/ELT задач
- •Продвинутый SQL: сложные join, оконные функции, оптимизация и планы выполнения
- •Практический опыт работы с Greenplum, ClickHouse и/или MS SQL Server
- •Опыт работы с Kafka (consumer/producer, семантика доставки и обработки)
- •Уверенная работа с REST API (пагинация, ретраи, обработка ошибок)
- •Опыт работы с S3‑совместимыми хранилищами: чтение/запись и партиционирование
- •Знание архитектур хранения данных: DWH, Data Lake, Lake House, Medallion и пр., а также обеспечение мониторинга и обработки сбоев
Будет плюсом
- •Опыт работы с Trino (федеративные запросы)
- •Опыт построения DWH (staging / dds / marts)
- •Понимание data lineage и практик контроля качества данных
- •Опыт orchestration (Airflow или аналоги)