Data Engineer (Python + Spark)
офис, удалёнка, гибрид, Москва
Команда развивает ML-систему для обнаружения Out-of-stock и аномалий в продажах; вы будете строить end-to-end пайплайны и near‑real‑time обработку данных, чтобы обеспечивать точность моделей и поддержку оперативных решений в магазинах
Стек
PythonPySparkGreenplumAirflowSpark SQLHadoopHiveTrinoS3ClickHousePostgreSQLDockerYARNKubernetespytest
Задачи
- •Разрабатывать и оптимизировать Spark‑пайплайны для обработки больших объёмов данных (200+ млн строк в день)
- •Обеспечивать хранение и доступность данных в DWH (интеграция с Greenplum/Postgres/ClickHouse)
- •Автоматизировать интеграцию данных из продаж, ERP, внешних API, погодных и календарных источников
- •Поддерживать near‑real‑time поток данных для моделей и систему предупреждений магазинов
- •Работать в связке с Data Science‑командой для обеспечения качества данных
- •Развивать и масштабировать платформу прогнозирования спроса
Обязательно
- •Уверенные навыки PySpark и Spark SQL
- •Опыт разработки на Python 3
- •Опыт работы с DWH/хранилищами данных (Greenplum/PostgreSQL/ClickHouse)
- •Опыт оркестрации пайплайнов на Airflow
- •Опыт работы с распределёнными хранилищами/экосистемой Hadoop
- •Опыт контейнеризации/деплоя: Docker и YARN/Kubernetes
Будет плюсом
- •Опыт с Trino
- •Опыт с S3 как хранением данных
- •Навыки модульного тестирования данных (pytest)