Data Platform Engineer
Команда Data Platform развивает платформу для построения, запуска и поддержки batch- и streaming-конвейеров данных. Роль фокусируется на проектировании и оптимизации конвейеров, обеспечении качества и репродуцируемости данных для команд аналитики и ML
ГрейдSenior
Стек
PythonSparkAirflowKafkaKubeflow PipelinesGitCI/CD
Задачи
- •Разработка и поддержка конвейеров обработки данных (batch и streaming)
- •Проектирование схем данных и архитектуры пайплайнов
- •Оптимизация Spark-задач по производительности и ресурсам
- •Реализация механизмов retry, backfill, идемпотентности и управления состоянием
- •Обеспечение качества данных, версионирования и отслеживания происхождения
Обязательно
- •Уверенное знание Python и/или JVM-языка
- •Опыт разработки и поддержки конвейеров обработки данных
- •Глубокое понимание Spark или другой распределённой системы обработки данных
- •Опыт с Airflow, Kubeflow Pipelines или аналогами
- •Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности
- •Опыт работы в batch- и streaming-обработке (event time, окна, watermark, late data)
- •Опыт работы с Git, code review, тестированием, CI/CD и observability
Будет плюсом
- •Опыт работы с хранилищами признаков и ML-платформами
- •Опыт разработки потоковых систем и работы с Kafka
- •Опыт версионирования, lineage и проверки качества данных
- •Опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений
- •Опыт создания переиспользуемых решений для команд данных и ML