Инженер данных
Команда развития инструментов платформы строит Data Lake и сервисы интеграции, чтобы другие продукты могли самостоятельно загружать и обрабатывать данные. Роль важна для надёжности, качества и масштабируемости единого хранилища данных Магнита
ГрейдJunior/Middle
Опыт2–3 года
Стек
PythonApache SparkApache IcebergKafkaApache AirflowTrinoImpalaKafka ConnectDebeziumSQL
Задачи
- •Разрабатывать batch- и CDC-инжесты в Data Lake
- •Проектировать платформенные компоненты и API для подключения источников
- •Настраивать загрузки, управлять жизненным циклом данных
- •Реализовывать механизмы контроля качества, обработки ошибок и восстановления загрузок
- •Анализировать и оптимизировать производительность и потребление ресурсов
- •Участвовать в сопровождении потоков при сложных инцидентах
Обязательно
- •Коммерческая разработка на Python 2–3 года
- •Умение писать поддерживаемый и тестируемый код
- •Уверенное знание SQL и принципов моделирования/хранения данных
- •Опыт работы с Apache Airflow
- •Опыт работы с Apache Spark
- •Понимание архитектуры и эксплуатации распределённых систем
Будет плюсом
- •Опыт работы с Apache Iceberg
- •Опыт с Trino и Impala
- •Знание Kafka, Kafka Connect и Debezium