Data Engineer (Стажер)
Москва
Стажёр в команду data engineering, работающую с Hadoop и Oracle: разработка отказоустойчивых ETL/ELT-пайплайнов, интеграция источников и построение витрин для бизнес-заказчиков; роль важна для качества данных и аналитики компании
ГрейдJunior
Стек
PythonSparkOracleAirflowPySparkHadoopParquetORCSQLGitLinuxpandasrequests
Задачи
- •Проектирование и реализация отказоустойчивых ETL/ELT процессов
- •Оптимизация и сопровождение пайплайнов данных (Spark, PySpark)
- •Интеграция новых источников и построение витрин для бизнеса
- •Обеспечение качества и актуальности данных в продуктиве
- •Участие в архитектурных решениях по хранению и обработке больших данных
- •Ad-hoc аналитика и поддержка команд аналитиков и data scientist
Обязательно
- •Высшее техническое образование или на завершающей стадии обучения
- •Опыт разработки на Python от 6 месяцев
- •Уверенное знание SQL (сложные запросы, оконные функции, планы выполнения)
- •Понимание архитектуры больших данных и принципов ETL/ELT
- •Знакомство с Airflow и оркестрацией пайплайнов
- •Базовые навыки Linux и работа с Git
- •Опыт работы с Hadoop/Spark или готовность к быстрому освоению