Data Engineer
офис, удалёнка, гибрид
Команда Data Platform в крупном банке; вы будете строить и поддерживать пайплайны загрузки и обработки неструктурированных и табличных данных для аналитики и сервисов банка, повышая скорость и надёжность данных для бизнеса
ГрейдMiddle/Senior
Опытот 4 лет
Стек
PythonPySparkGreenplumKafkaAirflowNumPyPandasOraclePostgreSQL
Задачи
- •Разработка и сопровождение ETL/ELT-пайплайнов для пакетной обработки данных
- •Проектирование и внедрение сервисов загрузки и обработки неструктурированных данных (text, XML, JSON)
- •Разработка продюсеров/консьюмеров Kafka на Python и поддержка consumer groups
- •Оптимизация сложных SQL‑запросов с оконными функциями, профилирование и тюнинг производительности
- •Написание модульных и интеграционных тестов для дата-сервисов
Обязательно
- •опыт работы в роли Data Engineer от 4 лет
- •отличное знание Python, ООП и функционального программирования
- •опыт разработки на PySpark для высоконагруженной обработки данных
- •опыт работы с Kafka: продюсеры/консьюмеры на Python и consumer groups
- •хорошее знание SQL: сложные запросы, оконные функции и оптимизация
- •опыт работы с СУБД Oracle, Postgres, Greenplum
- •опыт работы с Airflow и инструментами мониторинга workflow
Будет плюсом
- •опыт потоковой обработки на Spark Structured Streaming
- •опыт работы с Flink