Data Engineer
В команду Data Platform крупного коммерческого банка для разработки и вывода в промышленную эксплуатацию конвейеров загрузки и обработки неструктурированных и потоковых данных. Работа влияет на качество данных в аналитике и мобильных сервисах банка
ГрейдMiddle/Senior
Опытот 4 лет
Стек
PythonPySparkPostgreSQLKafkaAirflowOracleGreenplumSpark Structured StreamingFlinkNumPyPandas
Задачи
- •Разработка конвейеров загрузки и обработки неструктурированных данных (текст, XML, JSON)
- •Проектирование и внедрение потоковой обработки на базе Spark Structured Streaming и PySpark
- •Разработка продюсеров/консьюмеров в Kafka и управление consumer groups
- •Оптимизация сложных SQL-запросов и профилирование производительности
- •Покрытие модульными и интеграционными тестами и сопровождение в production
- •Интеграция с API поставщиков данных и отладка входящих потоков
Обязательно
- •опыт работы в роли Data Engineer от 4-х лет
- •отличные знания Python: структуры данных, ООП и функциональное программирование
- •опыт разработки на PySpark и Spark Structured Streaming
- •опыт работы с Apache Kafka: продюсеры/консьюмеры и consumer groups
- •отличное знание SQL и опыт оптимизации сложных аналитических запросов
- •опыт работы с Airflow для оркестрации пакетных задач
- •опыт работы с БД Oracle, PostgreSQL или Greenplum