Инженер данных
удалёнка, Москва
Команда банка ищет инженера данных для разработки и поддержки высоконагруженных конвейеров репликации и подготовки данных в DataLake/SandBox/FeatureStore; результат нужен для аналитики и построения признаков для ML-моделей
ГрейдMiddle/Senior
Стек
PythonPySparkPostgreSQLAirflownumpypandasOracleGreenplumSQL
Задачи
- •Реализация высоконагруженных конвейеров обработки и репликации данных из ИТ‑систем банка
- •Подготовка данных в DataLake, SandBox и FeatureStore для построения признаков для ML
- •Разработка и поддержка сервисов загрузки и обработки неструктурированных данных (текст, XML, JSON)
- •Проверка качества кода и код‑ревью для инженеров и младших инженеров данных
- •Ведение документации по разработанному функционалу и отражение статуса задач в Jira
Обязательно
- •Уверенное знание Python, структур данных, алгоритмов, ООП и ФП
- •Опыт написания модульных и интеграционных тестов; знание numpy и pandas
- •Опыт разработки production‑сервисов загрузки и обработки неструктурированных/слабо структурированных данных
- •Умение работать с API поставщиков данных по документации
- •Знание SQL, уменее писать сложные запросы с оконными функциями; опыт с Oracle, Postgres, Greenplum
- •Опыт с workflow engines и инструментами мониторинга пакетной обработки данных
- •Опыт разработки на Airflow и создании высоконагруженных приложений на PySpark; знание настроек Spark и их влияния на производительность