Старший инженер данных
удалёнка, гибрид, Москва
Команда DS в крупном банке ищет специалиста для проектирования и внедрения автоматических DQ‑контролей и ML‑решений для обнаружения аномалий, дрейфа и деградации данных; решения будут интегрироваться в production‑пайплайны и поддерживаться операционными командами
ГрейдSenior
Опытот 3 лет
Стек
PythonPySparkHadoop/HiveAirflowSQLMLflowpandasnumpyscikit-learn
Задачи
- •Исследовать и прототипировать методы контроля качества данных
- •Проектировать ML‑ и статистические контроли для аномалий и дрейфа распределений
- •Строить DQ‑метрики: row_count, null_rate, unique_count, свежесть, доли категорий
- •Валидировать контролы на исторических данных и синтетических аномалиях (shadow mode)
- •Интегрировать решения в production‑пайплайны (Airflow, PySpark, Hive/Hadoop)
- •Настраивать алертинг и сопровождать решения в production
Обязательно
- •Опыт в ML / Data Science от 3 лет
- •Уверенное владение Python (pandas, numpy, scikit-learn)
- •Опыт работы с SQL
- •Опыт работы с PySpark и Hadoop/Hive
- •Опыт работы с Airflow и интеграции в production‑пайплайны
- •Понимание статистики и классических ML‑методов
- •Опыт вывода моделей в production, мониторинга и версионирования моделей
Будет плюсом
- •Опыт построения DQ‑фреймворка или мониторинга качества данных в production
- •Опыт мониторинга признаков и скорингов моделей (дрейф, delayed labels)
- •Опыт с Kafka, Flink или Spark Structured Streaming
- •Опыт работы с банковскими/транзакционными данными
- •Опыт с объяснимостью моделей (SHAP, permutation importance)
- •Опыт настройки алертинга и дашбордов для операционных команд