Старший инженер данных
Москва
Команда Корпоративного центра ИИ ищет старшего инженера данных для проектирования и оптимизации масштабируемых batch и streaming пайплайнов, обеспечения качества данных и своевременной поставки признаков для аналитики и ML-сервисов.
ГрейдSenior
Стек
PythonSparkClickHouseKafkaAirflowHadoop/HDFSHiveS3PySparkScalaSQLGitCI/CDJupyterDataSphere
Задачи
- •Проектирование и оптимизация batch и streaming пайплайнов данных
- •Поддержка качества данных: валидация, профилирование и мониторинг
- •Поставка и сопровождение признаков для аналитики и ML
- •Участие в разработке AI/ML сервисов в корпоративном центре ИИ
Обязательно
- •Высшее образование
- •Продвинутое владение SQL (ClickHouse, Hive, реляционные СУБД) и оптимизация запросов
- •Продвинутое владение Python и PySpark, основы Scala
- •Опыт работы с Hadoop/HDFS, интеграция с объектными хранилищами (S3) и потоковой обработкой (Kafka)
- •Проектирование и сопровождение ETL/ELT процессов в Airflow
- •Навыки работы с Git, CI/CD и инструментами анализа (Jupyter, DataSphere)