Инженер данных (Data Engineer)
удалёнка
Команда инженерии данных занимается миграцией и развитием витрин данных: перенос с Hadoop на стек Apache Iceberg + Spark, построение реплик и оптимизация конвейеров данных для аналитики и BI, а также поддержка качества через тестирование и документацию.
Стек
PythonApache SparkApache IcebergApache AirflowHadoopS3ParquetGitCI/CDKafkaSQL
Задачи
- •Анализ существующих решений и витрин данных
- •Миграция витрин с Hadoop на Iceberg + Spark
- •Реализация недостающих реплик витрин данных
- •Переработка решений на целевом стеке
- •Построение и развитие витрин данных, участие в тестировании
- •Наполнение и актуализация технической документации
Обязательно
- •Уверенные знания SQL
- •Уверенные знания Python
- •Опыт работы с Apache Spark
- •Практический опыт с хранилищами на базе Hadoop и/или S3
- •Знание и опыт работы с Apache Iceberg
- •Опыт использования Apache Airflow
- •Понимание форматов хранения данных (включая Parquet) и опыт с Git, CI/CD, Jira, Confluence
Будет плюсом
- •Базовые знания Kafka