Data Engineer
Команда отвечает за ETL/ELT‑конвейеры и кластерную инфраструктуру на Hadoop/Spark. Развиваете платформу обработки и потоковой аналитики, повышая производительность и масштабируемость данных для внутренних сервисов и аналитики
Стек
JavaApache SparkHDFSKafkaHadoopYARNHiveHBaseParquetPostgreSQLMS SQLMongoDBPySparkFlinkAirflowElasticsearchClickHouseVerticaDockerCI/CDRabbitMQ
Задачи
- •Разработка и оптимизация ETL/ELT‑конвейеров
- •Настройка и администрирование Hadoop/Spark инфраструктуры (HDFS, YARN, Hive, HBase)
- •Оптимизация распределённых вычислений и запросов
- •Обработка потоковых данных (Kafka, Spark Streaming)
- •Проектирование и масштабирование архитектуры данных
- •Автоматизация процессов с использованием DevOps‑практик
Обязательно
- •Опыт работы с Java/Scala и Big Data‑фреймворками (Apache Spark, Hadoop)
- •Глубокие знания Hadoop‑экосистемы (YARN, HDFS, Hive, HBase, Parquet)
- •Опыт оптимизации производительности распределённых систем
- •Опыт работы с потоковой обработкой данных (Kafka, Spark Streaming)
- •Навыки работы с SQL и NoSQL (PostgreSQL, MS SQL, MongoDB)
- •Навыки настройки кластеров и эксплуатации инфраструктуры
Будет плюсом
- •Опыт с PySpark
- •Опыт с Flink
- •Опыт с Airflow
- •Знание Elasticsearch, ClickHouse, Vertica
- •Опыт работы с Docker и CI/CD
- •Опыт с RabbitMQ