МедиалогияМедиалогия

Data Engineer

Команда отвечает за ETL/ELT‑конвейеры и кластерную инфраструктуру на Hadoop/Spark. Развиваете платформу обработки и потоковой аналитики, повышая производительность и масштабируемость данных для внутренних сервисов и аналитики

Стек

JavaApache SparkHDFSKafkaHadoopYARNHiveHBaseParquetPostgreSQLMS SQLMongoDBPySparkFlinkAirflowElasticsearchClickHouseVerticaDockerCI/CDRabbitMQ

Задачи

  • Разработка и оптимизация ETL/ELT‑конвейеров
  • Настройка и администрирование Hadoop/Spark инфраструктуры (HDFS, YARN, Hive, HBase)
  • Оптимизация распределённых вычислений и запросов
  • Обработка потоковых данных (Kafka, Spark Streaming)
  • Проектирование и масштабирование архитектуры данных
  • Автоматизация процессов с использованием DevOps‑практик

Обязательно

  • Опыт работы с Java/Scala и Big Data‑фреймворками (Apache Spark, Hadoop)
  • Глубокие знания Hadoop‑экосистемы (YARN, HDFS, Hive, HBase, Parquet)
  • Опыт оптимизации производительности распределённых систем
  • Опыт работы с потоковой обработкой данных (Kafka, Spark Streaming)
  • Навыки работы с SQL и NoSQL (PostgreSQL, MS SQL, MongoDB)
  • Навыки настройки кластеров и эксплуатации инфраструктуры

Будет плюсом

  • Опыт с PySpark
  • Опыт с Flink
  • Опыт с Airflow
  • Знание Elasticsearch, ClickHouse, Vertica
  • Опыт работы с Docker и CI/CD
  • Опыт с RabbitMQ
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT