ГНГНИВЦ

Разработчик Hadoop (senior)

офис, удалёнка, гибрид, Москва

Работа в команде Big Data над распределёнными процессами обработки данных в кластере ADH. Разработка и сопровождение ETL и потоковых пайплайнов на Spark с интеграцией в Hadoop-экосистему для обеспечения надёжной аналитики и обмена данными между системами

ГрейдSenior
Опыт3–6 лет

Стек

JavaApache SparkHDFSKafkaHiveHBaseOraclePostgreSQLClickHouseZookeeperYARNLinuxSQL

Задачи

  • Разработка и поддержка распределённых Big Data процессов и ETL пайплайнов на Spark (Java/Scala)
  • Разработка и сопровождение потоковых пайплайнов и интеграция через Kafka
  • Интеграция и обмен данными с HDFS, Hive, HBase, Oracle, PostgreSQL и ClickHouse
  • Написание и оптимизация SQL-запросов для загрузки/выгрузки данных
  • Оптимизация производительности Spark job'ов и тюнинг кластера (partitioning, broadcasting)
  • Участие в проектировании архитектуры Big Data и внедрение лучших практик

Обязательно

  • 5+ лет коммерческой разработки на Java и Scala
  • практический опыт работы с Apache Spark и глубокое понимание Spark internals (RDD/DataFrame API, shuffle, Catalyst Optimizer)
  • знание Hadoop-экосистемы (HDFS, Hive, HBase) и компонентов кластера (YARN, Zookeeper)
  • опыт работы с Kafka
  • хорошее знание SQL и опыт работы с реляционными СУБД (Oracle, PostgreSQL)
  • уверенное владение Linux
  • опыт взаимодействия с бизнес-заказчиками и аналитиками

Будет плюсом

  • опыт работы с ClickHouse
  • опыт работы в кластере ADH
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT