ГНГНИВЦ
Разработчик Hadoop (senior)
офис, удалёнка, гибрид, Москва
Работа в команде Big Data над распределёнными процессами обработки данных в кластере ADH. Разработка и сопровождение ETL и потоковых пайплайнов на Spark с интеграцией в Hadoop-экосистему для обеспечения надёжной аналитики и обмена данными между системами
ГрейдSenior
Опыт3–6 лет
Стек
JavaApache SparkHDFSKafkaHiveHBaseOraclePostgreSQLClickHouseZookeeperYARNLinuxSQL
Задачи
- •Разработка и поддержка распределённых Big Data процессов и ETL пайплайнов на Spark (Java/Scala)
- •Разработка и сопровождение потоковых пайплайнов и интеграция через Kafka
- •Интеграция и обмен данными с HDFS, Hive, HBase, Oracle, PostgreSQL и ClickHouse
- •Написание и оптимизация SQL-запросов для загрузки/выгрузки данных
- •Оптимизация производительности Spark job'ов и тюнинг кластера (partitioning, broadcasting)
- •Участие в проектировании архитектуры Big Data и внедрение лучших практик
Обязательно
- •5+ лет коммерческой разработки на Java и Scala
- •практический опыт работы с Apache Spark и глубокое понимание Spark internals (RDD/DataFrame API, shuffle, Catalyst Optimizer)
- •знание Hadoop-экосистемы (HDFS, Hive, HBase) и компонентов кластера (YARN, Zookeeper)
- •опыт работы с Kafka
- •хорошее знание SQL и опыт работы с реляционными СУБД (Oracle, PostgreSQL)
- •уверенное владение Linux
- •опыт взаимодействия с бизнес-заказчиками и аналитиками
Будет плюсом
- •опыт работы с ClickHouse
- •опыт работы в кластере ADH