ГНГНИВЦ
Data Engineer / ETL-разработчик
удалёнка, Москва
Команда данных работает над Озером данных и аналитическими витринами для государственных и коммерческих клиентов. Вы будете проектировать и сопровождать ETL/ELT-процессы, оптимизировать хранение и расчёты больших данных и обеспечивать качество и доступность данных для аналитики
ГрейдMiddle/Senior
Стек
PythonSparkPostgreSQLHadoop/HDFSClickHouseAirflowNiFiParquet/ORC/AvroKafkaDockerGitSQL
Задачи
- •проектировать, разрабатывать и сопровождать ETL/ELT-пайплайны загрузки и трансформации данных
- •оптимизировать и настраивать расчёты на Spark-кластере и устранять узкие места производительности
- •проектировать и сопровождать схемы хранения и модели данных в PostgreSQL и ClickHouse
- •обеспечивать согласованность, полноту и качество данных на всех этапах жизненного цикла
- •настраивать и поддерживать мониторинг пайплайнов и своевременно реагировать на сбои загрузки
- •автоматизировать рутинные операции по обработке и контролю данных и вести техническую документацию
Обязательно
- •уверенное знание SQL (JOIN, подзапросы, оконные функции, CTE, планы выполнения)
- •опыт работы с PostgreSQL: проектирование БД, оптимизация запросов, индексы, транзакции
- •опыт работы с ClickHouse: моделирование таблиц, партиционирование, тиры хранения, оптимизация
- •опыт работы с озером данных на базе Hadoop/HDFS и форматами Parquet/ORC/Avro
- •опыт разработки ETL/ELT-процессов и пайплайнов данных
- •практическое знакомство со Spark / Hive / HDFS
- •опыт работы с инструментами оркестрации (Airflow, NiFi) и базовые навыки Docker/Linux/Git