Data Engineer (Senior)
удалёнка, Москва
Команда платформенных Data Engineer строит и поддерживает собственную Data Platform на lakehouse (Iceberg + Trino) с пайплайнами, Spark‑вычислениями и AI‑агентами. Роль важна для ускорения разработки пайплайнов и обеспечения качества данных в продукте.
ГрейдSenior
Опытот 5 лет
Стек
PythonApache SparkApache IcebergKafkaTrinoDebeziumApache AirflowKubernetesSQLCI/CDGit
Задачи
- •развитие ядра платформы: Data Vault, обвязка Airflow, lineage‑инструменты
- •разработка библиотек и фреймворков на Python для инжиниринга данных
- •поддержка lakehouse: Iceberg maintenance, compaction, snapshot expiration, schema evolution и тюнинг layout
- •оптимизация Trino-запросов и работа с коннекторами
- •интеграции с источниками данных (OLTP, REST/gRPC, Kafka, файловые хранилища)
- •внедрение AI‑инструментов и агентов для расследования инцидентов и поддержки DAG'ов; код‑ревью и участие в архитектурных решениях
Обязательно
- •от 5 лет промышленного опыта в data engineering или backend с дата‑уклоном
- •Python — senior: ООП, проектирование API библиотек, типизация, тесты
- •Apache Iceberg: compaction, snapshot expiration, position/equality deletes, schema evolution
- •Trino или другой MPP‑движок: оптимизация запросов, чтение планов, коннекторы
- •Apache Airflow глубоко: внутреннее устройство, написание операторов и хуков
- •Apache Spark (PySpark) и понимание модели выполнения
- •SQL продвинутого уровня; уверенная работа с Git и CI/CD
Будет плюсом
- •опыт с Kafka/Debezium CDC‑пайплайнами
- •опыт разработки платформных фреймворков (Data Vault или аналог)
- •опыт работы в Kubernetes
- •опыт внедрения LLM/агентов (LangGraph, MCP или подобные) для автоматизации инженерных задач