ИвиИви

Data Platform Engineer

Команда Data Platform развивает платформу для построения, запуска и поддержки batch- и streaming-конвейеров данных. Роль фокусируется на проектировании и оптимизации конвейеров, обеспечении качества и репродуцируемости данных для команд аналитики и ML

ГрейдSenior

Стек

PythonSparkAirflowKafkaKubeflow PipelinesGitCI/CD

Задачи

  • Разработка и поддержка конвейеров обработки данных (batch и streaming)
  • Проектирование схем данных и архитектуры пайплайнов
  • Оптимизация Spark-задач по производительности и ресурсам
  • Реализация механизмов retry, backfill, идемпотентности и управления состоянием
  • Обеспечение качества данных, версионирования и отслеживания происхождения

Обязательно

  • Уверенное знание Python и/или JVM-языка
  • Опыт разработки и поддержки конвейеров обработки данных
  • Глубокое понимание Spark или другой распределённой системы обработки данных
  • Опыт с Airflow, Kubeflow Pipelines или аналогами
  • Понимание partitioning, shuffle, skew, retry, backfill и идемпотентности
  • Опыт работы в batch- и streaming-обработке (event time, окна, watermark, late data)
  • Опыт работы с Git, code review, тестированием, CI/CD и observability

Будет плюсом

  • Опыт работы с хранилищами признаков и ML-платформами
  • Опыт разработки потоковых систем и работы с Kafka
  • Опыт версионирования, lineage и проверки качества данных
  • Опыт оптимизации Spark-задач по скорости, памяти и стоимости вычислений
  • Опыт создания переиспользуемых решений для команд данных и ML
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT