Инженер данных
Команда данных разрабатывает ETL-пайплайны и backend-сервисы для подготовки данных и продакшена ML. Работа над batch-обработкой, интеграциями и стабильностью обучающих/инференсных пайплайнов для бизнес-приложений
ГрейдJunior/Middle
Опыт1–3 года
Стек
PythonPySparkPostgreSQLKubernetesPandasFastAPIPydanticClickHouseGreenplumTrinoS3Apache AirflowMLflowDockerGitGitLab CI/CDLinux
Задачи
- •Проектировать и реализовывать batch ETL-процессы
- •Разрабатывать backend-сервисы на Python для обработки данных и интеграций
- •Инжиниренно оборачивать ML-проекты в продакшен-пайплайны (обучение и инференс)
- •Проектировать и оптимизировать хранилища данных
- •Оркестрировать пайплайны в Airflow и обеспечивать воспроизводимость и наблюдаемость
Обязательно
- •Коммерческий опыт разработки на Python не менее 2 лет
- •Знание стандартной библиотеки Python и экосистемы data-инструментов
- •Понимание принципов построения ETL/ELT-процессов
- •Опыт с распределёнными СУБД и вычислительными движками (Greenplum, ClickHouse, Spark, Trino)
- •Опыт оркестрации пайплайнов в Apache Airflow
- •Базовые навыки CI/CD и DevOps (сборка, тестирование, деплой)
- •Опыт работы с Linux и контейнеризацией (Docker)