Data Engineer в команду платформы данных (ML)
удалёнка
Команда платформы данных Trust & Safety: вы будете строить потоковые и пакетные пайплайны признаков для антифрода и модерации — от событий до онлайн/оффлайн хранилищ, обеспечивая согласованность логики и SLA по свежести данных
ГрейдMiddle/Senior
Опыт4–5+ лет
Стек
PythonFlinkClickHouseKafkaRedisCassandraS3Apache IcebergTrinoAirflowSQL
Задачи
- •Проектировать и реализовывать потоковые пайплайны из Databus/Kafka для расчёта онлайн‑признаков
- •Разрабатывать пакетные ETL/ELT-процессы через Trino/S3/Iceberg для офлайн‑признаков
- •Писать результаты в Redis, Cassandra и/или ClickHouse
- •Обеспечивать единую логику расчёта признаков между обучением и продакшеном
- •Настраивать расписания, пересчёты и бэкап‑процессы для соблюдения SLA по свежести
- •Мониторить качество данных, писать проверки и расследовать инциденты
Обязательно
- •4–5+ лет опыта в Data Engineer или backend+data роли
- •Опыт работы с Kafka/Databus: продюсеры, консьюмеры, партиционирование и обработка ошибок
- •Практический опыт со streaming‑движком (Flink или реальный прод‑опыт со Spark Structured Streaming)
- •Опыт работы с Redis или Cassandra как онлайновыми хранилищами признаков
- •Опыт работы с S3 и табличными форматами (Iceberg/Delta/Hudi) и доступ через Trino/SQL
- •Отличное знание SQL и опыт с ClickHouse
- •Уверенный уровень Python для разработки data‑скриптов и сервисной логики
Будет плюсом
- •Опыт реального продакшен‑опыта со Spark Structured Streaming
- •Знание и опыт с Delta/Hudi как альтернативой Iceberg