Middle/Senior Data Engineer
гибрид, Москва
Команда развивает поисковый сервис, обеспечивающий LLM и пользователей актуальной информацией. Вы будете строить end-to-end пайплайны, Data LakeHouse и процессы подготовки мультимодальных данных для векторного и полнотекстового поиска, повышая качество, свежесть и производительность индексов
ГрейдMiddle/Senior
Опытот 3 лет
Стек
PythonSpark/PySparkS3KubernetesAirflowParquetApache IcebergKafkaElasticSearchCassandraPrometheusGrafanaPyTorchAWSYandex CloudSberCloud
Задачи
- •Проектировать и развивать end-to-end пайплайны: ingest, batch/micro-batch обработка, нормализация
- •Реализовывать дедупликацию, лемматизацию, обогащение и подготовку данных к индексации
- •Интегрировать новые источники и мультимодальные данные с гарантией воспроизводимости загрузки
- •Развивать и оптимизировать Data LakeHouse и хранилища для векторного, полнотекстового и гибридного поиска
- •Оптимизировать Spark-процессы на Kubernetes по производительности, стоимости и стабильности
- •Обеспечивать надежность пайплайнов: мониторинг, качество данных, SLA и CI/CD для pipelines
Обязательно
- •от 3 лет опыта в роли Data/Platform/ML Engineer
- •продвинутый Python и SQL
- •опыт с Airflow и Spark/PySpark в production
- •опыт разработки batch или streaming/micro-batch пайплайнов для от 100 TB до PB+
- •понимание распределённого хранения данных и распределённых вычислений
- •опыт анализа и оптимизации производительности Spark jobs (shuffle, skew, partitioning, memory)
- •опыт работы с Kubernetes и S3-compatible storage
Будет плюсом
- •опыт с поисковыми движками: ElasticSearch, OpenSearch, Vespa
- •опыт с Cassandra или другими распределёнными NoSQL-хранилищами
- •опыт с Kafka или другими брокерами событий
- •понимание vector search, embeddings, ANN/HNSW и hybrid search
- •опыт GPU-инференса моделей и PyTorch
- •опыт работы с облачными платформами: AWS, Yandex Cloud, SberCloud
- •опыт с observability stack: Prometheus и Grafana