СберСбер

Middle/Senior Data Engineer

гибрид, Москва

Команда развивает поисковый сервис, обеспечивающий LLM и пользователей актуальной информацией. Вы будете строить end-to-end пайплайны, Data LakeHouse и процессы подготовки мультимодальных данных для векторного и полнотекстового поиска, повышая качество, свежесть и производительность индексов

ГрейдMiddle/Senior
Опытот 3 лет

Стек

PythonSpark/PySparkS3KubernetesAirflowParquetApache IcebergKafkaElasticSearchCassandraPrometheusGrafanaPyTorchAWSYandex CloudSberCloud

Задачи

  • Проектировать и развивать end-to-end пайплайны: ingest, batch/micro-batch обработка, нормализация
  • Реализовывать дедупликацию, лемматизацию, обогащение и подготовку данных к индексации
  • Интегрировать новые источники и мультимодальные данные с гарантией воспроизводимости загрузки
  • Развивать и оптимизировать Data LakeHouse и хранилища для векторного, полнотекстового и гибридного поиска
  • Оптимизировать Spark-процессы на Kubernetes по производительности, стоимости и стабильности
  • Обеспечивать надежность пайплайнов: мониторинг, качество данных, SLA и CI/CD для pipelines

Обязательно

  • от 3 лет опыта в роли Data/Platform/ML Engineer
  • продвинутый Python и SQL
  • опыт с Airflow и Spark/PySpark в production
  • опыт разработки batch или streaming/micro-batch пайплайнов для от 100 TB до PB+
  • понимание распределённого хранения данных и распределённых вычислений
  • опыт анализа и оптимизации производительности Spark jobs (shuffle, skew, partitioning, memory)
  • опыт работы с Kubernetes и S3-compatible storage

Будет плюсом

  • опыт с поисковыми движками: ElasticSearch, OpenSearch, Vespa
  • опыт с Cassandra или другими распределёнными NoSQL-хранилищами
  • опыт с Kafka или другими брокерами событий
  • понимание vector search, embeddings, ANN/HNSW и hybrid search
  • опыт GPU-инференса моделей и PyTorch
  • опыт работы с облачными платформами: AWS, Yandex Cloud, SberCloud
  • опыт с observability stack: Prometheus и Grafana
Откликнуться на сайте компании

Похожие вакансии

MarsMars

Руководитель отдела аналитики данных

Data LakehouseML‑платформаData GovernanceNear Real‑Time интеграции

Построение корпоративной дата‑платформы и культуры Data & AI

Опыт: 6+ лет
гибрид, Москва
ЯндексЯндекс

ML‑разработчик в команду трекинга Автономного транспорта

PythonPyTorchTensorFlowOpenCV

Модули 3D‑трекинга и perception для автономных автомобилей

офис, гибрид, Москва
СберСбер

ML Engineer (ASR, GigaChat Data)

Pythondata pipelineASRVAD

Данные и пайплайны для офлайн-ассистента и локального ASR

офис, гибрид, Москва
СберСбер

Data Engineer for VLM Training Data (GigaChat Vision)

PythonPostgreSQLS3YTsaurus

Инфраструктура и пайплайны для мультимодальных датасетов VLM

офис, гибрид, Москва
СберСбер

NLP/LLM Researcher

PythonPyTorchHuggingFace Transformers

Сервисы взаимодействия и планирования для роботов

офис, Москва
АльфаАльфа

Руководитель направления автоматизации данных

PythonPower BISQLExcel

Платформа отчетности и автоматизации данных

гибрид, Москва

Смотреть ещё

JobsWave
Найти работу в IT