СберСбер

Data Engineer for VLM Training Data (GigaChat Vision)

офис, гибрид, Москва

В команде Data Engineering для VLM вы будете строить инфраструктуру, пайплайны очистки/фильтрации/версирования и экспорт training‑ready датасетов для обучения Vision‑Language моделей. Роль важна для качества данных и воспроизводимости исследований и продакшена; тесная работа с ML‑инженерами и исследователями.

ГрейдSenior

Стек

PythonPostgreSQLS3YTsaurusDVCDockerGit

Задачи

  • Собирать требования ML‑команды к данным для обучения, дообучения и оценки
  • Проектировать и реализовывать масштабируемые пайплайны очистки, фильтрации, дедупликации и генерации данных
  • Организовывать импорт, валидацию, хранение и версионирование больших датасетов
  • Разрабатывать пайплайны синтетической генерации данных для улучшения VLM
  • Обеспечивать экспорт воспроизводимых training‑ready форматов и надёжность data‑процессов
  • Собирать статистику, строить отчёты и визуализации по качеству и покрытию датасетов

Обязательно

  • Опыт в production‑grade data engineering и пайплайнах
  • Уверенное владение Python (multiprocessing, multithreading, async)
  • Опыт с объектными хранилищами (S3 или аналоги) и распределённым хранением (YTsaurus)
  • Опыт работы с большими объёмами данных и распределённой обработкой
  • Опыт с DVC, Docker и Git, версионирование датасетов
  • Умение проектировать reproducible pipelines и экспорт в training‑ready форматы

Будет плюсом

  • Опыт с мультимодальными данными (image‑text pairs, OCR, captions)
  • Опыт построения пайплайнов для synthetic data generation
  • Реализация quality scoring, semantic deduplication, filtering и clustering
  • Опыт работы с Common Crawl/LAION‑подобными датасетами
  • Опыт визуализации статистики по большим датасетам и внутренними аналитическими дашбордами
  • Базовое понимание ML training pipeline и влияния качества данных на модели
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT