Data Engineer for VLM Training Data (GigaChat Vision)
офис, гибрид, Москва
В команде Data Engineering для VLM вы будете строить инфраструктуру, пайплайны очистки/фильтрации/версирования и экспорт training‑ready датасетов для обучения Vision‑Language моделей. Роль важна для качества данных и воспроизводимости исследований и продакшена; тесная работа с ML‑инженерами и исследователями.
ГрейдSenior
Стек
PythonPostgreSQLS3YTsaurusDVCDockerGit
Задачи
- •Собирать требования ML‑команды к данным для обучения, дообучения и оценки
- •Проектировать и реализовывать масштабируемые пайплайны очистки, фильтрации, дедупликации и генерации данных
- •Организовывать импорт, валидацию, хранение и версионирование больших датасетов
- •Разрабатывать пайплайны синтетической генерации данных для улучшения VLM
- •Обеспечивать экспорт воспроизводимых training‑ready форматов и надёжность data‑процессов
- •Собирать статистику, строить отчёты и визуализации по качеству и покрытию датасетов
Обязательно
- •Опыт в production‑grade data engineering и пайплайнах
- •Уверенное владение Python (multiprocessing, multithreading, async)
- •Опыт с объектными хранилищами (S3 или аналоги) и распределённым хранением (YTsaurus)
- •Опыт работы с большими объёмами данных и распределённой обработкой
- •Опыт с DVC, Docker и Git, версионирование датасетов
- •Умение проектировать reproducible pipelines и экспорт в training‑ready форматы
Будет плюсом
- •Опыт с мультимодальными данными (image‑text pairs, OCR, captions)
- •Опыт построения пайплайнов для synthetic data generation
- •Реализация quality scoring, semantic deduplication, filtering и clustering
- •Опыт работы с Common Crawl/LAION‑подобными датасетами
- •Опыт визуализации статистики по большим датасетам и внутренними аналитическими дашбордами
- •Базовое понимание ML training pipeline и влияния качества данных на модели