Middle RL - Engineer (GigaChat Vision)
офис, гибрид, Москва
Работа в команде GigaChat Vision над RL-методами для обучения VLM/LLM: разработка алгоритмов, reward-дизайн, организация пайплайнов данных и перевод экспериментов в продакшн для улучшения качества моделей и бизнес-метрик
ГрейдMiddle
Стек
DeepSpeedFSDPPPORLHFinference-фреймворки
Задачи
- •Разрабатывать и улучшать RL-подходы для обучения VLM/LLM
- •Проектировать reward-функции и учебные пайплайны, масштабировать решения под домены
- •Определять требования к данным и участвовать в сборе/фильтрации/подготовке датасетов
- •Развивать и интегрировать eval-фреймворк для оценки reasoning-качества
- •Дебажить эксперименты, анализировать аномалии и улучшать стабильность обучения
- •Сопровождать перенос экспериментальных решений в продакшн и работать с соседними командами
Обязательно
- •Глубокое понимание RL для LLM/VLM (RLHF, PPO) и практический опыт
- •Знание полного цикла обучения VLM/LLM (pretrain → SFT → RL)
- •Опыт с распределённым обучением и инструментами типа DeepSpeed, FSDP
- •Сильный практический опыт постановки, проведения и анализа RL-экспериментов
- •Умение работать самостоятельно в условиях неопределённости и доводить сложные задачи
- •Системное мышление и способность влиять на финальные метрики модели
- •Опыт взаимодействия со смежными командами и стейкхолдерами
Будет плюсом
- •Опыт менторинга или технического лидерства в проектах
- •Публикации или вклад в open-source в области RL/LLM/VLM
- •Опыт вывода RL-обученных моделей в продакшн и поддержания их качества