Senior RL - Engineer (GigaChat Vision)
офис, гибрид, Москва
Команда GigaChat Vision ищет senior RL-инженера для разработки и внедрения методов обучения VLM/LLM. Будете проектировать RL-подходы, reward‑функции и eval‑метрики, переносить эксперименты в продакшн и повышать качество моделей
ГрейдSenior
Стек
DeepSpeedFSDPPPORLHFGRPO
Задачи
- •Разрабатывать и улучшать RL‑подходы для обучения VLM/LLM
- •Проектировать reward‑функции и строить пайплайны обучения
- •Выстраивать стратегии масштабирования под разные домены и сценарии
- •Определять требования к данным и участвовать в подготовке датасетов
- •Развивать и улучшать систему оценки reasoning‑качества и метрики в eval‑фреймворке
- •Дебажить эксперименты, анализировать аномалии и доводить решения до продакшна
Обязательно
- •Глубокое понимание RL для LLM/VLM (RLHF, GRPO, PPO) и практический опыт
- •Опыт постановки, проведения и анализа RL‑экспериментов
- •Опыт распределённого обучения и инференса (DeepSpeed, FSDP и т.п.)
- •Понимание полного цикла обучения VLM/LLM (pretrain → SFT → RL)
- •Умение работать самостоятельно в условиях неопределённости
- •Системное мышление: от данных и reward‑дизайна до eval и продакшн‑метрик
- •Опыт взаимодействия со смежными командами и стейкхолдерами
Будет плюсом
- •Опыт менторинга или технического лидерства
- •Публикации или вклад в open‑source в области RL/LLM/VLM
- •Опыт вывода RL‑обученных моделей в продакшн и поддержки их качества