Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat
офис, гибрид, Москва
Руководитель направления в команде online RL GigaChat: доведение исследований по post-training и online RL до production-пайплайнов, запуск экспериментов и повышение качества LLM через надежные пайплайны обучения и оптимизацию использования GPU
ГрейдLead
Стек
PythonPyTorchFSDPDeepSpeedonline RLRLHFDPOdistributed training
Задачи
- •Разрабатывать и улучшать методы online RL и post-training
- •Проектировать и проводить ML-эксперименты: гипотезы, конфигурации, анализ результатов
- •Строить и поддерживать пайплайны обучения и data-пайплайны для rollout'ов и reward-сигналов
- •Обеспечивать воспроизводимость: версионирование данных, конфигов и чекпоинтов
- •Оптимизировать throughput и эффективность GPU: distributed training и профилирование
- •Вести взаимодействие с исследователями и инженерами, брать ответственность за фичи от идеи до продакшена
Обязательно
- •Свободное владение Python
- •Опыт работы с PyTorch
- •Практический опыт в LLM post-training (RLHF, online RL, DPO или смежное)
- •Опыт проведения ML-экспериментов от идеи до вывода
- •Понимание distributed training (Data Parallel, FSDP, DeepSpeed или аналоги)
- •Умение писать production-ready, надежный код
- •Умение разбираться в сложных системах и устранять узкие места
Будет плюсом
- •Опыт с reward-моделями и LLM-as-a-judge
- •Опыт построения сред выполнения, sandboxes и верификаторов для code/STEM задач
- •Опыт оптимизации large-scale inference (vLLM и аналоги)
- •Знание современных open-source стеков для обучения LLM (Megatron, TRL и др.)
- •Публикации или вклад в open-source, сильный прикладной трек-рекорд