NLP Engineer (Reinforcement Learning)
Москва
Команда GigaChat Reasoning развивает пайплайны online RL для улучшения навыков моделей и вывода их в продакшн. Вы будете создавать среды, тренировать модели (RU/EN), оптимизировать обучение и внедрять результаты в продукт Deep Research
ГрейдSenior
Стек
PythonPyTorchDeep LearningReinforcement Learning
Задачи
- •разрабатывать среды для online RL и training loop'ы
- •ускорять и профилировать пайплайн обучения
- •экспериментировать с loss-функциями и подходами к обучению
- •тренировать и тестировать модели (малые и большие)
- •помогать с выводом моделей в продакшн
Обязательно
- •опыт в online RL и хорошие теоретические знания
- •уверенное владение Python и PyTorch
- •знание базовых алгоритмов и математики
- •знания в Deep Learning и опыт обучения моделей
- •опыт вывода моделей в продакшн
- •понимание текущего состояния LLM и их эволюции
Будет плюсом
- •наличие публикаций