NLP Engineer (Reinforcement Learning)
Москва
Команда GigaChat Reasoning: разработка сред, онлайн-RL обучения и ускорение пайплайнов для улучшения способности моделей рассуждать. Работа над обучением, тестированием и выводом в продакшен решений для повышения качества ответов на русском и английском
ГрейдSenior
Стек
PythonPyTorchDeep LearningReinforcement LearningLLM
Задачи
- •разрабатывать среды для онлайн-RL и сценарии обучения
- •создавать и разметывать датасеты для тренировок
- •обучать и тестировать модели и агентские навыки
- •профилировать и оптимизировать пайплайн обучения и сэмплинг
- •помогать в выводе моделей в продакшен
- •следить за свежими исследованиями и внедрять новые подходы
Обязательно
- •опыт в online Reinforcement Learning и теоретические знания
- •уверенное владение Python
- •опыт работы с PyTorch
- •знание основ Deep Learning и математики
- •опыт обучения как небольших, так и больших моделей
- •опыт вывода моделей в продакшен
- •понимание текущего состояния и эволюции LLM
Будет плюсом
- •публикации в тематических конференциях или журналах