Старший DL-разработчик в команду ризонинга
гибрид
Команда работает над развитием режима рассуждений (reasoning) для LLM Alice: создание данных, улучшение функций награды и исследований процедур RL-обучения. Роль важна для повышения качества ответов модели и её применения в разнообразных задачах пользователей.
ГрейдSenior
Стек
PythonTransformervLLMVERLSGLangReinforcement LearningPPOGAEраспределённое обучение
Задачи
- •создание и аннотирование наборов данных для рассуждающих задач
- •разработка и оптимизация функций награды для RL-обучения
- •исследование и настройка процедур обучения (on-policy/off-policy, advantage estimation и entropy management)
- •эксперименты с архитектурами и алгоритмами обучения для больших Transformer-моделей
Обязательно
- •отличное знание математики, алгоритмов и структур данных
- •умение программировать на Python
- •понимание и опыт с Reinforcement Learning (GAE, PPO и другие методы policy optimization)
- •практический опыт распределённого обучения больших Transformer-моделей
- •понимание стадии alignment современных LLM
Будет плюсом
- •опыт обучения reasoning/рассуждающих моделей
- •опыт работы с инфраструктурой для RL-обучения: VERL, vLLM, SGLang