Старший DL-разработчик в команду Нейро
Команда Нейро развивает мультимодальный продукт для Алисы: вы будете работать над LLM-оценщиком и реворд-моделями, которые задают качество обучения и генерации ответов, проводя исследования и внедряя улучшения для alignment и мультимодальной оценки
ГрейдSenior
Стек
PythonPyTorchNLPRLLLMVLMGRPO
Задачи
- •Улучшение процесса алайнмента Нейро с помощью реворд-моделей и LLM-оценщика
- •Исследования подходов LLM-as-a-judge
- •Эксперименты с test-time scaling для LLM-оценщика
- •Улучшение LLM-оценщика на стадиях обучения включая annealing и GRPO
- •Развитие мультимодального VLM-оценщика
Обязательно
- •Глубокое понимание математики за PyTorch-кодом
- •Умение превращать научные статьи в код; реализация SOTA-методов
- •Широкие компетенции в NLP и Deep Learning
- •Практический опыт работы с нейросетями в исследовательском контексте
Будет плюсом
- •Глубокие знания в области LLM и RL
- •Опыт работы с крупными моделями и распределённым обучением