Старший LLM-разработчик в команду рассуждений Alice AI LLM
гибрид
Команда улучшает способности рассуждений семейства Alice AI LLM: вы будете исследовать и внедрять методы RLVR/RLHF, схемы reward‑моделей и дистилляции для единой модели, повышающей качество ответов и цепочек рассуждений для массовых B2C‑задач
ГрейдSenior
Стек
PythonLLMRLHFRLVRMoEдистилляцияon-policy RLасинхронные RL-алгоритмыreward-модели
Задачи
- •Масштабирование и проведение экспериментов RLVR- и RLHF-обучения reasoning‑моделей
- •Исследование и разработка reward‑моделей и этапов алайнмента
- •Объединение сигналов из разных задач в единой модели и дистилляция
- •Улучшение качества цепочек рассуждений: backtracking, верификация и структура ответов
- •Тестирование on‑policy и асинхронных RL‑алгоритмов и методов стабилизации обучения
Обязательно
- •Экспертные знания в NLP и классическом ML
- •Умение программировать на Python
- •Понимание современных LLM и опыт решения прикладных задач или релевантный исследовательский опыт
- •Практические знания и опыт применения RLHF и/или RLVR
- •Опыт работы с reward‑моделями и методиками дистилляции
Будет плюсом
- •Опыт с MoE‑архитектурами
- •Опыт применения on‑policy и асинхронных RL‑алгоритмов
- •Практика дистилляции и объединения сигналов из разных доменов
- •Опыт стабилизации обучения для Dense и MoE‑моделей