ЯндексЯндекс

Старший DL-разработчик в команду Нейро

Команда Нейро развивает мультимодальный продукт для Алисы: вы будете работать над LLM-оценщиком и реворд-моделями, которые задают качество обучения и генерации ответов, проводя исследования и внедряя улучшения для alignment и мультимодальной оценки

ГрейдSenior

Стек

PythonPyTorchNLPRLLLMVLMGRPO

Задачи

  • Улучшение процесса алайнмента Нейро с помощью реворд-моделей и LLM-оценщика
  • Исследования подходов LLM-as-a-judge
  • Эксперименты с test-time scaling для LLM-оценщика
  • Улучшение LLM-оценщика на стадиях обучения включая annealing и GRPO
  • Развитие мультимодального VLM-оценщика

Обязательно

  • Глубокое понимание математики за PyTorch-кодом
  • Умение превращать научные статьи в код; реализация SOTA-методов
  • Широкие компетенции в NLP и Deep Learning
  • Практический опыт работы с нейросетями в исследовательском контексте

Будет плюсом

  • Глубокие знания в области LLM и RL
  • Опыт работы с крупными моделями и распределённым обучением
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT