ML-разработчик в команду качества LLM в Алисе
гибрид
Команда работает над повышением качества и свойств AliceAI — полезности, человечности и фактологичности ответов. Вы будете исследовать и внедрять подходы RL, развивать reward‑модели и эксперименты с внешними источниками для улучшения LLM‑поведения для миллионов пользователей
ГрейдMiddle/Senior
Стек
LLMMoEReinforcement LearningRAGNLPreward‑модели
Задачи
- •Исследовать и внедрять методы RL для обучения LLM
- •Разрабатывать и улучшать reward‑модели для оценки аспектов ответов
- •Искать и решать проблемы reward‑hacking и корреляции/антикорреляции функций награды
- •Проводить эксперименты с использованием внешних источников (RAG) для повышения фактологичности
- •Формулировать гипотезы и проверять их через эксперименты на срезах ответов
Обязательно
- •Глубокий интерес к прикладным ML‑исследованиям
- •Опыт работы с NLP и LLM, понимание современной архитектуры языковых моделей
- •Умение формулировать и проверять гипотезы через экспериментальный цикл
- •Понимание методов RL и принципов обучения с подкреплением (теоретически)
- •Опыт работы с исследовательскими экспериментами и анализом поведения моделей
Будет плюсом
- •Практический опыт применения reinforcement learning для обучения моделей
- •Опыт работы с RAG и интеграцией внешних источников информации