ML-разработчик в команду базового алайнмента Alice AI LLM
гибрид
Команда работает над превращением предобученной LLM в диалогового агента Alice AI: SFT, RLHF и reward modeling для повышения качества ответов и соответствия пользовательским ожиданиям. Роль важна для качества взаимодействия пользователей с агентом.
Стек
LLMNLPSQLPPODPOreward modeling
Задачи
- •Разработка и проведение SFT-экспериментов по обучению следованию инструкциям
- •Организация и обучение с использованием RLHF (DPO, PPO)
- •Разработка и обучение reward-моделей для оценки качества ответов
- •Поиск и исправление слабых мест модели, разработка новых навыков
- •Анализ данных экспериментов и формулировка дальнейших гипотез
Обязательно
- •Отличное знание классических ML-методов и NLP
- •Понимание архитектуры современных LLM и опыт работы с ними (прикладной или исследовательский)
- •Опыт работы с данными
- •Уверенное знание SQL