ЯндексЯндекс

ML-разработчик в команду базового алайнмента Alice AI LLM

гибрид

Команда работает над превращением предобученной LLM в диалогового агента Alice AI: SFT, RLHF и reward modeling для повышения качества ответов и соответствия пользовательским ожиданиям. Роль важна для качества взаимодействия пользователей с агентом.

Стек

LLMNLPSQLPPODPOreward modeling

Задачи

  • Разработка и проведение SFT-экспериментов по обучению следованию инструкциям
  • Организация и обучение с использованием RLHF (DPO, PPO)
  • Разработка и обучение reward-моделей для оценки качества ответов
  • Поиск и исправление слабых мест модели, разработка новых навыков
  • Анализ данных экспериментов и формулировка дальнейших гипотез

Обязательно

  • Отличное знание классических ML-методов и NLP
  • Понимание архитектуры современных LLM и опыт работы с ними (прикладной или исследовательский)
  • Опыт работы с данными
  • Уверенное знание SQL
Откликнуться на сайте компании

Похожие вакансии

СОСоюзмультфильм

ИИ - Разработчик

PythonPyTorchOpenCVDocker

Модели и сервисы для автоматизации процессов анимации

Wildberries & RussWildberries & Russ

Middle ML Engineer

PythonPyTorchHuggingFacetransformers

LLM-инструменты и агенты для автоматизации бизнес-процессов

Опыт: от 3 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

ML-разработчик в команду оптимизации архитектур и обучений модели планирования движения

PythonPyTorchCUDAFSDP

Инфраструктура и оптимизация обучения моделей планирования движения

СберСбер

LLM/ ML инженер на core агента (ДКА)

PythonLangChainVector databaseGigaChat

Платформа мультиагентных AI-агентов и инструментов

Опыт: 1–3 года
гибрид, Москва
МТСМТС

Middle Дата аналитик в Скоринг [Big Data, МТС Веб Сервисы]

PythonPySpark

ML-платформа для скоринга B2B-клиентов

гибрид, Москва
CHChoiceit

Middle/Senior Quantitive Researcher

PythonPyTorchNumPyscikit-learn

Системы сигналов и бэктестинга для торговых стратегий

Опыт: 3–6 лет
удалёнка

Смотреть ещё

JobsWave
Найти работу в IT