ЯндексЯндекс

Старший LLM-разработчик в команду рассуждений Alice AI LLM

гибрид

Команда улучшает способности рассуждений семейства Alice AI LLM: вы будете исследовать и внедрять методы RLVR/RLHF, схемы reward‑моделей и дистилляции для единой модели, повышающей качество ответов и цепочек рассуждений для массовых B2C‑задач

ГрейдSenior

Стек

PythonLLMRLHFRLVRMoEдистилляцияon-policy RLасинхронные RL-алгоритмыreward-модели

Задачи

  • Масштабирование и проведение экспериментов RLVR- и RLHF-обучения reasoning‑моделей
  • Исследование и разработка reward‑моделей и этапов алайнмента
  • Объединение сигналов из разных задач в единой модели и дистилляция
  • Улучшение качества цепочек рассуждений: backtracking, верификация и структура ответов
  • Тестирование on‑policy и асинхронных RL‑алгоритмов и методов стабилизации обучения

Обязательно

  • Экспертные знания в NLP и классическом ML
  • Умение программировать на Python
  • Понимание современных LLM и опыт решения прикладных задач или релевантный исследовательский опыт
  • Практические знания и опыт применения RLHF и/или RLVR
  • Опыт работы с reward‑моделями и методиками дистилляции

Будет плюсом

  • Опыт с MoE‑архитектурами
  • Опыт применения on‑policy и асинхронных RL‑алгоритмов
  • Практика дистилляции и объединения сигналов из разных доменов
  • Опыт стабилизации обучения для Dense и MoE‑моделей
Откликнуться на сайте компании

Похожие вакансии

СОСоюзмультфильм

ИИ - Разработчик

PythonPyTorchOpenCVDocker

Модели и сервисы для автоматизации процессов анимации

Wildberries & RussWildberries & Russ

Middle ML Engineer

PythonPyTorchHuggingFacetransformers

LLM-инструменты и агенты для автоматизации бизнес-процессов

Опыт: от 3 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

ML-разработчик в команду оптимизации архитектур и обучений модели планирования движения

PythonPyTorchCUDAFSDP

Инфраструктура и оптимизация обучения моделей планирования движения

СберСбер

LLM/ ML инженер на core агента (ДКА)

PythonLangChainVector databaseGigaChat

Платформа мультиагентных AI-агентов и инструментов

Опыт: 1–3 года
гибрид, Москва
МТСМТС

Middle Дата аналитик в Скоринг [Big Data, МТС Веб Сервисы]

PythonPySpark

ML-платформа для скоринга B2B-клиентов

гибрид, Москва
CHChoiceit

Middle/Senior Quantitive Researcher

PythonPyTorchNumPyscikit-learn

Системы сигналов и бэктестинга для торговых стратегий

Опыт: 3–6 лет
удалёнка

Смотреть ещё

JobsWave
Найти работу в IT