ЯндексЯндекс

Старший DL-разработчик в команду ризонинга

гибрид

Команда работает над развитием режима рассуждений (reasoning) для LLM Alice: создание данных, улучшение функций награды и исследований процедур RL-обучения. Роль важна для повышения качества ответов модели и её применения в разнообразных задачах пользователей.

ГрейдSenior

Стек

PythonTransformervLLMVERLSGLangReinforcement LearningPPOGAEраспределённое обучение

Задачи

  • создание и аннотирование наборов данных для рассуждающих задач
  • разработка и оптимизация функций награды для RL-обучения
  • исследование и настройка процедур обучения (on-policy/off-policy, advantage estimation и entropy management)
  • эксперименты с архитектурами и алгоритмами обучения для больших Transformer-моделей

Обязательно

  • отличное знание математики, алгоритмов и структур данных
  • умение программировать на Python
  • понимание и опыт с Reinforcement Learning (GAE, PPO и другие методы policy optimization)
  • практический опыт распределённого обучения больших Transformer-моделей
  • понимание стадии alignment современных LLM

Будет плюсом

  • опыт обучения reasoning/рассуждающих моделей
  • опыт работы с инфраструктурой для RL-обучения: VERL, vLLM, SGLang
Откликнуться на сайте компании

Похожие вакансии

СОСоюзмультфильм

ИИ - Разработчик

PythonPyTorchOpenCVDocker

Модели и сервисы для автоматизации процессов анимации

Wildberries & RussWildberries & Russ

Middle ML Engineer

PythonPyTorchHuggingFacetransformers

LLM-инструменты и агенты для автоматизации бизнес-процессов

Опыт: от 3 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

ML-разработчик в команду оптимизации архитектур и обучений модели планирования движения

PythonPyTorchCUDAFSDP

Инфраструктура и оптимизация обучения моделей планирования движения

СберСбер

LLM/ ML инженер на core агента (ДКА)

PythonLangChainVector databaseGigaChat

Платформа мультиагентных AI-агентов и инструментов

Опыт: 1–3 года
гибрид, Москва
МТСМТС

Middle Дата аналитик в Скоринг [Big Data, МТС Веб Сервисы]

PythonPySpark

ML-платформа для скоринга B2B-клиентов

гибрид, Москва
CHChoiceit

Middle/Senior Quantitive Researcher

PythonPyTorchNumPyscikit-learn

Системы сигналов и бэктестинга для торговых стратегий

Опыт: 3–6 лет
удалёнка

Смотреть ещё

JobsWave
Найти работу в IT