СберСбер

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

офис, гибрид, Москва

Руководитель направления в команде online RL GigaChat: доведение исследований по post-training и online RL до production-пайплайнов, запуск экспериментов и повышение качества LLM через надежные пайплайны обучения и оптимизацию использования GPU

ГрейдLead

Стек

PythonPyTorchFSDPDeepSpeedonline RLRLHFDPOdistributed training

Задачи

  • Разрабатывать и улучшать методы online RL и post-training
  • Проектировать и проводить ML-эксперименты: гипотезы, конфигурации, анализ результатов
  • Строить и поддерживать пайплайны обучения и data-пайплайны для rollout'ов и reward-сигналов
  • Обеспечивать воспроизводимость: версионирование данных, конфигов и чекпоинтов
  • Оптимизировать throughput и эффективность GPU: distributed training и профилирование
  • Вести взаимодействие с исследователями и инженерами, брать ответственность за фичи от идеи до продакшена

Обязательно

  • Свободное владение Python
  • Опыт работы с PyTorch
  • Практический опыт в LLM post-training (RLHF, online RL, DPO или смежное)
  • Опыт проведения ML-экспериментов от идеи до вывода
  • Понимание distributed training (Data Parallel, FSDP, DeepSpeed или аналоги)
  • Умение писать production-ready, надежный код
  • Умение разбираться в сложных системах и устранять узкие места

Будет плюсом

  • Опыт с reward-моделями и LLM-as-a-judge
  • Опыт построения сред выполнения, sandboxes и верификаторов для code/STEM задач
  • Опыт оптимизации large-scale inference (vLLM и аналоги)
  • Знание современных open-source стеков для обучения LLM (Megatron, TRL и др.)
  • Публикации или вклад в open-source, сильный прикладной трек-рекорд
Откликнуться на сайте компании

Похожие вакансии

ЯндексЯндекс

ML-разработчик в группу инстракт-алаймента планера

PythonPyTorchGPURL

ML-планер траекторий для роботакси и автономных грузовиков

офис, Санкт-Петербург
OzonOzon

Старший Data Scientist, ML Global

PythonPyTorchClickHouseMLflow

R&D моделей для задач NLP и компьютерного зрения

Опыт: 1–3 года
офис, удалёнка, гибрид, Москва
АльфаАльфа

Специалист по разработке нейронных сетей

PythonPyTorchSQLMLflow

RAG- и агентные ML‑сервисы для банковских продуктов

удалёнка, гибрид, Москва
АльфаАльфа

Руководитель направления ИТ-валидации моделей ЮЛ

PythonPySparkHiveHadoop

ИТ-валидация и независимая проверка ML-моделей для сегмента ЮЛ

Опыт: от 3 лет
гибрид, Москва
СберСбер

Senior Data Scientist

PythonSparkGreenPlumHadoop

ML-решения для прогноза продаж и планирования отделений

Опыт: от 3 лет
офис, гибрид, Москва
СберСбер

Middle/Senior ML/DL Engineer в центр Робототехники

PythonPyTorchONNXTensorRT

Модели компьютерного зрения и инференс для промышленных роботов

офис, Москва

Смотреть ещё

JobsWave
Найти работу в IT