ЯндексЯндекс

Разработчик инфраструктуры RL-обучения Alice AI LLM

Команда строит распределённую инфраструктуру для обучения и дообучения больших языковых и визуально-языковых моделей с методами Reinforcement Learning. Вы будете оптимизировать доставку данных, коммуникации и отказоустойчивость, а также внедрять и исследовать современные подходы для повышения эффективности обучения

Стек

PythonPyTorchtorch.distributedNVIDIA GPUC++CUDATritonvLLM

Задачи

  • Оптимизировать доставку и сохранение данных для обучения
  • Улучшать коммуникации между блоками распределённого обучения
  • Повышать отказоустойчивость инфраструктуры обучения
  • Развивать инструменты диагностики и быстрого обнаружения проблем
  • Исследовать и внедрять современные решения для RL-инфраструктуры

Обязательно

  • Опыт системного программирования и разработки библиотек на Python
  • Практический опыт с PyTorch и torch.distributed
  • Знание подходов параллелизации: data, tensor, pipeline, expert parallelism
  • Понимание эксплуатации больших LLM в продакшне и MLOps-вызовов
  • Интерес к LLM и методам Reinforcement Learning
  • Умение эффективно работать в команде и делиться знаниями

Будет плюсом

  • Участие в создании инфраструктуры обучения ML-моделей
  • Внедрение и оптимизация RL-решений
  • Опыт с RL-библиотеками (veRL, slime, NeMo-RL, SkyRL) и библиотеками инференса (vLLM, SGLang, TRTLLM)
  • Опыт низкоуровневого программирования и оптимизации на C++
  • Опыт работы с GPU NVIDIA, CUDA или Triton
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT