Разработчик инфраструктуры RL-обучения Alice AI LLM
Команда строит распределённую инфраструктуру для обучения и дообучения больших языковых и визуально-языковых моделей с методами Reinforcement Learning. Вы будете оптимизировать доставку данных, коммуникации и отказоустойчивость, а также внедрять и исследовать современные подходы для повышения эффективности обучения
Стек
PythonPyTorchtorch.distributedNVIDIA GPUC++CUDATritonvLLM
Задачи
- •Оптимизировать доставку и сохранение данных для обучения
- •Улучшать коммуникации между блоками распределённого обучения
- •Повышать отказоустойчивость инфраструктуры обучения
- •Развивать инструменты диагностики и быстрого обнаружения проблем
- •Исследовать и внедрять современные решения для RL-инфраструктуры
Обязательно
- •Опыт системного программирования и разработки библиотек на Python
- •Практический опыт с PyTorch и torch.distributed
- •Знание подходов параллелизации: data, tensor, pipeline, expert parallelism
- •Понимание эксплуатации больших LLM в продакшне и MLOps-вызовов
- •Интерес к LLM и методам Reinforcement Learning
- •Умение эффективно работать в команде и делиться знаниями
Будет плюсом
- •Участие в создании инфраструктуры обучения ML-моделей
- •Внедрение и оптимизация RL-решений
- •Опыт с RL-библиотеками (veRL, slime, NeMo-RL, SkyRL) и библиотеками инференса (vLLM, SGLang, TRTLLM)
- •Опыт низкоуровневого программирования и оптимизации на C++
- •Опыт работы с GPU NVIDIA, CUDA или Triton