MLE (Online RL) / Post-Training LLM (Middle+ / Senior)
Москва
Команда GigaChat ищет ML-инженера для разработки и внедрения online RL и post-training решений: от экспериментов до production-пайплайнов обучения. Работа напрямую влияет на качество модели и продуктовые метрики
ГрейдMiddle/Senior
Стек
PythonPyTorchDeepSpeedvLLMFSDPData ParallelRLHFDPOTRLMegatron
Задачи
- •Разрабатывать и улучшать методы online RL и post-training
- •Проектировать и проводить ML-эксперименты: гипотезы, конфигурации, анализ результатов
- •Строить и поддерживать пайплайны обучения и инфраструктуру (rollout, сбор reward, обновление весов)
- •Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов и чекпоинтов
- •Оптимизировать эффективность использования GPU и distributed training
- •Проектировать reward-сигналы и пайплайны подготовки данных для обучения
Обязательно
- •Отличное владение Python и PyTorch
- •Практический опыт в LLM post-training: RLHF, online RL, DPO или смежные подходы
- •Опыт проведения ML-экспериментов от постановки гипотезы до анализа и выводов
- •Знание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги
- •Умение писать чистый production-ready код
- •Способность разбираться в сложных системах и устранять узкие места
Будет плюсом
- •Опыт работы с reward-моделями и LLM-as-a-judge
- •Опыт построения сред исполнения, sandboxes и верификаторов для code/STEM задач
- •Опыт оптимизации large-scale inference (vLLM, Sglang и т.п.)
- •Знание open-source стеков для обучения LLM (Verl, Megatron, TRL и др.)
- •Публикации или вклад в open-source