ML-разработчик в команду инфраструктуры претрейна Alice AI LLM
гибрид
Команда инфраструктуры претрейна Alice AI LLM развивает фреймворки и оптимизации для обучения крупных языковых моделей. Вы будете ускорять распределённое обучение, улучшать схемы коммуникаций и реализовывать низкоуровневые оптимизации для экономии GPU и повышения скорости обучения.
ГрейдSenior
Стек
PythonPyTorchYaFSDPYCCLFP8TritonCUDA
Задачи
- •Оптимизация производительности обучения больших языковых моделей (увеличение загрузки GPU)
- •Разработка и улучшение схем коммуникаций для масштабного распределённого обучения (Pipeline, Expert, Context Parallelism)
- •Внедрение и оптимизация YaFSDP и YCCL в пайплайны обучения
- •Низкоуровневые оптимизации с реализацией кода на Triton/CUDA/CuTe DSL
- •Анализ и внедрение методов FP8 и других числовых форматов для ускорения обучения
Обязательно
- •Опыт работы с современными LLM и понимание их архитектуры
- •Уверенное программирование на Python и опыт разработки на PyTorch/Torch
- •Знание процесса обучения DL‑моделей и навыки оптимизаций производительности
- •Понимание распределённого обучения: FSDP vs DDP, применение FP8, знание TP/EP и их компромиссов