ЯндексЯндекс

ML-разработчик в команду инфраструктуры претрейна Alice AI LLM

гибрид

Команда инфраструктуры претрейна Alice AI LLM развивает фреймворки и оптимизации для обучения крупных языковых моделей. Вы будете ускорять распределённое обучение, улучшать схемы коммуникаций и реализовывать низкоуровневые оптимизации для экономии GPU и повышения скорости обучения.

ГрейдSenior

Стек

PythonPyTorchYaFSDPYCCLFP8TritonCUDA

Задачи

  • Оптимизация производительности обучения больших языковых моделей (увеличение загрузки GPU)
  • Разработка и улучшение схем коммуникаций для масштабного распределённого обучения (Pipeline, Expert, Context Parallelism)
  • Внедрение и оптимизация YaFSDP и YCCL в пайплайны обучения
  • Низкоуровневые оптимизации с реализацией кода на Triton/CUDA/CuTe DSL
  • Анализ и внедрение методов FP8 и других числовых форматов для ускорения обучения

Обязательно

  • Опыт работы с современными LLM и понимание их архитектуры
  • Уверенное программирование на Python и опыт разработки на PyTorch/Torch
  • Знание процесса обучения DL‑моделей и навыки оптимизаций производительности
  • Понимание распределённого обучения: FSDP vs DDP, применение FP8, знание TP/EP и их компромиссов
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT