ЯндексЯндекс

Разработчик инфраструктуры LLM

Команда работает над инфраструктурой продакшен-инференса больших языковых моделей: повышение доступности и снижение latency при выполнении LLM-инференса на GPU. Роль важна для стабильности сервиса и качества отклика пользователей.

ГрейдSenior

Стек

C++CUDAPythonTensorRT-LLMvLLMsglangNVIDIA

Задачи

  • Оптимизация инференсных движков для снижения latency и повышения throughput
  • Развитие инструментов диагностики для быстрого выявления инфраструктурных проблем
  • Исследование и внедрение методов оптимизации инференса (квантование, прунинг)
  • Внедрение и поддержка подходов параллелизации (Data/Tensor/Pipeline/Expert Parallel)

Обязательно

  • уверенные навыки низкоуровневого программирования и оптимизации на C++ и Python
  • опыт работы с GPU NVIDIA и CUDA, понимание архитектуры GPU
  • глубокое понимание архитектуры Transformer (attention, FFN, нормализация)
  • знание подходов параллелизации: Data Parallel, Tensor Parallel, Pipeline Parallel
  • понимание задач эксплуатации LLM в продакшне и MLOps-практик
  • умение эффективно работать в команде и делиться знаниями

Будет плюсом

  • опыт с решениями для оптимизации инференса: vLLM
  • опыт с TensorRT-LLM (TRT-LLM)
  • знакомство с sglang
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT