Разработчик инфраструктуры LLM
Команда работает над инфраструктурой продакшен-инференса больших языковых моделей: повышение доступности и снижение latency при выполнении LLM-инференса на GPU. Роль важна для стабильности сервиса и качества отклика пользователей.
ГрейдSenior
Стек
C++CUDAPythonTensorRT-LLMvLLMsglangNVIDIA
Задачи
- •Оптимизация инференсных движков для снижения latency и повышения throughput
- •Развитие инструментов диагностики для быстрого выявления инфраструктурных проблем
- •Исследование и внедрение методов оптимизации инференса (квантование, прунинг)
- •Внедрение и поддержка подходов параллелизации (Data/Tensor/Pipeline/Expert Parallel)
Обязательно
- •уверенные навыки низкоуровневого программирования и оптимизации на C++ и Python
- •опыт работы с GPU NVIDIA и CUDA, понимание архитектуры GPU
- •глубокое понимание архитектуры Transformer (attention, FFN, нормализация)
- •знание подходов параллелизации: Data Parallel, Tensor Parallel, Pipeline Parallel
- •понимание задач эксплуатации LLM в продакшне и MLOps-практик
- •умение эффективно работать в команде и делиться знаниями
Будет плюсом
- •опыт с решениями для оптимизации инференса: vLLM
- •опыт с TensorRT-LLM (TRT-LLM)
- •знакомство с sglang