GPU Performance Engineer
офис, удалёнка, гибрид
Команда отвечает за эффективное использование GPU для 150+ продуктов Яндекса на базе ИИ. Вы будете оптимизировать производительность и утилизацию GPU, строить инструменты диагностики и внедрять решения для масштабируемого обучения и инференса, повышая стабильность и экономическую отдачу инфраструктуры
Стек
PythonPyTorchCUDANVIDIAtorch.distributedNsightnvprofvLLMSGLangTRTLLMveRLslimeNeMo-RLSkyRL
Задачи
- •Повышение эффективности утилизации GPU: формирование гипотез, реализация и внедрение решений
- •Оптимизация и профилирование: поиск и устранение bottlenecks, оптимизация memory access, kernels, latency и throughput
- •Развитие инструментов диагностики для быстрого выявления инфраструктурных проблем
- •Исследование и внедрение современных решений для обучения и инференса
- •Анализ архитектуры, тестирование, интеграция: оценка аппаратных решений, разработка планов тестирования и бенчмарков, анализ регрессий производительности
Обязательно
- •Знание Python и опыт системного программирования, разработка библиотек или фреймворков
- •Опыт работы с PyTorch и torch.distributed
- •Знание подходов параллелизации: data parallelism, tensor parallelism, pipeline parallelism, expert parallelism
- •Опыт работы с GPU (NVIDIA) и CUDA, разработка или оптимизация алгоритмов под CUDA
- •Умение оптимизировать производительность GPU-приложений и повысить утилизацию GPU
- •Навыки анализа профилей и метрик производительности и умение читать и оптимизировать сложный код
- •Умение эффективно работать в команде и делиться знаниями
Будет плюсом
- •Уверенное владение C/C++ или аналогичными низкоуровневыми языками
- •Опыт с RL-библиотеками: veRL, slime, NeMo-RL, SkyRL
- •Опыт с библиотеками инференса: vLLM, SGLang, TRTLLM
- •Опыт оптимизации под production нагрузки, low-latency или real-time систем