Руководитель команды CUDA-инференса в Автономный транспорт
гибрид, офис, Санкт-Петербург
Руководство командой, которая проектирует и ускоряет инференс моделей автономного вождения на GPU и ускорителях. Работа включает разработку CUDA‑ядер, профилирование и достижение измеримого улучшения latency/throughput на целевой платформе.
ГрейдLead
Стек
C++CUDAPyTorchTensorRTONNXCUTLASSTritonNsight
Задачи
- •руководство командой CUDA‑оптимизации и people management
- •формирование технического вектора, планов и приоритетов
- •проектирование и оптимизация CUDA‑ядер для matmul/conv/attention
- •профилирование производительности и устранение bottleneck
- •достижение измеримого ускорения в end‑to‑end сценариях
Обязательно
- •сильный опыт CUDA performance engineering
- •опыт разработки/оптимизации kernel для matmul/conv/attention
- •хорошее знание C++
- •понимание memory hierarchy GPU и cost model операций
- •умение профилировать и доводить оптимизации до измеримого ускорения
- •способность к техническому лидерству или управлению командой
- •умение аргументировать performance‑решения и работать кросс‑командно
Будет плюсом
- •опыт с CUTLASS, Triton или кастомными inference‑движками
- •оптимизация под конкретные GPU‑архитектуры
- •работа с quantization и mixed precision
- •построение roofline‑моделей и latency/bandwidth‑оценок
- •знание fusion‑подходов и graph‑level оптимизаций