Бэкенд-разработчик в команду голосовых технологий
Команда развивает бэкенд‑инфраструктуру для ASR и TTS, которые используются в продуктах Яндекса. Вы будете проектировать и разрабатывать высоконагруженные gRPC‑сервисы и оптимизировать инференс нейросетей для низкой задержки и высокой стабильности.
ГрейдSenior
Стек
C++gRPCCUDAPyTorchTensorRT-LLMvLLMSGLangTritonNVIDIA GPU
Задачи
- •Внедрять и адаптировать новые модели TTS и ASR в сервисы
- •Проектировать и разрабатывать производительные gRPC‑сервисы на C++
- •Оптимизировать инференс: батчинг, квантование, кеширование
- •Исследовать и внедрять движки инференса (vLLM, TensorRT-LLM, SGLang)
- •Поддерживать надёжность: мониторинг, метрики, логирование, автоматизация релизов
Обязательно
- •Уверенное владение C++, желательно C++17 и выше
- •Опыт разработки высоконагруженных бэкенд‑сервисов с контролем latency и throughput
- •Умение находить и устранять утечки памяти и деградацию производительности под нагрузкой
- •Базовые знания ML и знакомство с PyTorch
- •Опыт разработки тестируемого и отказоустойчивого кода
- •Опыт работы с оптимизацией инференса нейросетей
Будет плюсом
- •Знакомство с фреймворками инференса LLM: SGLang, vLLM, TensorRT-LLM
- •Опыт разработки/оптимизации под GPU с использованием CUDA или Triton
- •Понимание архитектуры NVIDIA GPU