Разработчик Inference Server на C++ в отдел ML-инфраструктуры
офис, гибрид, Москва
Команда ML‑инфраструктуры развивает коробочное решение для запуска и доставки ML‑моделей в продакшен; вы будете развивать инференс‑сервисы на C++, обеспечивать производительность и удобство интеграции для ML‑команд компании
ГрейдJunior/Middle
Опыт1–3 года
Стек
C++Triton Inference ServerLinuxGPUTRT-LLMKubernetesSeldon CoreKubeflow
Задачи
- •Развитие коробочного решения для инференса
- •Реализация балансировки и оптимизации выполнения запросов
- •Внедрение многоуровневого кеширования и управления конфигами
- •Разработка инструментов деплоя и поднятия сервисов в облаке
- •Взаимодействие с внутренними командами и поддержка интеграций
Обязательно
- •опыт программирования не менее двух лет
- •уверенное владение C++ или готовность быстро разобраться
- •знание concurrency в C++ или в Linux
- •понимание принципов работы Unix/Linux (процессы, системные вызовы)
Будет плюсом
- •опыт разработки высоконагруженных сервисов на C++
- •опыт развёртывания и эксплуатации inference на CPU/GPU
- •знакомство с Triton и TRT-LLM
- •знание/понимание устройства нейронных моделей
- •опыт работы с KServe/Seldon Core/Kubeflow