Ведущий разработчик Inference-server в отдел ML-инфраструктуры
офис, гибрид, Москва
Команда ML‑инфраструктуры развивает inference‑сервис для быстрого деплоя нейросетей от лёгких CPU‑моделей до больших трансформеров; вы будете развивать core‑часть, многоуровневое кеширование, балансировку, мониторинг и интеграцию с ML‑платформой для ускорения экспериментов и продакшена
ГрейдLead
Опыт3–6 лет
Стек
C++Triton Inference ServerKubeflowSeldon CoreLinux
Задачи
- •Развивать и поддерживать core‑часть сервиса инференса
- •Реализовывать многоуровневое in‑memory/disk/remote кеширование и динамическую балансировку
- •Проектировать и внедрять механизмы деплоя и эксплуатации для CPU/GPU инстансов
- •Интегрировать инференс‑сервисы с единой ML‑платформой
- •Взаимодействовать с внутренними командами и заказчиками, внедрять новые бэкенды
- •Анализировать мировые аналоги и внедрять лучшие практики
Обязательно
- •Опыт программирования не менее пяти лет
- •Уверенные знания C++ или готовность быстро освоить язык
- •Опыт в роли технического лидера и составлении роадмапа сервиса
- •Знания concurrency в C++ и/или глубоко в Linux
- •Ориентация на пользу для бизнеса при принятии технических решений
- •Опыт в мониторинге, доставке, обновлении и эксплуатации моделей в продакшене
Будет плюсом
- •Проектирование и разработка высоконагруженных сервисов на C++
- •Понимание устройства нейронных моделей и интерес к исследованиям в ML
- •Опыт развёртывания и эксплуатации inference на CPU/GPU
- •Знакомство с Triton и TRT LLM
- •Глубокое знание Unix/Linux internals