Senior LLM Inference Backend Engineer
офис, гибрид, Москва
Команда развивает production-платформу инференса LLM и прикладные AI-сервисы (чат, код-ассистент, code-review). Задача — проектировать и поддерживать GPU-кластеры, оптимизировать latency/throughput, обеспечивать надежность и интеграции в корпоративные системы
ГрейдSenior
Опыт5+ лет
Стек
PythonFastAPIvLLMNVIDIA GPUOpenAI API
Задачи
- •Проектирование и поддержка GPU-кластера инференса (скалирование, балансировка, приоритизация, лимиты)
- •Оптимизация производительности инференса: батчинг, кэширование, управление latency/throughput
- •Разработка и сопровождение AI-сервисов: чат, код-ассистент, code review
- •Проектирование пайплайнов tool/function calling, управление контекстом и обработка ошибок
- •Обеспечение надежности и observability: SLA, мониторинг и предотвращение регрессий
- •Интеграция сервисов с корпоративными API, БД и legacy-системами
Обязательно
- •опыт разработки на Python, знание typing и async, паттернов проектирования
- •опыт разработки высоконагруженных API (FastAPI или аналоги)
- •опыт работы с инструментами инференса (vLLM, OpenAI API или эквиваленты)
- •опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами
- •опыт проектирования и поддержки NVIDIA GPU-кластера инференса
- •опыт обеспечения надежности и observability, выполнение SLA и предотвращение регрессий
- •опыт масштабирования: балансировка, приоритизация запросов и пользовательские лимиты
Будет плюсом
- •опыт работы с MCP и интеграцией MCP
- •опыт разработки на Lua
- •знакомство с мультиагентными системами и оркестрацией агентов
- •опыт проведения A/B-тестов и офлайн-оценок LLM (eval-сеты, human eval)