YADROYADRO

Senior LLM Inference Backend Engineer

офис, гибрид, Москва

Команда развивает production-платформу инференса LLM и прикладные AI-сервисы (чат, код-ассистент, code-review). Задача — проектировать и поддерживать GPU-кластеры, оптимизировать latency/throughput, обеспечивать надежность и интеграции в корпоративные системы

ГрейдSenior
Опыт5+ лет

Стек

PythonFastAPIvLLMNVIDIA GPUOpenAI API

Задачи

  • Проектирование и поддержка GPU-кластера инференса (скалирование, балансировка, приоритизация, лимиты)
  • Оптимизация производительности инференса: батчинг, кэширование, управление latency/throughput
  • Разработка и сопровождение AI-сервисов: чат, код-ассистент, code review
  • Проектирование пайплайнов tool/function calling, управление контекстом и обработка ошибок
  • Обеспечение надежности и observability: SLA, мониторинг и предотвращение регрессий
  • Интеграция сервисов с корпоративными API, БД и legacy-системами

Обязательно

  • опыт разработки на Python, знание typing и async, паттернов проектирования
  • опыт разработки высоконагруженных API (FastAPI или аналоги)
  • опыт работы с инструментами инференса (vLLM, OpenAI API или эквиваленты)
  • опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами
  • опыт проектирования и поддержки NVIDIA GPU-кластера инференса
  • опыт обеспечения надежности и observability, выполнение SLA и предотвращение регрессий
  • опыт масштабирования: балансировка, приоритизация запросов и пользовательские лимиты

Будет плюсом

  • опыт работы с MCP и интеграцией MCP
  • опыт разработки на Lua
  • знакомство с мультиагентными системами и оркестрацией агентов
  • опыт проведения A/B-тестов и офлайн-оценок LLM (eval-сеты, human eval)
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT