Inference - инженер
удалёнка, офис
Команда развивает внутреннюю LLM‑платформу: gateway, инференс, retrieval и guardrails. Вы будете строить высокопроизводительный inference‑слой и инструменты деплоя, чтобы обеспечить стабильную и масштабируемую работу ML‑сервисов в продукте банка
ГрейдMiddle/Senior
Опытот 4 лет
Стек
PythonFastAPIKubernetesCI/CDasyncioaiohttp
Задачи
- •Разрабатывать высокопроизводительные сервисы для инференса моделей
- •Оптимизировать токенизацию, динамический батчинг и использование CPU/GPU ресурсов
- •Настраивать и поддерживать деплой ML‑сервисов и CI/CD-пайплайны
- •Работать с Kubernetes и инфраструктурой для масштабирования сервисов
- •Поддерживать стабильность: мониторинг, алертинг, code review и техдолг
- •Проводить R&D и внедрять методы оптимизации инференс‑платформы
Обязательно
- •Опыт с Python, asyncio, aiohttp и FastAPI от 4 лет
- •Опыт работы с ML‑инфраструктурой и разворачиванием ML/LLM‑сервисов
- •Опыт настройки CI/CD и работы с Kubernetes
- •Понимание принципов работы LLM и ограничений моделей
- •Умение оптимизировать производительность сервисов: токенизация, батчинг, асинхронность, управление ресурсами CPU/GPU
- •Навыки поддержки стабильности сервисов: мониторинг, алерты, code review
Будет плюсом
- •Опыт работы с vLLM или SGLang на уровне инженера
- •Опыт GPU‑оптимизаций и написания GPU‑kernels (CUDA/Triton)
- •Практика патчинга и глубокой настройки инференс‑движков