Точка БанкТочка Банк

Inference - инженер

удалёнка, офис

Команда развивает внутреннюю LLM‑платформу: gateway, инференс, retrieval и guardrails. Вы будете строить высокопроизводительный inference‑слой и инструменты деплоя, чтобы обеспечить стабильную и масштабируемую работу ML‑сервисов в продукте банка

ГрейдMiddle/Senior
Опытот 4 лет

Стек

PythonFastAPIKubernetesCI/CDasyncioaiohttp

Задачи

  • Разрабатывать высокопроизводительные сервисы для инференса моделей
  • Оптимизировать токенизацию, динамический батчинг и использование CPU/GPU ресурсов
  • Настраивать и поддерживать деплой ML‑сервисов и CI/CD-пайплайны
  • Работать с Kubernetes и инфраструктурой для масштабирования сервисов
  • Поддерживать стабильность: мониторинг, алертинг, code review и техдолг
  • Проводить R&D и внедрять методы оптимизации инференс‑платформы

Обязательно

  • Опыт с Python, asyncio, aiohttp и FastAPI от 4 лет
  • Опыт работы с ML‑инфраструктурой и разворачиванием ML/LLM‑сервисов
  • Опыт настройки CI/CD и работы с Kubernetes
  • Понимание принципов работы LLM и ограничений моделей
  • Умение оптимизировать производительность сервисов: токенизация, батчинг, асинхронность, управление ресурсами CPU/GPU
  • Навыки поддержки стабильности сервисов: мониторинг, алерты, code review

Будет плюсом

  • Опыт работы с vLLM или SGLang на уровне инженера
  • Опыт GPU‑оптимизаций и написания GPU‑kernels (CUDA/Triton)
  • Практика патчинга и глубокой настройки инференс‑движков
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT