Инженер по поддержке больших данных
гибрид, Москва
Команда эксплуатации ML-инфраструктуры: вы будете поддерживать кластерные и контейнерные среды для инференса LLM, настраивать мониторинг и алертинг, оперативно расследовать инциденты и автоматизировать диагностику для обеспечения стабильной работы моделей и сервисов
ГрейдJunior/Middle
Опыт1–3 года
Стек
PythonKubernetesVictoriaMetricsPrometheusGrafanaLokiOpenAI-compatible endpointsvLLMLangChainSGLangPromQLSQL
Задачи
- •Поддержка виртуальных машин и контейнерных сред для инференса моделей
- •Настройка и поддержка мониторинга и алертинга, написание PromQL-запросов
- •Эксплуатация микросервисов и трассировка запросов между сервисами
- •Оперативное реагирование на алерты, проведение RCA и подготовка ранбуков
- •Отладка API-запросов к LLM (OpenAI-compatible и локальные inference-серверы)
- •Автоматизация диагностики и рутинных операций скриптами на Python
Обязательно
- •Понимание виртуальных машин, контейнеризации и распределения ресурсов
- •Уверенные навыки работы с Prometheus и Grafana, написание PromQL
- •Опыт работы с Loki для анализа логов
- •Умение анализировать метрики инференса (p95/p99 latency, GPU utilization, queue size)
- •Опыт автоматизации и написания скриптов на Python
- •Опыт отладки API-запросов к LLM (OpenAI-compatible endpoints и локальные inference-серверы)
Будет плюсом
- •Опыт работы с LLM-инференс движками (vLLM, SGLang)
- •Знание LangChain или LangFlow
- •Чтение технической документации на английском языке (B1+)