MLOps engineer
удалёнка, гибрид, Москва
Команда отвечает за ML/LLM-платформу и инструменты для ML‑команд. Вы будете разворачивать и масштабировать Kubernetes‑инфраструктуру, поддерживать MLOps/AIOps‑сервисы и обеспечивать CI/CD, мониторинг и управление жизненным циклом моделей для надёжной доставки ML‑фич
ГрейдSenior
Опытот 3 лет
Стек
PythonKubernetesMLflowAirflowDVCTritonvLLMLLM GatewayCI/CDLinux
Задачи
- •Развёртывание и развитие инфраструктуры ML/LLM платформы на Kubernetes
- •Поддержка и доработка MLOps/AIOps инструментов (Airflow, MLflow, JupyterHub, DVC и др.)
- •Проектирование и развитие ML/LLM пайплайнов полного цикла
- •Разработка системы управления жизненным циклом моделей и внутренних инструментов для ML‑команд
- •Масштабирование и оптимизация CPU/GPU ресурсов и кластеров Kubernetes
- •Настройка CI/CD, мониторинга, логирования и алертинга для ML сервисов
Обязательно
- •Опыт работы в SRE/DevOps/Infrastructure от 3 лет
- •Опыт администрирования и эксплуатации Kubernetes кластеров
- •Уверенные знания Linux и поддержки production‑инфраструктуры
- •Навыки разработки на Python (скрипты автоматизации, сервисы, asyncio/multiprocessing)
- •Опыт с CI/CD, automation tooling, мониторингом, логированием и observability
Будет плюсом
- •Опыт работы с MLflow, Airflow, DVC и JupyterHub
- •Знание Triton, vLLM, LLM Gateway и inference-инструментов
- •Опыт управления GPU‑ресурсами и оптимизации ML‑нагрузок