Инженер по обеспечению надежности машинного обучения (Senior MLOps)
Москва
Команда MLOps развивает инфраструктуру для экспериментов, обучения и промышленного сервинга ML-моделей (batch и online) на CPU/GPU. Роль важна для надёжного, масштабируемого и контролируемого развёртывания моделей и сокращения времени вывода их в продакшен
ГрейдSenior
Стек
PythonKubernetesDockerTerraformTriton Inference ServerBentoMLMLflowHelmPrometheusHPAGPU-инфраструктураLinuxGitLabAnsible
Задачи
- •Разрабатывать и поддерживать платформу инференса для batch и online сценариев
- •Автоматизировать жизненный цикл модели: сборка образов, публикация артефактов, деплой, канареечные релизы, A/B-тесты и откаты
- •Развивать и сопровождать Kubernetes-кластеры, операторы, автоскейлинг и маршрутизацию трафика
- •Организовать мониторинг сервисинга и качества моделей, детектирование дрейфа и деградации
- •Обеспечивать воспроизводимость экспериментов: трекинг, версионирование кода/данных/моделей и изоляцию сред
- •Оптимизировать использование вычислительных ресурсов, включая GPU, с учётом производительности и стоимости
Обязательно
- •Уверенное владение Python для автоматизации и внутренних инструментов
- •Опыт эксплуатации Kubernetes в production: кластеры, операторы, Helm, HPA, ingress, storage
- •Опыт развёртывания инференс-движков в Kubernetes (Triton, BentoML или аналоги)
- •Опыт настройки и эксплуатации GPU-инфраструктуры и контейнеризации (GPU-enabled Docker, драйверы, MIG)
- •Опыт настройки мониторинга и алертинга для ML-сервисов (Prometheus stack и observability)
- •Опыт инфраструктурной автоматизации и IaC: Terraform, Ansible, GitOps-подходы
- •Опыт работы с CI/CD и системами контроля версий (GitLab, Bitbucket и т.п.)
Будет плюсом
- •Опыт работы с системами трекинга экспериментов (MLflow, ClearML)
- •Опыт с сервисами управления признаками и ML-артфактами
- •знание практик безопасности для секретов и чувствительных данных
- •опыт оптимизации inference-пайплайнов и профилирования производительности