LamodaLamoda

Инженер по обеспечению надежности машинного обучения (Senior MLOps)

Москва

Команда MLOps развивает инфраструктуру для экспериментов, обучения и промышленного сервинга ML-моделей (batch и online) на CPU/GPU. Роль важна для надёжного, масштабируемого и контролируемого развёртывания моделей и сокращения времени вывода их в продакшен

ГрейдSenior

Стек

PythonKubernetesDockerTerraformTriton Inference ServerBentoMLMLflowHelmPrometheusHPAGPU-инфраструктураLinuxGitLabAnsible

Задачи

  • Разрабатывать и поддерживать платформу инференса для batch и online сценариев
  • Автоматизировать жизненный цикл модели: сборка образов, публикация артефактов, деплой, канареечные релизы, A/B-тесты и откаты
  • Развивать и сопровождать Kubernetes-кластеры, операторы, автоскейлинг и маршрутизацию трафика
  • Организовать мониторинг сервисинга и качества моделей, детектирование дрейфа и деградации
  • Обеспечивать воспроизводимость экспериментов: трекинг, версионирование кода/данных/моделей и изоляцию сред
  • Оптимизировать использование вычислительных ресурсов, включая GPU, с учётом производительности и стоимости

Обязательно

  • Уверенное владение Python для автоматизации и внутренних инструментов
  • Опыт эксплуатации Kubernetes в production: кластеры, операторы, Helm, HPA, ingress, storage
  • Опыт развёртывания инференс-движков в Kubernetes (Triton, BentoML или аналоги)
  • Опыт настройки и эксплуатации GPU-инфраструктуры и контейнеризации (GPU-enabled Docker, драйверы, MIG)
  • Опыт настройки мониторинга и алертинга для ML-сервисов (Prometheus stack и observability)
  • Опыт инфраструктурной автоматизации и IaC: Terraform, Ansible, GitOps-подходы
  • Опыт работы с CI/CD и системами контроля версий (GitLab, Bitbucket и т.п.)

Будет плюсом

  • Опыт работы с системами трекинга экспериментов (MLflow, ClearML)
  • Опыт с сервисами управления признаками и ML-артфактами
  • знание практик безопасности для секретов и чувствительных данных
  • опыт оптимизации inference-пайплайнов и профилирования производительности
Откликнуться на сайте компании

Похожие вакансии

МТСМТС

Senior Devops Engineer [Прогрессоры]

KubernetesHelmPostgreSQLPrometheus

Инфраструктура и CI/CD платформы для сервиса Прогрессоры

Опыт: от 5 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

SRE-инженер в общую облачную платформу Финтеха

PythonKubernetesSQLTerraform

Облачная платформа для стабильной работы финтех-среды

удалёнка, гибрид, Санкт-Петербург
АльфаАльфа

DevOps/ Middle+

PythonKubernetesElasticsearch / ELKKafka

Инфраструктура и CI/CD для систем контроля доступа и антифрода

Опыт: от 3 лет
офис, удалёнка, гибрид, Москва
СберСбер

SRE инженер (AEF)

PythonKubernetesJenkinsArgo CD

Платформа для разработки и исполнения GenAI-агентов

Опыт: от 5 лет
гибрид, Москва
МТСМТС

Ведущий инженер технической поддержки (Цифровой бизнес)

SQLKibanaGrafanaJira

Поддержка и мониторинг цифровых сервисов банка

Опыт: 1–3 года
удалёнка, гибрид, Москва
ДОМ.РФДОМ.РФ

DevOps-инженер (Платформы данных и аналитические системы)/ИТ

GoKubernetesDockerKafka

Инфраструктура data‑платформы и пайплайнов обработки

Опыт: от 5 лет
удалёнка, гибрид, Москва

Смотреть ещё

JobsWave
Найти работу в IT