Старший DevOps-инженер
Москва
Вступите в команду DevOps: вы будете управлять и масштабировать production‑инфраструктуру, поддерживать Kubernetes-кластеры и обеспечивать observability и безопасность сервисов в российских облаках (Yandex Cloud, VK Cloud, Selectel). Роль критична для надёжности и развёртывания LLM-инференса с GPU.
ГрейдSenior
Стек
PythonKubernetesYandex CloudTerraformAnsiblePulumiGitLabTeamCityArgoCDPrometheusGrafanaLokiOpenSearchOpenTelemetryNVIDIA A100NVIDIA H100NVIDIA L40S
Задачи
- •Администрирование и поддержка production‑кластеров Kubernetes (Yandex Managed Service for Kubernetes, VK Cloud Container Service, Selectel Kubernetes)
- •Проектирование и реализация сетей и правил безопасности в облаках РФ (VPC, NAT, VPN, Security Groups)
- •Развёртывание и эксплуатация LLM‑инференс серверов в Kubernetes с поддержкой GPU‑узлов
- •Автоматизация инфраструктуры как кода с Terraform/Ansible/Pulumi
- •Настройка и поддержка CI/CD и GitOps‑пайплайнов (GitLab, TeamCity, ArgoCD)
- •Внедрение мониторинга, логирования и трассировки (Prometheus, Grafana, Loki/ELK, OpenSearch, OpenTelemetry)
Обязательно
- •Опыт администрирования production‑кластеров Kubernetes (Yandex Managed Service for Kubernetes, VK Cloud Container Service, Selectel Kubernetes)
- •Проектирование сетей и безопасности в облаках РФ (VPC, NAT, VPN, Security Groups)
- •Развёртывание и эксплуатация LLM‑инференс серверов (llama.cpp, vLLM, Ollama) с поддержкой NVIDIA GPU
- •Инфраструктура как код: Terraform, Ansible, Pulumi
- •Работа с CI/CD и GitOps: GitLab, TeamCity, ArgoCD
- •Мониторинг и observability: Prometheus, Grafana, Loki/ELK, OpenSearch, OpenTelemetry
- •Автоматизация внутренних сервисов на Python или Go