SRE инженер (SberTech)
Москва
Команда поддержки распределённой облачной инфраструктуры на базе OpenStack-подобной экосистемы и собственного RPM-based дистрибутива. Работать будете над надёжностью платформы, автоматизацией релизов, наблюдаемостью и расследованием инцидентов в production
ГрейдSenior
Стек
LinuxDockerQEMU/KVMAnsibleOpenStackGitGitLab CIrpmbuildPodmanPrometheusGrafanaCephLokiELKOpenSearchRabbitMQKafka
Задачи
- •эксплуатация и развитие production-инфраструктуры cloud (control plane, compute, network, storage)
- •автоматизация деплоя, обновлений, миграций и аудита конфигураций
- •поддержка CI/CD и процессов релизов: канареечные выкладки, rollback, тестирование
- •диагностика и устранение сложных проблем в Linux, сети, хранилищах и виртуализации
- •проектирование и сопровождение SLO/SLI, участие в incident response
- •проведение postmortem/RCA и снижение MTTR
Обязательно
- •глубокие знания Linux: systemd, journalctl, cgroups, namespaces, сетевой стек
- •опыт с контейнерами (Docker и/или Podman), registry, networking, volumes
- •опыт с виртуализацией QEMU/KVM и libvirt (CLI/API), сетевые bridge/overlay
- •опыт работы с CI/CD и системами контроля версий (Git, GitLab CI или аналоги)
- •опыт автоматизации конфигураций (Ansible или аналог)
- •базовый опыт сборки и публикации RPM-пакетов (rpmbuild/mock/koji или аналоги)
Будет плюсом
- •практический опыт эксплуатации OpenStack или его компонентов
- •опыт работы с Ceph и другими распределёнными хранилищами
- •навыки работы с Prometheus/Grafana/Alertmanager или аналогичным стеком наблюдаемости
- •опыт построения централизованных логов (Loki/ELK/OpenSearch)
- •понимание сервисной архитектуры: REST/RPC, message-bus подход (RabbitMQ/Kafka)
- •опыт hardening и базовый security mindset (TLS, секреты, политики доступа)
- •опыт поддержки собственного Linux-дистрибутива и внутренних репозиториев
- •опыт создания/использования AI-агентов и использование GigaChat, Kandinsky и аналогов