Старший инженер доступности
Москва
Команда SRE развивает и поддерживает облачную платформу и инфраструктуру как код для одного из продуктов. Роль фокусируется на Kubernetes/Helm, переводе на Ansible IaC, эксплуатации высоконагруженных дата-платформ и обеспечении наблюдаемости и отказоустойчивости
ГрейдSenior
Стек
PythonKubernetesPostgreSQLAnsibleHelmClickHouseKafkaRedisS3GitLabJenkinsPrometheusGrafanaLokiPyroscopeBash
Задачи
- •Развитие облачной платформы и инфраструктуры как кода с Ansible
- •Проектирование и совершенствование платформы на базе Kubernetes и управление через Helm
- •Перевод legacy‑инфраструктуры на IaC и выработка единых стандартов конфигурации
- •Эксплуатация и администрирование высоконагруженных дата‑платформ (ClickHouse, PostgreSQL, Kafka, Redis, S3)
- •Настройка и поддержка CI/CD конвейеров (GitLab/Jenkins) и автоматизаций
- •Построение наблюдаемости: Prometheus/Grafana/Loki/Pyroscope, дашборды и алерты; анализ и расследование инцидентов
Обязательно
- •Глубокие знания Linux (RPM‑based)
- •Опыт работы с Ansible (роли, модули, коллекции) и подходом IaC
- •Навыки контейнеризации и оркестрации через Kubernetes и Helm
- •Опыт настройки и поддержки CI/CD (GitLab или Jenkins)
- •Администрирование ClickHouse, PostgreSQL, Kafka, Redis и S3‑подобных хранилищ
- •Опыт работы с системами наблюдаемости (Prometheus, Grafana, Loki, Pyroscope) и создание алертинга
- •Умение программировать на Bash или Python и эксплуатировать высоконагруженные системы
Будет плюсом
- •Опыт разработки сервисов на Go
- •Знание ArgoCD/FluxCD
- •Опыт работы с PKCS#11