Ведущий SRE-инженер (Kubernetes, Observability)
офис, удалёнка, Москва
Работа в продуктовой команде SRE: развитие практик надежности, мониторинга и SLA/SLO для микросервисной платформы. Повысите доступность сервисов, автоматизируете CI/CD и расследуете инциденты для снижения простоев
ГрейдLead
Стек
KubernetesPrometheusGrafanaELKOpenTelemetryLokiCI/CD
Задачи
- •Определение и внедрение SLA, SLO и SLI
- •Разработка и улучшение мониторинга, алертинга и observability
- •Расследование инцидентов, проведение RCA и postmortem
- •Анализ производительности и снижение latency
- •Настройка масштабирования Kubernetes и повышение отказоустойчивости
- •Оптимизация CI/CD-процессов и автоматизация рутинных операций
Обязательно
- •Опыт работы в роли SRE/Production Engineer/DevOps
- •Глубокое понимание SLA / SLO / SLI
- •Эксплуатация Kubernetes в production
- •Опыт работы с микросервисной архитектурой
- •Знание инструментов observability (Prometheus, Grafana, ELK, OpenTelemetry, Loki и т.п.)
- •Опыт расследования инцидентов и проведения RCA/postmortem