Инженер по доступности сервисов в команду Observability
Москва
Работа в команде Observability над развитием мониторинга инфраструктуры и приложений: создание зонтичного мониторинга, внедрение SLI/SLO, траблшутинг и автоматизация процессов для повышения надёжности платформенных продуктов
Стек
PythonKubernetesPostgreSQLPrometheusAlertmanagerOpenSearchLokiVectorOpenTelemetryTempoArgoCDJenkinsGitHub/GitLabHelm charts
Задачи
- •Внедрение и развитие инструментов наблюдаемости и метрик
- •Построение мониторинга инфраструктуры и приложений по стандартам компании
- •Создание зонтичного мониторинга процессов компании
- •Работа с SLI/SLO, настройка и сопровождение показателей надежности
- •Траблшутинг инцидентов, автоматизация и шаблонизация действий при инцидентах
- •Консолидация экспертизы и взаимодействие с платформенными командами и командами разработки
Обязательно
- •Знание и опыт работы с Kubernetes
- •Опыт мониторинга: Prometheus и Alertmanager
- •Опыт работы с системами логирования: OpenSearch или Loki или Vector
- •Опыт с Distributed Tracing: OpenTelemetry и/или Tempo
- •Навыки написания и ревью скриптов (Python, Bash, Go)
- •Понимание SLI/SLO/SLA
- •Опыт работы с CI/CD и инструментами: ArgoCD, Jenkins, GitHub/GitLab и Helm charts
Будет плюсом
- •Опыт с GrafanaOnCall
- •Опыт с Mimir
- •Опыт работы с Sentry
- •Опыт с PostgreSQL
- •Опыт с MongoDB
- •Опыт с load‑balancer/reverse proxy (Nginx, HaProxy)
- •Опыт с публичными облаками (Yandex Cloud, Cloud.ru)
- •Опыт с service‑mesh (Istio)
- •Опыт тестирования отказоустойчивости и нагрузочного тестирования