Старший инженер мониторинга
офис, удалёнка, гибрид, Москва
Команда Incident & Problem Management развивает системы метрик, алертов, логов и дашбордов для повышения стабильности Авито. Вы будете улучшать мониторинг и качество сервисов, снижать количество инцидентов и ускорять реакцию команды на проблемы
ГрейдSenior
Опыт1–3 года
Стек
PrometheusGrafanaELKZabbixGraphiteLinuxKubernetesGit
Задачи
- •вести проектные стримы по развитию мониторинга от идеи до метрик
- •улучшать качество алертов: внедрять новые, устранять шум и false positive
- •контролировать и отслеживать SLA/SLO, подсвечивать отклонения
- •развивать инструменты и документацию мониторинга
- •онбордить новичков, проводить технические интервью и вести встречи в отсутствие тимлида
Обязательно
- •опыт в мониторинге, SRE или DevOps от 2 лет
- •опыт работы в сменном графике 24/7
- •уверенные знания Linux и разбора production-проблем на хосте и приложении
- •знание систем мониторинга: Prometheus, Grafana, Zabbix, ELK и умение писать/оптимизировать запросы
- •понимание работы микросервисов в продакшене и опыт работы с Git
- •умение декомпозировать стримы, отвечать за метрики и доводить задачи до результата
Будет плюсом
- •опыт наставничества и работы на позиции сеньора/лида
- •опыт снижения alert noise и улучшения качества алертов
- •участие в postmortem/RCA и улучшении процессов после инцидентов
- •умение автоматизировать рутину на Python, Go, Bash
- •опыт работы с Kubernetes, контейнерами, Service Discovery и Tracing
- •опыт построения метрик и дашбордов для MTTA/MTTD/FRT/SLA/SLO