SRE / Site Reliability Engineer
Команда SRE ищет инженера для повышения наблюдаемости и устойчивости продакшен-сервисов: расследование инцидентов, автоматизация сбора диагностики и построение SLI/SLO и алёртов. Роль важна для снижения MTTR и минимизации влияния инцидентов на клиентов
ГрейдSenior
Стек
PythonPrometheusELK StackAnsibleGoJavaC/C++TerraformGrafanaLinuxGDB
Задачи
- •Проведение глубокого RCA по дампам памяти, тред-дампам, логам и сетевым снятиям
- •Участие в ротации P1/P2-инцидентов и организация Blameless Post-Mortem
- •Разработка скриптов и ботов на Python/Go для автоматического сбора диагностической информации
- •Проектирование SLI/SLO, настройка дашбордов и корреляционных алертов в Grafana/Prometheus
- •Написание Runbooks/Playbooks для первой линии поддержки
- •Взаимодействие с командами разработки по исправлению критичных багов
Обязательно
- •Опыт эксплуатации Linux (Debian/Ubuntu/CentOS и др.)
- •Опыт эксплуатации высоконагруженных распределённых систем (от 5000+ RPS)
- •Умение проводить глубокий анализ сетевого трафика (PCAP) и TLS/SSL-handshake
- •Опыт работы с Java (анализ тред-дампов, heap dumps) и C/C++ (core dumps)
- •Уверенное владение Python для написания утилит и скриптов
- •Опыт построения мониторинга с Prometheus и визуализаций в Grafana
- •Опыт работы с ELK Stack или Splunk и сложными поисковыми запросами