СоларСолар

SRE / Site Reliability Engineer

Команда SRE ищет инженера для повышения наблюдаемости и устойчивости продакшен-сервисов: расследование инцидентов, автоматизация сбора диагностики и построение SLI/SLO и алёртов. Роль важна для снижения MTTR и минимизации влияния инцидентов на клиентов

ГрейдSenior

Стек

PythonPrometheusELK StackAnsibleGoJavaC/C++TerraformGrafanaLinuxGDB

Задачи

  • Проведение глубокого RCA по дампам памяти, тред-дампам, логам и сетевым снятиям
  • Участие в ротации P1/P2-инцидентов и организация Blameless Post-Mortem
  • Разработка скриптов и ботов на Python/Go для автоматического сбора диагностической информации
  • Проектирование SLI/SLO, настройка дашбордов и корреляционных алертов в Grafana/Prometheus
  • Написание Runbooks/Playbooks для первой линии поддержки
  • Взаимодействие с командами разработки по исправлению критичных багов

Обязательно

  • Опыт эксплуатации Linux (Debian/Ubuntu/CentOS и др.)
  • Опыт эксплуатации высоконагруженных распределённых систем (от 5000+ RPS)
  • Умение проводить глубокий анализ сетевого трафика (PCAP) и TLS/SSL-handshake
  • Опыт работы с Java (анализ тред-дампов, heap dumps) и C/C++ (core dumps)
  • Уверенное владение Python для написания утилит и скриптов
  • Опыт построения мониторинга с Prometheus и визуализаций в Grafana
  • Опыт работы с ELK Stack или Splunk и сложными поисковыми запросами
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT