Site Reliability Engineer
гибрид, удалёнка, Москва
Команда SRE поддерживает инфраструктуру крупнейшего мессенджера: развиваете и автоматизируете эксплуатацию, строите мониторинг и алерты, быстро реагируете на инциденты и проводите постанализ для обеспечения доступности и качества сервиса
ГрейдMiddle/Senior
Опытот 3 лет
Стек
LinuxDockerPrometheusGrafanaGraylogtcpdumpWiresharkPythonGoJavaBash
Задачи
- •Развивать и сопровождать инфраструктуру и операционные процессы
- •Автоматизировать рутинные операции и писать инструменты для эксплуатации
- •Проектировать и поддерживать мониторинг, алерты и дашборды
- •Взаимодействовать со смежными инфраструктурными и командами разработки
- •Оперативно реагировать на инциденты и проводить пост-анализ
Обязательно
- •Опыт работы в SRE/DevOps/системным инженером от 3 лет
- •Прочные знания Linux и сетей (TCP/IP, DNS, HTTP, LB) и анализ трафика (tcpdump/Wireshark)
- •Умение читать и писать код для диагностики и автоматизации (Python, Go, Java, Bash)
- •Опыт с Prometheus/Grafana/Graylog, настройка алертов и бордов
- •Понимание контейнеров и работы с ними; готовность участвовать в дежурствах и инцидентах
Будет плюсом
- •Опыт работы с PostgreSQL/Cassandra/Redis
- •Понимание сопровождения Java-приложений
- •Знание VoIP/real-time звонков и факторов качества (задержка, джиттер, потери)