Customer Reliability Engineer в Яндекс 360
гибрид, офис, Москва
Команда on‑premise отвечает за поставку Яндекс 360 в закрытые контуры корпоративных клиентов. Вы будете работать с инсталляциями на стороне заказчика, решать критические инциденты, улучшать надёжность и автоматизировать процессы, чтобы сервисы стабильно работали в сложных корпоративных средах
ГрейдMiddle/Senior
Стек
PythonKubernetesPostgreSQLDockerS3AnsiblePrometheusGrafanaELKBashLinuxstracetcpdumplsofperf
Задачи
- •Разбор сложных инцидентов и проведение Root Cause Analysis по логам, дампам и сетевому трафику
- •Эксплуатация и развёртывание on‑premise инсталляций у заказчиков в гетерогенных средах
- •Автоматизация рутины: скрипты на Python/Bash и создание плейбуков
- •Диагностика проблем ядра Linux, дисковой подсистемы и сетей
- •Взаимодействие с разработчиками для передачи полевых наблюдений и улучшения продукта
- •Коммуникация с техспециалистами заказчика и сопровождение обновлений
Обязательно
- •Глубокие знания Linux (память, процессы, дисковая подсистема, namespaces)
- •Уверенное использование strace, tcpdump, lsof, perf
- •Знание сетевых протоколов TCP/IP, DNS, балансировки L3/L7 и диагностики сетей
- •Опыт работы с PostgreSQL и S3‑совместимыми хранилищами, умение писать SQL
- •Практическое программирование для автоматизации на Python и Bash
- •Опыт с контейнеризацией Docker/Containerd и оркестраторами Kubernetes
- •Эмпатия и готовность глубоко погружаться в проблемы клиентов
Будет плюсом
- •Опыт в роли SRE, DevOps или системного администратора в HighLoad‑проектах
- •Опыт работы с Ansible
- •Опыт с мониторингом: Prometheus, Grafana, ELK‑стек
- •Знание CI/CD процессов