Старший инженер
удалёнка, гибрид, Москва
В SRE-команде будете обеспечивать доступность и устойчивость сервисов, развивать observability и SRE-практики, а также оптимизировать BigData-кластеры для быстрого выявления и устранения инцидентов. Работа критична для стабильности платформы и скорости восстановления при сбоях.
ГрейдSenior
Опытот 3 лет
Стек
PythonKubernetesClickHousePrometheusKafkaFlinkGrafanaAlertmanagerLokiElasticsearchGoBash
Задачи
- •обеспечение надежности и доступности сервисов (SLA/SLO)
- •анализ и устранение узких мест в инфраструктуре
- •развитие SRE-практик: error budgets и postmortems
- •управление алертами и снижение уровня шума
- •оптимизация работы BigData-кластеров (Kafka, ClickHouse, Flink)
- •автоматизация реагирования на инциденты и взаимодействие с Dev‑командами
Обязательно
- •опыт в SRE/DevOps от 3 лет
- •глубокое понимание SRE-принципов
- •опыт работы с Kubernetes и распределёнными системами
- •навыки настройки и анализа метрик/логов (PromQL, Loki, Elasticsearch)
- •умение писать код для автоматизации (Python, Go, Bash)
- •опыт управления инцидентами и проведения postmortem-аналитики
Будет плюсом
- •опыт оптимизации Kafka, ClickHouse и Flink
- •опыт работы с Grafana и Alertmanager