СберСбер

SRE-инженер (Команда системы мониторинга HR платформы)

гибрид, Москва

Команда развивает систему мониторинга HR‑платформы на базе Grafana и VictoriaMetrics: проектирование отказоустойчивой архитектуры, создание дашбордов и алертов, автоматизация сбора метрик и анализ инцидентов. Результат — повышение стабильности и быстрого обнаружения проблем в бизнес‑сервисах

ГрейдSenior

Стек

PythonPrometheusVictoriaMetricsGrafanaZabbixPromQLMetricsQLGrafana AlertingDockerKubernetesKafka

Задачи

  • Проектировать и поддерживать отказоустойчивую архитектуру мониторинга (VictoriaMetrics, Prometheus)
  • Строить комплексные дашборды в Grafana и настраивать правила алертинга
  • Развивать и оптимизировать компоненты на Zabbix (шаблоны, LLD, триггеры)
  • Унифицировать сбор метрик, стандартизировать экспортеры и каналы оповещений
  • Разрабатывать AI‑агентов для анализа метрик: поиск аномалий и прогнозирование
  • Интегрировать агентов с системами реагирования и участвовать в разборе инцидентов

Обязательно

  • Глубокие знания VictoriaMetrics (архитектура кластера, ретеншен, downsampling)
  • Продвинутые навыки работы с Prometheus (federation, remote write/read, PromQL)
  • Опыт создания дашбордов и алертов в Grafana и Grafana Alerting
  • Опыт работы с Zabbix: шаблоны, LLD, сложные триггеры и автоматизация через API
  • Уверенное владение Python для разработки автоматизации и AI‑агентов
  • Умение вести техническую документацию и участвовать в разборе инцидентов

Будет плюсом

  • Опыт внедрения LLM / LangChain и агентных фреймворков
  • Знание Docker и Kubernetes для развёртывания и мониторинга
  • Опыт с очередями сообщений и потоковой обработкой (Kafka)
Откликнуться на сайте компании

Похожие вакансии

МТСМТС

Senior Devops Engineer [Прогрессоры]

KubernetesHelmPostgreSQLPrometheus

Инфраструктура и CI/CD платформы для сервиса Прогрессоры

Опыт: от 5 лет
удалёнка, гибрид, Москва
ЯндексЯндекс

SRE-инженер в общую облачную платформу Финтеха

PythonKubernetesSQLTerraform

Облачная платформа для стабильной работы финтех-среды

удалёнка, гибрид, Санкт-Петербург
АльфаАльфа

DevOps/ Middle+

PythonKubernetesElasticsearch / ELKKafka

Инфраструктура и CI/CD для систем контроля доступа и антифрода

Опыт: от 3 лет
офис, удалёнка, гибрид, Москва
СберСбер

SRE инженер (AEF)

PythonKubernetesJenkinsArgo CD

Платформа для разработки и исполнения GenAI-агентов

Опыт: от 5 лет
гибрид, Москва
МТСМТС

Ведущий инженер технической поддержки (Цифровой бизнес)

SQLKibanaGrafanaJira

Поддержка и мониторинг цифровых сервисов банка

Опыт: 1–3 года
удалёнка, гибрид, Москва
ДОМ.РФДОМ.РФ

DevOps-инженер (Платформы данных и аналитические системы)/ИТ

GoKubernetesDockerKafka

Инфраструктура data‑платформы и пайплайнов обработки

Опыт: от 5 лет
удалёнка, гибрид, Москва

Смотреть ещё

JobsWave
Найти работу в IT