SRE-инженер (Команда системы мониторинга HR платформы)
гибрид, Москва
Команда развивает систему мониторинга HR‑платформы на базе Grafana и VictoriaMetrics: проектирование отказоустойчивой архитектуры, создание дашбордов и алертов, автоматизация сбора метрик и анализ инцидентов. Результат — повышение стабильности и быстрого обнаружения проблем в бизнес‑сервисах
ГрейдSenior
Стек
PythonPrometheusVictoriaMetricsGrafanaZabbixPromQLMetricsQLGrafana AlertingDockerKubernetesKafka
Задачи
- •Проектировать и поддерживать отказоустойчивую архитектуру мониторинга (VictoriaMetrics, Prometheus)
- •Строить комплексные дашборды в Grafana и настраивать правила алертинга
- •Развивать и оптимизировать компоненты на Zabbix (шаблоны, LLD, триггеры)
- •Унифицировать сбор метрик, стандартизировать экспортеры и каналы оповещений
- •Разрабатывать AI‑агентов для анализа метрик: поиск аномалий и прогнозирование
- •Интегрировать агентов с системами реагирования и участвовать в разборе инцидентов
Обязательно
- •Глубокие знания VictoriaMetrics (архитектура кластера, ретеншен, downsampling)
- •Продвинутые навыки работы с Prometheus (federation, remote write/read, PromQL)
- •Опыт создания дашбордов и алертов в Grafana и Grafana Alerting
- •Опыт работы с Zabbix: шаблоны, LLD, сложные триггеры и автоматизация через API
- •Уверенное владение Python для разработки автоматизации и AI‑агентов
- •Умение вести техническую документацию и участвовать в разборе инцидентов
Будет плюсом
- •Опыт внедрения LLM / LangChain и агентных фреймворков
- •Знание Docker и Kubernetes для развёртывания и мониторинга
- •Опыт с очередями сообщений и потоковой обработкой (Kafka)