Главный DevOps инженер S3-платформы (MinIO и on-prem решений)
офис, удалёнка, гибрид, Москва
Команда отвечает за эксплуатацию on‑prem S3‑платформы (MinIO/Ceph), обеспечивая доступность и отказоустойчивость хранилища для Data Lake, BI и ML‑команд; роль важна для непрерывной работы данных и восстановления после инцидентов
ГрейдLead
Стек
PythonMinIOCephPrometheus/GrafanaAnsibleTerraformLinuxS3
Задачи
- •Эксплуатация и сопровождение S3‑платформы 24/7
- •Участие в on‑call и обработка инцидентов, проведение RCA
- •Мониторинг, алертинг и улучшение наблюдаемости
- •Управление отказоустойчивостью, репликации и DR‑процессами
- •Автоматизация рутинных операций и оптимизация производительности
- •Ведение эксплуатационной документации (runbooks, инструкции)
Обязательно
- •Экспертный администратор Linux
- •Опыт сопровождения высоконагруженных систем 24/7 и on‑call
- •Глубокое понимание S3/Object Storage и принципов distributed storage
- •Опыт работы с MinIO или Ceph и аналогами
- •Опыт диагностики и troubleshooting (CPU, сеть, диски)
- •Опыт с мониторингом (Prometheus/Grafana)
- •Опыт автоматизации (Ansible/Terraform) и скриптования на Python/Bash
Будет плюсом
- •Опыт поддержки Data Lake (Hadoop/Spark/Airflow/Iceberg/Impala)
- •Опыт внедрения SRE‑практик и процессов эксплуатации
- •Опыт CI/CD (GitLab, Jenkins)
- •Знание Kubernetes и Docker
- •Опыт capacity planning и DR‑тестов