Свяжитесь напрямую по этой вакансии
📍 Местоположение: Бангалор (Гибридный формат) 💼 Опыт: 6–10 лет
⚠️ Важно: ✔ Рассматриваются только местные кандидаты из Бангалора ✔ Должна быть возможность для личного собеседования в короткие сроки
🔎 Обзор роли Мы ищем опытного старшего SRE с глубокими знаниями в области Observability, Kubernetes и облачных платформ. Эта роль сосредоточена на создании и эксплуатации высоконадежных, масштабируемых и наблюдаемых систем в средах GCP (предпочтительно) и AWS.
🔹 Ключевые обязанности
Надёжность и эксплуатация • Проектирование и эксплуатация высокодоступных систем на базе Kubernetes • Определение и управление SLO, SLI и бюджетами ошибок • Руководство реагированием на инциденты, проведением RCA и разборами после инцидентов без обвинений (blameless postmortems) • Повышение надежности платформы за счет автоматизации
Observability (Основной фокус) • Создание централизованных платформ observability (метрики, логи, трассировки) • Обязателен практический опыт работы с Prometheus, Alertmanager, Grafana • Логирование/трассировка с использованием ELK / OpenSearch, Loki, OpenTelemetry • Мониторинг в облачной среде (предпочтительно GCP Monitoring) • Определение действенных стандартов оповещения с низким уровнем шума
Облачные технологии и платформенная инженерия • Инфраструктура в GCP (предпочтительно GKE) / AWS (EKS) • Эксплуатация кластеров Kubernetes • Развертывание Helm и Docker-ворклоады • Автоматизация инфраструктуры с использованием Terraform / Ansible / Packer
Автоматизация и инструментарий • Уверенное владение Python для разработки инструментов надежности • Создание внутренних инструментов для отслеживания SLO и рабочих процессов инцидентов • Интеграция observability в CI/CD (Jenkins)
Лидерство • Наставничество инженеров • Влияние на архитектуру надежности • Сотрудничество с командами платформы и облачных технологий
✅ Обязательные навыки SRE | Python (Coding) | Kubernetes | ELK | Prometheus | Grafana | AWS/GCP | Docker | Helm | Terraform | Linux | Jenkins CI/CD
⭐ Желательно Splunk | Datadog | Cribl | Vector | OpenTelemetry | Multi-cloud | Platform Security
📅 Основные моменты проекта ✨ Создание централизованной платформы observability 📉 Сокращение MTTR с помощью инженерии, основанной на SLO 🚨 Руководство реагированием на производственные инциденты ⚡ Оптимизация производительности, масштабируемости и облачных затрат
📩 Заинтересованы? Отправьте резюме на recruitment@shashwathsolution.com
6-10 лет
Опыт работы
Гибрид
Формат работы
Senior
Грейд
B2 - Выше среднего
Уровень английского
DevOps
Специализация
IT & Tech
Отрасль
Агентство
Тип компании
По городу
DevOps
Специализация
IT & Tech
Отрасль
Агентство
Тип компании