Когда один взлом может остановить бизнес
Всем привет! Вообще всё, что касается DevOps - это всегда немного волнительно. Потому что шансы потерять всё никогда не равны нулю. Вот и в нашу копилку недавно попал такой кейс.
После компрометации части инфраструктуры крупная компания столкнулась со взломом локальной серверной системы. А дальше вскрылась классическая проблема многих «исторически сложившихся» инфраструктур: - нет полноценного резервного копирования; - нет отказоустойчивости; - всё завязано на локальные серверы.
В результате под угрозой оказалась работа всех сервисов компании - инцидент привел к недоступности внутренних систем, сервисов и частичной остановкой рабочих процессов компании. Для быстрого возобновления работы приняли решение развернуть с нуля инфраструктуру в Yandex Cloud.
Что удалось поднять за 7 дней: - 40 виртуальных машин; - 890 vCPU; - 7200+ Гб RAM; - 50 Тб дискового пространства; - рабочие места для ~1000 пользователей. Параллельно настроили резервирование, мониторинг и централизованное управление сервисами. В итоге компания не просто восстановила работу сервисов после инцидента, а получила более безопасную и масштабируемую инфраструктуру без зависимости от локального железа.
Вообще такие проекты всегда напоминают одну простую мысль: пока всё работает - резервные копии кажутся не такими уж важными 😃