Когда один взлом может остановить бизнес

Всем привет! Вообще всё, что касается DevOps - это всегда немного волнительно. Потому что шансы потерять всё никогда не равны нулю. Вот и в нашу копилку недавно попал такой кейс.

После компрометации части инфраструктуры крупная компания столкнулась со взломом локальной серверной системы. А дальше вскрылась классическая проблема многих «исторически сложившихся» инфраструктур: - нет полноценного резервного копирования; - нет отказоустойчивости; - всё завязано на локальные серверы.

В результате под угрозой оказалась работа всех сервисов компании -  инцидент привел к недоступности внутренних систем, сервисов и частичной остановкой рабочих процессов компании. Для быстрого возобновления работы приняли решение развернуть с нуля инфраструктуру в Yandex Cloud.

Что удалось поднять за 7 дней: - 40 виртуальных машин; - 890 vCPU; - 7200+ Гб RAM; - 50 Тб дискового пространства; - рабочие места для ~1000 пользователей. Параллельно настроили резервирование, мониторинг и централизованное управление сервисами. В итоге компания не просто восстановила работу сервисов после инцидента, а получила более безопасную и масштабируемую инфраструктуру без зависимости от локального железа.

Вообще такие проекты всегда напоминают одну простую мысль: пока всё работает - резервные копии кажутся не такими уж важными 😃