Сценарий, при котором бэкапов нет
В новостях - повреждённый в результате атаки ЦОД одного из ИТ-гигантов. Пострадавшим коллегам - сочувствие. Причины и политику - за скобки, урок себе заберём: он стоит дорого. Мы привыкли к авариям понятного масштаба: умер диск, обесточило зал. Под такие сценарии у всех есть бэкапы. Но есть авария другой природы - площадка исчезает целиком. Вместе со всем, что мы привыкли считать раздельным: прод, реплика и копии “рядом, для скорости”. Два тезиса, которые стоит перепроверить сегодня: Репликация - это не резервное копирование. Реплика честно переносит на вторую площадку всё, что происходит с данными. Включая их уничтожение. Копия в том же ЦОД - это не копия. В том же регионе - под вопросом. Три копии, два типа носителей, одна - в другой географии. Я бы добавил четвёртое: одна неизменяемая, офлайн или immutable - от вирей и физического уничтожения спасает именно она. Что всплывает во время восстановления, если не проверить заранее: Облако - не гарантия: зона доступности - не регион. Окружение описывать кодом, чтобы поднять не только данные, но и сети, права, настройки.
Сервис рвётся по самому забытому звену: DNS, сертификаты, секреты, лицензии. Виртуалки - не весь сервис.
DR-план, который ни разу не прогоняли целиком, - документ, а не способность.
Георезервировать всё дорого и не нужно. Сначала приоритизация: что работает через час после катастрофы, что через сутки, что подождёт. Под каждый класс - свой RTO/RPO. Резервное копирование, которое ни разу не проверяли восстановлением, - не резервирование. Это надежда. А на надежду SLA не выписывают.