Итак, разбор инцидента от Яндекса. Довольно детальный, за что им большое спасибо (хотя то что команда облака увидела отвал зоны спустя семь минут - это забавно, да) И что я вам хочу сказать за этот инцидент?
Учитесь строить инфраструктуру надлежащим образом. Даже если она в облаке. Облако это вообще не про надёжность (я ведь уже говорил?). Надёжность вашей инфраструктуры обеспечиваете только вы и ваша команда, и никто другой. И не важно, будет она в облаке или в Tier IV дата-центре на супер-дорогих серверах.
Любой сервер может сломаться (даже новый). Любой ДЦ может отвалиться - сгорит ИБП, не заведётся дизель, отрубятся чиллеры. И вообще не важно, есть ли дизель у дата-центра - это скорее компромисс с рынком, который в массе своей ленивый и не хочет напрягаться лишний раз - ведь проще переложить ответственность за непрерывность работы на кого-то ещё. (да, окай, есть энтерпрайз-системы, которые плохо переживают отключение электричества - но зачем ими пользоваться добровольно?!)
как-то так.
@snakeslair #thereisnoclouds