На Хабре (ссылку давать не буду, но она там в топе читаемых, так что найти не сложно) слышен протяжный вой клиентов, задетых инцидентом. Да, локации ams TimeWeb и Hostkey лежат уже считай сутки, и это печально.

Но давайте отставим в сторону эмоции, и попробуем разобраться, насколько тут виноват конкретный хостер (реселлящий услуги зарубежного ЦОДа)

Q: У ЦОДа уже были проблемы (в мае), вы обещали постмортем, а его так и нет - почему? A: Т.к. авария находится в зоне действия партнёра (ЦОДа), то дать клиентам постмортем можно только на основании RCA (Root Cause Analysis) от этого самого партнёра. А RCA (сюрприз!) может готовиться долго... особенно если этот самый партнёр не очень хочет раскрывать какие-то детали инцидента, или просто долго подбирает такие формулировки, которые дадут ровно нужное количество информации (и за которые не смогут зацепиться юристы на стороне клиентов).

Q: Что конкретно сделано с охлаждением в ДЦ Qupra? (имеется в виду после майской аварии) A: Тут хостер (клиент ЦОДа) может опираться только на слова партнёра и проверить информацию об "апгрейде системы охлаждения" не представляется возможным. Что там было в реальности - знает только непосредственно оператор/владелец площадки.

Q: Рассматриваете ли вы смену площадки в Нидерландах? A: С этим есть очевидные трудности, особенно после маски-шоу с арестом оборудования. Западные ЦОДы, натурально, отказываются работать с любыми российскими компаниями (не только санкционными), или даже просто связанными с РФ. А при любых подозрениях устраивают дотошную юридическую проверку, которая может занять не одну неделю. Поэтому даже если пострадавшие хостеры и рассматривают другие площадки, то быстро это точно не произойдёт (я уж молчу про трудности, связанные непосредственно с переездом инфраструктуры). Хотя работать с недадёжным поставщиком, разумеется, нельзя.

Q: Из-за вас у меня не работает мой коммерческий проект! (SaaS, чат-бот, CRM, интернет-магазин - подставить нужное) A: Я тебе один умный вещь скажу, только ты не обижайся (с) Если у вас есть коммерческий проект, который приносит вам прибыль и который не жалко потерять, то его инфраструктура должна а) иметь актуальные бэкапы вне локации, где находится прод; б) иметь #DRP, хотя бы примерный. Не обязательно городить active-active мульти-дц схему с балансировщиками и кубернетисом. Но бэкапы должны быть регулярными, вы должны их проверять и должны иметь хотя бы примерный план на случай, если завтра ваша виртуалка исчезнет (возможно, вместе с хостером). Если же вы считаете, что за 999р/мес (супер-вип-лакшери тариф!) хостер вам гарантирует какую-либо доступность, то у меня для вас плохие новости.

Q: А вот у этого же хостера в соседнем ДЦ/кампусе всё работает, почему бы просто туда серваки не перенести? A: Тут начинаются нюансы с точки зрения инфраструктуры. Во-первых, в другом ЦОДе банально может не быть свободного электричества/места, чтобы принять "пострадавших". Дефицит стоек и электричества не только в Москве - в "традиционных" локациях в Европе с этим тоже есть проблемы. Во-вторых, это дополнительные расходы - на стойки, сеть, работу персонала и тд. И "полежать", пусть даже сутки, может оказаться дешевле, чем совершать подобные кульбиты, тем более что нет гарантий, что ситуация не повторится.

@snakeslair #thereisnoclouds


В этом посте были ссылки, но мы их удалили по правилам Сетки