Там отчёт от Cloudflare подъехал.
Всё наебнулось из-за изменения permissions на одной из наших БД. После этого база начала дампить в feature file для Bot Management сразу по несколько записей на одну фичу. Появились дубликаты. В итоге этот feature-файл раздулся в два раза.
Дальше этот жирный файл разошёлся по всей нашей сети — на все edge-машины. А сервисы, которые рулят трафиком по сети, периодически загружают этот feature file, чтобы Bot Management был в курсе актуальных угроз. В коде был захардкоженный лимит на размер этого файла, который оказался меньше нового удвоенного размера.
Из-за этого процесс начал крашиться → цепная реакция → половина нод легла.
Сначала мы подумали, что нас долбит какой-то монструозный DDoS (трафик реально спайкануло), но довольно быстро нашли причин и откатили фича файл на предыдущую валидную версию.
Такую сложную отказоустойчивую систему как Cloudflare победил.... один файл. Одна маленькая ошибка. После этого мы всё равно увидим обещанный SLA 99.9999% 😂 Хотя больше одной девятки после запятой (особенно 99.99999%, привет Яндексу) пишут просто чтобы себя успокоить, а не потому, что реально получится показать такой результат. Всегда ведь существует миллион факторов, о которых никто не подумал. До момента, пока они внезапно всё не положат.
В оригинале можете почитать тут: https://blog.cloudflare.com/18-november-2025-outage/
P.S За вольный авторский перевод спасибо Гроку (и чуть-чуть мне)
🔛 @kisel_it