Там отчёт от Cloudflare подъехал.

Всё наебнулось из-за изменения permissions на одной из наших БД. После этого база начала дампить в feature file для Bot Management сразу по несколько записей на одну фичу. Появились дубликаты. В итоге этот feature-файл раздулся в два раза.

Дальше этот жирный файл разошёлся по всей нашей сети — на все edge-машины. А сервисы, которые рулят трафиком по сети, периодически загружают этот feature file, чтобы Bot Management был в курсе актуальных угроз. В коде был захардкоженный лимит на размер этого файла, который оказался меньше нового удвоенного размера.

Из-за этого процесс начал крашиться → цепная реакция → половина нод легла.

Сначала мы подумали, что нас долбит какой-то монструозный DDoS (трафик реально спайкануло), но довольно быстро нашли причин и откатили фича файл на предыдущую валидную версию.

Такую сложную отказоустойчивую систему как Cloudflare победил.... один файл. Одна маленькая ошибка. После этого мы всё равно увидим обещанный SLA 99.9999% 😂 Хотя больше одной девятки после запятой (особенно 99.99999%, привет Яндексу) пишут просто чтобы себя успокоить, а не потому, что реально получится показать такой результат. Всегда ведь существует миллион факторов, о которых никто не подумал. До момента, пока они внезапно всё не положат.

В оригинале можете почитать тут: https://blog.cloudflare.com/18-november-2025-outage/

P.S За вольный авторский перевод спасибо Гроку (и чуть-чуть мне)

🔛 @kisel_it

#fails