⭕ Как мы инвестигировали CrashLoopBackOff
В ходе мониторинга обнаружила постоянные рестарты подов CrashLoopBackOff в сервисе на Flask, хотя liveness пробы стабильно возвращали 200.
В логах ошибок приложения не было. Рестарты коррелировали с ростом количества запросов от смежного сервиса.
Пошла к команде DevOps для совместного расследования.
Что сделали: Смягчили liveness пробу Увеличили количество воркеров Результата это не дало
Продолжили дебажить, проверили код. На стороне приложения ничего подозрительного не нашли. Дальнейшее исследование указало на базу данных. Время выполнения запросов выросло. Вероятнее всего, liveness проба стояла в очереди вместе с API-запросами и не успевала ответить до таймаута. После добавления индекса задержки в БД снизились, пробы начали проходить, рестарты прекратились.
Вывод: Рестарты подов не всегда связаны с нехваткой памяти. Медленные внешние зависимости влияют на отзывчивость проб. Совместная работа с DevOps помогла найти корневую причину, которая лежала за пределами кода приложения.