Когда ваш любимый сервис снова пропал из Appstore
(Старался коротко, но вышло как всегда)
Вторник. Утро. Вы проснулись и заметили, что ваше любимое приложение с совой внезапно исчезает из Apple AppStore из-за воли модераторов площадки.
Пользователи не могли установить приложение, действующие клиенты не получали обновления безопасности ,а команда столкнулась с инцидентом, который невозможно починить силами одного дежурного. Это не просто сбой сервиса, это проблема, которая требует эскалации на уровне руководства,взаимодействия с владельцами площадки и коммуникации с пользователями.
И это хороший повод вспомнить, зачем нужна шкала severity и как она помогает не утонуть в хаосе Чтобы не жить в режиме вечной красной тревоги,нужна общая шкала severity и понятные правила эскалации. Критичность должна быть привязана к влиянию на пользователей и бизнес.Тогда из алерта сразу понятно: это сигнал для наблюдения или повод поднимать дежурного 🧐
Critical (CRIT или SEV1) : сервис недоступен, пользователи не могут выполнить ключевой сценарий, идут прямые потери. Примеры могут звучать следующим образом: - Яндекс.Карты не строят маршруты, навигация недоступна. - Яндекс.Диск не отдаёт файлы,массовые ошибки загрузки. - Яндекс.Музыка не воспроизводит треки у значительной части пользователей. - Яндекс Пэй пропадает из стора на небольшое время, новые клиенты не могут установить приложение, действующие пользователи не получают обновления безопасности.
Error (ERR или SEV2) : заметная деградация или частичная недоступность с влиянием на пользовательский опыт,но сервис продолжает работать. Примеры: - Резкий рост времени ответа API Яндекс.Погоды,пользователи видят долгую загрузку виджетов. - Массовый рост ошибок авторизации через Яндекс ID,вход работает, но с повторными попытками. - Деградация резервного контура Яндекс.Облака,основной контур держит,но запас по отказоустойчивости потерян.
Warning (WARN или SEV3) : ранний сигнал возможной проблемы. Влияния на пользователей пока нет или оно минимально,но есть риск перехода в Error или Critical.
Примеры: - Постепенное заканчивание свободного места на кластере Яндекс.Метрики,медленный рост числа медленных запросов. - Плавное увеличение времени ответа Яндекс.Переводчика без роста ошибок.
Info (INFO или SEV4) : информация к сведению,не требует реакции дежурного. Полезно для анализа и долгосрочных улучшений.
Примеры: - Отчёт о выполнении резервного копирования данных Яндекс.Документов. - Существенное изменение профиля успешных запросов в Яндекс.Поиске,повод посмотреть тренды,но не инцидент.
Критичность всегда зависит от того,чей SLO горит и как быстро расходуется бюджет на ошибки #sre #alerting #severity #incidentmanagement #oncall #observability #slo #errorbudget #yandex #monitoring #productionengineering #reliability
· 07.07
Да, внешняя платформа - это по сути чужой SLO, и он ломается без предупреждения. Для таких кейсов полезны fallback-каналы, feature flags и мониторинг изменений не только в проде, но и в магазине. Вы ещё алерты на статус листинга держите?
ответить
коммент удалён
· 11.07
Алерты на листинг не покрывали, так уж вышло(
ответить
ответ удалён