Мы дописали алертинг по логам и сели за регламент для дежурного: пришло письмо - открой агента idevops, скопируй туда текст алерта. На этой строчке стало неловко.

Письмо порождает машина. Копирует его человек. Разбирает снова машина.

Шлюз к агенту у нас уже был - для клиентских обращений: живая сессия omp --mode rpc, кадры JSON через stdin/stdout, инструменты подключаются конфигом. Алерт из Alertmanager - то же обращение, просто его пишет vmalert, а не человек.

Переходник занял триста строк на Bun: вебхук Alertmanager разворачивается в промпт и уходит в ту же сессию. Упёрлись в 429 по квоте - повторяем через agy.

Скормили настоящий алерт: HighErrorRate, cloudauto-sandbox/app, 45 ошибок за 5 минут.

Агент за один ход сходил в VictoriaLogs по LogsQL, дёрнул kubectl за подами и сопоставил. Под живой, 2/2 Running, три дня без рестартов. В логах client_fetch_error ... read ECONNRESET на собственный https-домен. В кластерном шлюзе для sandbox-хоста поднят слушатель на 80 и не поднят на 443, сертификата тоже нет. NextAuth стучится по https - Envoy рвёт TCP по отсутствующему SNI.

Сорок минут моей работы. У агента - один ход.

Разбор целиком, вместе с тем, почему агент при этом ничего не чинит и где у --auto-approve граница: https://iconicompany.com/ru/blog/alert-is-a-ticket-sre-agent-over-omp-rpc