Удалённо ищу роль SRE/DevOps, где моя задача - чтобы ночью не звонили, а если позвонили - чтобы мы знали, где и почему сломалось, и как это предотвратить. Мой фокус: меньше хаоса, больше предсказуемости. Для этого: • Делаю наблюдаемость по делу: Grafana + VictoriaMetrics/Prometheus + ELK. Не «ещё один график», а понятные метрики и алерты, которые реально помогают локализовать проблему • БД (PostgreSQL) - не администрирую, но включаю в мониторинг и трейсинг: вижу нагрузку, медленные запросы и корреляции с сервисом • Разбираю инциденты по RCA, пишу blameless postmortem с выводами и мерами, чтобы история не повторялась • Планирую ресурсы и мощности: считаю рост нагрузки, закладываю буфер, снижаю риск внезапной деградации • Автоматизирую типовые операции (Ansible, скрипты), чтобы команда тратила время на развитие, а не на рутину • Работаю с бизнесом и смежными командами: перевожу технические риски на язык SLA (бизнес и технические SLA), сроков и денег, согласовываю приоритеты и ожидания Готов к удалёнке, вилка от 150 тыс. руб. net. Если в команде сейчас «горят» инциденты, много ручного разбора или нестабильные релизы - напишите, расскажу, что можно сделать в первые 30 дней.
SRE/DevOps в поисках команды
· 3 чрезюме
0 комментов