Вакансия : Senior OpenStack DevOps / SRE Engineer
Формат работы: удалённо Зарплата: обсуждается индивидуально по итогам собеседования с руководителем.
О вакансии
Ищем Senior OpenStack DevOps / SRE Engineer с сильным production-опытом эксплуатации и развития крупных OpenStack-кластеров.
Нам нужен инженер, который умеет не только поддерживать инфраструктуру, но и самостоятельно заниматься troubleshooting, performance tuning, масштабированием, миграциями, автоматизацией и архитектурой высокодоступных систем.
Требования:
• 5–7+ лет опыта в DevOps / SRE / системном администрировании. • 3+ года production-опыта с OpenStack, желательно с кластерами от 50+ физических узлов. • Экспертное знание Linux: RHEL / Ubuntu / Debian, kernel tuning, systemd, cgroups, SELinux. • Глубокая экспертиза KVM / QEMU / libvirt: NUMA, CPU pinning, hugepages, SR-IOV, PCI passthrough. • Глубокое знание OpenStack: Nova, Neutron, Cinder, Glance, Keystone, Placement; понимание внутренней архитектуры, deployment, upgrades, migrations и troubleshooting. • Сильная экспертиза в сетях: OVS / OVN, VXLAN / VLAN / Geneve, BGP / EVPN, DPDK, SR-IOV. • Опыт диагностики flow tables, conntrack, iptables, nftables. • Экспертное знание Ceph: CRUSH, OSD / MON / MDS, performance tuning, RBD, CephFS, RGW. • Опыт интеграции Ceph с Cinder / Glance. • Уверенное владение Ansible, Terraform, Python / Bash. • Опыт построения CI/CD для инфраструктуры. • Опыт работы с системами мониторинга и observability: Prometheus, Grafana, VictoriaMetrics, ELK / EFK / Loki. • Опыт работы с Docker / Kubernetes, понимание CNI / CSI, желательно опыт эксплуатации Kubernetes поверх OpenStack. • Опыт работы с P0/P1 incidents, on-call, root cause analysis, post-mortem и созданием runbooks. • Понимание принципов SRE: SLO / SLI / SLA, capacity planning, HA, security / compliance. • Опыт менторинга Middle / Junior инженеров.
Основные задачи:
• Эксплуатация и поддержка OpenStack 24/7. • Troubleshooting и восстановление OpenStack-сервисов. • Performance tuning и оптимизация инфраструктуры. • Планирование и проведение upgrade OpenStack и связанных компонентов. • Масштабирование OpenStack-кластеров. • Миграция инфраструктуры VMware / Hyper-V → OpenStack. • Проектирование и поддержка сетевой инфраструктуры. • Эксплуатация и оптимизация Ceph. • Автоматизация инфраструктуры и IaC с использованием Ansible / Terraform. • Настройка и развитие систем мониторинга и observability. • Обеспечение безопасности и соответствия инфраструктурным требованиям. • Участие в проектировании архитектуры HA / multi-region. • Проведение RCA, post-mortem и разработка runbooks после критических инцидентов. • Передача знаний и менторинг менее опытных инженеров.
Резюме мне в лс🙏🏻