SRE-инженер обеспечивает надёжность и масштабируемость высоконагруженных систем. Прежде всего он настраивает мониторинг и алертинг (Prometheus, Grafana, VictoriaMetrics, Zabbix, Datadog). Он также внедряет логирование и трейсинг (ELK Stack (Elasticsearch, Logstash, Kibana), Loki, OpenTelemetry, Jaeger, Zipkin) для поиска узких мест. Специалист управляет инцидентами: реагирует на сбои, проводит постмортемы (анализ причин), разрабатывает предупреждающие меры.
SRE инженер автоматизирует развёртывание и масштабирование (Kubernetes (K8s), Helm, Terraform, Ansible). Важная задача — обеспечение отказоустойчивости (redundancy, failover, multi-AZ, backup/restore). Он также работает с облачными платформами (AWS (EKS, EC2, S3), Yandex Cloud, GCP, Azure). Специалист внедряет SRE-практики: устанавливает Service Level Objectives (SLO), Service Level Indicators (SLI), Error Budget. Он взаимодействует с разработкой и DevOps: помогает проектировать системы с учётом надёжности (production readiness review). Он знает языки программирования (Python, Go, Bash) для написания скриптов и инструментов автоматизации.
Требуется опыт от 3 лет в SRE/DevOps/администрировании высоконагруженных систем. Знание Linux (администрирование, настройка ядра, сетевые утилиты). Понимание основ работы сетей (TCP/IP, DNS, HTTP/2, gRPC, балансировщики: Nginx, HAProxy, Envoy). Опыт работы с базами данных (PostgreSQL, MySQL, ClickHouse, Redis, Tarantool) — умение профилировать запросы и настраивать репликацию. Знание контейнеризации (Docker) и оркестрации (Kubernetes). Умение читать код приложений (хотя бы на одном языке) для глубокого анализа проблем. Английский (чтение документации, описание инцидентов). Способность сохранять спокойствие и быстро действовать в условиях аварии.
Другие специализации:




