Site Reliability Engineer(SRE)

07 октября 2026 • г Москва • АО "СберТех" • Информационные технологии:DevOps-инженер
подходит для людей с инвалидностью

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.

Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.

Технологический стек:

·       PostgreSQL — основное хранилище данных

·       Kubernetes — оркестрация

·       Kafka — обмен событиями

·       Redis — кэширование

·       S3 (совместимое объектное хранилище) — данные и бэкапы

·       Qdrant — векторная база знаний

·       Prometheus + Grafana — мониторинг

·       OpenSearch — логи

Твои задачи:

  • обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem
  • разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)
  • управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг
  • диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса
  • настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды
  • управление секретами и доступом, выполнение требований безопасности
  • работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы
  • участие в архитектурных решениях для новых сервисов платформы.

Мы ожидаем, что у тебя есть:

  • 3+ года опыта в SRE / DevOps / платформенной инфраструктуре
  • глубокий опыт работы с Kubernetes в промышленной эксплуатации
  • PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление
  • Kafka, Redis, S3-совместимые объектные хранилища
  • CI/CD, Linux, Bash
  • мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг
  • понимание принципов SLO / SLI / Error Budgets
  • опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS
  • опыт создания AI-агентов и использования их в работе будет преимуществом.

Будет плюсом:

  • опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU
  • опыт работы с векторными БД (Qdrant, Milvus, pgvector)
  • знание IaC (Terraform, Ansible)
  • опыт участия в RAG / AI-платформенных проектах
  • навыки написания postmortem и улучшения процессов эксплуатации.

Работа в СберТехе - это:

  • гибридный формат работы
  • годовой бонус и ежегодный пересмотр зарплаты
  • статус аккредитованной ИТ-компании
  • расширенный ДМС с первого дня и льготное страхование для семьи
  • корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях
  • 90 дней удаленной работы из любого региона РФ
  • льготная ипотека в Сбере
  • бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.