Senior Platform Engineer (аналог Hadoop/Spark)

05 августа 2026 • г Москва • ПАО Сбербанк • Информационные технологии:DevOps-инженер
  • Крупный высоконагруженный кластер YTsaurus (аналог Hadoop/Spark) для хранения и обработки петабайтов данных.
  • Инфраструктура развернута в Kubernetes с использованием Operator и CRD.
  • Задача: обеспечить 24/7 доступность, масштабируемость и автоматизацию платформы для команд Data Engineering и аналитики.
Обязанности
  • развертывание, конфигурация и сопровождение кластеров YTsaurus в K8s (Helm, Operator)
  • управление компонентами: Masters, Data/Tablet/Exec Nodes, Scheduler, Proxies, Query Tracker
  • настройка Persistent Volumes, storage locations, replication factor и снапшотов (changelogs/snapshots)
  • планирование ресурсов (CPU/RAM/IOPS/Storage) и управление квотами (accounts, pools, bundles)
  • разработка безопасных процедур upgrade/rollback и вывода узлов из эксплуатации (drain)
  • настройка мониторинга (Prometheus + Grafana + Odin) и сбор логов
  • участие в устранении инцидентов, RCA и postmortem
  • автоматизация на Python/Bash, управление конфигурацией через Ansible/Terraform
  • развитие CI/CD пайплайнов (GitLab)
  • управление доступом (ACL, RBAC, токены, группы) и интеграция с Vault.
Требования
  • Опыт от 5 лет в DevOps/SRE/Platform Engineering
  • Обязательный опыт эксплуатации YTsaurus в продакшене
  • Экспертное знание Kubernetes: StatefulSet, Operators, CRD, Helm, PV/C SI, Network Policies, affinity/taints
  • Глубокое знание Linux: I/O, память, cgroups, network stack, диагностика производительности
  • Понимание сетей: TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7 балансировка
  • Владение Python и Bash для автоматизации
  • Опыт с Ansible, Terraform, GitLab CI/CD
  • Навыки работы с Prometheus/Grafana и системами логирования



Будет плюсом:



  • знание архитектуры YTsaurus (Cypress, Hydra, Chunks, Tablet Cells, dynamic config)
  • опыт с CHYT, SPYT, YQL или Query Tracker
  • разработка Kubernetes Operators (Go/Python)
  • опыт с Hadoop/HDFS/Spark или ClickHouse/PostgreSQL
  • понимание SRE-практик: SLI/SLO, Error Budget, Capacity Planning, Disaster Recovery drills
  • опыт multi-cluster / multi-DC инфраструктуры
  • нагрузочное тестирование и тюнинг производительности.
Условия
  • стабильный оклад и премии по результатам работы, ежегодный пересмотр зарплаты
  • комфортный современный офис рядом с м.Кутузовская
  • гибридный формат работы: встречаемся очно в офисе 1 раз в неделю
  • корпоративный спортзал и зоны отдыха
  • уникальная система обучения Сбера для профессионального и карьерного развития
  • программа адаптации и помощь руководителя на старте
  • расширенный ДМС и льготное страхование семьи
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • бесплатная подписка СберПрайм, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера
  • корпоративная пенсионная программа