Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.
Мы предлагаем:
· Интересные задачи по построению Data Lakehouse на базе Apache Spark и Apache Iceberg.
· Работу с большими объемами данных и современным стеком технологий.
· Возможность влиять на архитектурные решения.
Ключевые технологии в вакансии: SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker.
Разработка и оптимизация витрин данных:
Архитектура данных:
Инженерные практики:
Производительность и качество:
Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса
Будет большим плюсом: