Привет! 👋 Мы — дата-инженерная команда внутри Управления экспериментальных систем машинного обучения SberAI. Наша миссия — поставлять качественные мультимодальные датасеты в продуктовые команды, которые развивают генеративные модели: speech, music, image, video, 3D, text.
🔍 Парсить открытые источники, собирать готовые датасеты
⚙️ Оркестрировать ETL/ELT-пайплайны, фильтровать и описывать данные, прогонять модели на бенчмарках
👥 Организовывать проекты ручного сбора и валидации на крауд-платформах TagMe, Elementary, ЯЗ.
Наш стек: 🛠
Python • SQL • S3 • Hadoop/GreenPlum • Airflow • Docker/K8s • Git • Vault • ML Space • Confluence • Jira
✅ Знание Python (библиотеки для работы с данными и API)
✅ Опыт с ML-пайплайнами и датасетами для CV/NLP
✅ Понимание ETL/ELT и жизненного цикла данных
✅ SQL: SELECT, JOIN, агрегаты, подзапросы
✅ Базовое понимание форматов: CSV, JSON, Parquet, сериализация
✅ Опыт с Docker/Kubernetes
Будет плюсом: