Senior Research Engineer (Multimodal Diffusion, Post-train)
05 октября 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Программист, разработчик
Исследуем и внедряем передовые методы для инструктивного редактирования изображений/видео, интеграции аудио в видео-генерацию и повышения качества за счет RLHF (Reinforcement Learning from Human Feedback).
Обязанности
- Разработка и обучение диффузионных моделей для инструктивного редактирования видео и изображений.
- Исследование архитектур для совместной генерации видео и синхронизированного аудио по текстовому промпту.
- Создание пайплайна RLHF для тонкой настройки моделей:
- Обучение мультимодальных reward-моделей (видео/аудио/текст).
- Интеграция алгоритмов RL (PPO, DPO, GRPO, OPD) в диффузионный пайплайн.
- Проектирование экспериментов, анализ результатов.
- Тесная коллаборация с Distributed Engineers для эффективной имплементации идей.
Требования
- Сильный бэкграунд в CV, генеративных моделях (Diffusion, GANs), мультимодальном ML.
- Опыт работы с диффузионными моделями (Stable Diffusion/FLUX, Wan 2.X и пр.) и фреймворками (Diffusers).
- Практические знания Reinforcement Learning, особенно RLHF.
- Уверенное владение PyTorch и навыки распределенного обучения (DDP/FSDP).
- Способность быстро прототипировать и проводить исследования SOTA методов.
- Опыт работы с SGLang, vLLM, Transformers
- Бонус: Опыт с аудио-генерацией (AudioLDM, MusicGen), публикации на NeurIPS/ICML/CVPR.
Условия
- комфортный современный офис рядом с м. Кутузовская
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- система обучения для профессионального и карьерного развития
- расширенный полис ДМС с первого дня работы и страхование для семьи
- льготная программа ипотеки для сотрудников
- бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
- вознаграждение за рекомендацию друзей в команду Сбера.