Senior Research Engineer (Multimodal Diffusion, Post-train)

05 октября 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Программист, разработчик

 Исследуем и внедряем передовые методы для инструктивного редактирования изображений/видео, интеграции аудио в видео-генерацию и повышения качества за счет RLHF (Reinforcement Learning from Human Feedback).

Обязанности
  • Разработка и обучение диффузионных моделей для инструктивного редактирования видео и изображений.
  • Исследование архитектур для совместной генерации видео и синхронизированного аудио по текстовому промпту.
  • Создание пайплайна RLHF для тонкой настройки моделей:
  • Обучение мультимодальных reward-моделей (видео/аудио/текст).
  • Интеграция алгоритмов RL (PPO, DPO, GRPO, OPD) в диффузионный пайплайн.
  • Проектирование экспериментов, анализ результатов.
  • Тесная коллаборация с Distributed Engineers для эффективной имплементации идей.
Требования
  • Сильный бэкграунд в CV, генеративных моделях (Diffusion, GANs), мультимодальном ML.
  • Опыт работы с диффузионными моделями (Stable Diffusion/FLUX, Wan 2.X и пр.) и фреймворками (Diffusers).
  • Практические знания Reinforcement Learning, особенно RLHF.
  • Уверенное владение PyTorch и навыки распределенного обучения (DDP/FSDP).
  • Способность быстро прототипировать и проводить исследования SOTA методов.
  • Опыт работы с SGLang, vLLM, Transformers
  • Бонус: Опыт с аудио-генерацией (AudioLDM, MusicGen), публикации на NeurIPS/ICML/CVPR.
Условия
  • комфортный современный офис рядом с м. Кутузовская
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • система обучения для профессионального и карьерного развития
  • расширенный полис ДМС с первого дня работы и страхование для семьи
  • льготная программа ипотеки для сотрудников
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.