Руководитель направления AI Safety

17 сентября 2026 • г Москва • ПАО Сбербанк • Информационные технологии:Дата-сайентист

Мы развиваем GigaChat — самый быстрорастущий AI-проект Сбера — и ищем сильного руководителя направления безопасности ИИ. Нашими моделями пользуются миллионы людей, и наша задача делать LLM безопасной — чтобы ее просто так нельзя было уболтать продать ваш Chevrolet за 1 рубль. А ещё, помимо безопасности, наша команда развивает GigaEmbeddings — эмбеддер, который больше года удерживает топ-1 по качеству среди русскоязычных моделей на лидерборде ruMTEB.

Это роль для технического лидера, который возглавит направление: от обучения быстрых guard-моделей и online-RL до систематического редтиминга, аналитики атак на реальном трафике и развития лучших русскоязычных эмбеддеров.

Обязанности

Улучшать модели-защиты

• Обучать компактные и быстрые классификаторы входящих и исходящих сообщений: дистилляция, работа в жёстком бюджете latency, не деградируя качество основной модели.

• Развивать online-RL контур: дообучать защиты и модель на свежих атаках и сигналах с продакшена, сокращая цикл от обнаружения новой атаки до устойчивости к ней.

• Балансировать метрики защит: пропущенные нарушения против ложных срабатываний, и держать оба показателя под контролем на масштабе.

• Выстроить систематический red teaming: ручной и автоматизированный поиск джейлбрейков, prompt injection, обходов защит — перед каждым релизом и постоянно на живых моделях и продакшен-логах.

Улучшать эмбеддеры

• Развивать GigaEmbeddings: подбор и синтез данных, contrastive learning, hard negatives, дистилляция в компактные версии — удерживая топ-1 на ruMTEB.

• Применять эмбеддеры в задачах безопасности: кластеризация атак и поиск аномалий в пользовательских логах, отслеживание эволюции техник обхода.

• Собирать из продакшен-данных датасеты, и целевые тестовые наборы под конкретные кейсы: например, рефразы или ранжирование.

• Быстро отвечать данными на вопрос «почему защиту пробили и что именно сломалось» и превращать разборы инцидентов в улучшения моделей.

Требования

• Отличное владение Python и PyTorch, практический опыт обучения моделей — классификаторов и LLM, а не только их использования.

• Опыт с RL-методами дообучения (RLHF/DPO/online-RL) или готовность быстро в них погрузиться на практическом уровне.

• Умение работать с продакшен-данными и обучать классификаторы: вытащить сигнал из логов, собрать датасет, посчитать метрики и понять, где разница значима, а где — шум.• Опыт обучения guard-моделей (Llama Guard и аналоги) или построения модерационных систем под высокой нагрузкой.

• Опыт обучения эмбеддеров или ретриверов и знакомство с бенчмарками MTEB/ruMTEB.

• Опыт автоматизированного red teaming и знакомство с профильной литературой по adversarial robustness.

• Опыт в командах безопасности разработчиков моделей; публикации или open-source вклад в области AI safety.

Условия

• Возможность развивать GigaEmbeddings — лучший русскоязычный эмбеддер, больше года удерживающий топ-1 на ruMTEB.

• Команду сильных инженеров и исследователей.

• Возможность совмещать управление направлением с глубокой технической работой.

• Конкурентную компенсацию, премии и расширенный соцпакет.