Мы занимаемся независимой оценкой качества и модельных рисков Kandinsky – семейства генеративных моделей для создания и редактирования изображений, видео и аудиовизуального контента, а также моделей мира (world models).
Наша задача – находить слабые места моделей, проверять выбранные подходы к оценке и готовить рекомендации, которые помогают принимать решения о релизе и возможных сценариях применения моделей.
Мы работаем с новыми версиями Kandinsky до их выхода к пользователям. Разрабатываем собственные методологии, бенчмарки и инструменты полного цикла, объединяя автоматические метрики, human evaluation и подходы LLM/VLM-as-a-judge.
Мы ищем специалиста на стыке исследований и инженерной разработки.
В этой работе не всегда существует готовая методология или универсальная метрика. Нужно определить, из чего складывается качество модели, спроектировать проверяемый эксперимент и реализовать воспроизводимый evaluation-пайплайн.
Роль охватывает весь цикл оценки: от формулирования критериев и подготовки тестовых данных до анализа результатов и рекомендаций для команды разработки. Важно не только измерить качество модели, но и понять, насколько она подходит для реальных пользовательских и бизнес-сценариев, какие ограничения критичны и что осталось непроверенным.
Проектировать оценку с нуля
Разрабатывать evaluation-пайплайны
Строить VLM-as-a-judge
Разбираться в ошибках моделей
Формировать заключение по модельному риску
Хорошее понимание устройства генеративных моделей:
Способность проектировать оценку качества моделей:
Навыки работы с LLM и VLM:
Понимание AI-агентов и агентных систем:
Умение проводить технический и научный ресерч:
Умение работать с агентами и субагентами:
Навыки вайбкодинга и AI-assisted coding:
Продуктовое мышление:
Дополнительный релевантный опыт: