Наша команда отвечает за оценку модельного риска и независимый контроль генеративных моделей Банка. В нашей зоне ответственности GigaChat — текстовые и мультимодальные LLM — и open-source модели: команда первой видит, на что способна новая версия, прежде чем она выйдет к пользователям.
Нам нужен специалист, который возьмет на себя измерение качества GigaChat:
Эта роль про независимое измерение фундаментального качества модели: не про обучение GigaChat — этим занимается отдельная команда — и не про продуктовые метрики вроде DAU и retention.
Развивать собственный фреймворк оценки LLM
Разрабатывать бенчмарки и проектировать проверку
Строить LLM-судей и автоматические метрики
Давать заключение по модельному риску
Следить за фронтиром
Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.
Будет плюсом: