Мы - команда инференса GigaChat. Всё, что модель отвечает пользователю, проходит через наш движок - и наша работа в том, чтобы это происходило быстро, дёшево и не падало никогда.У нас нет опции «подождём, пока это появится в vLLM». GigaChat - это свои архитектуры и свои мультимодальные модели, и когда исследователи приносят новую архитектуру, именно мы делаем так, чтобы она летала на проде: пишем ядра, придумываем, как разложить её по GPU, выжимаем токены в секунду там, где, казалось бы, выжимать уже нечего.Это работа, где результат меряется в миллисекундах и мегаваттах: каждый процент ускорения - это тысячи GPU-часов и реальные деньги. И где между «прочитал свежую статью» и «это крутится на проде под нагрузкой» проходят недели, а не годы.
Чем предстоит заниматься: