Мы помогаем делать агентные модели GigaCode и GigaChat лучше — они не просто отвечают текстом, а сами ходят в инструменты, пишут код, работают с базами данных и офисными сценариями.
Агент решает задачу, пайплайн сохраняет траекторию, сам проверяет результат и сам отсеивает мусор. Твоя работа — спроектировать этот пайплайн так, чтобы он честно обмерял модель и давал данные для улучшения следующего поколения агентного ИИ.
Это передний край развития ИИ: без таких пайплайнов агентные модели не на чем учить и нечем проверять.
━━━━━━━━━━━━━━━━━━━━
🚀 Почему это интересно
Ты будешь проектировать, как агенты проверяются и в чем работают, чтобы из их решений начало прорастать улучшение качества следующих поколений моделей. Задачи нетривиальные: среда должна быть честной, проверка — автоматической, запуск — на большом масштабе. Прямой вклад в развитие агентного ИИ.
• Проектировать пайплайны синтетических агентных данных: модель придумывает задачу → агент её решает → проверка → фильтр → датасет
• Придумывать задачи и бенчмарки для разных доменов: код, SQL, офис, инфобез и новые области
• Делать генерацию задач из открытых данных и автоматическую проверку (ораклы, тесты, LLM-судья — где это уместно)
• Разбираться в агентном цикле: инструменты, окружение, формат траекторий, что считать успешным завершением работы
• Масштабировать запуски: тысячи изолированных сред, очередь экспериментов, стабильный инференс LLM
• Строить контроль качества: валидная ли траектория, нет ли утечки ответа, не спутали ли сбой инфраструктуры с провалом агента
По сути это проектирование сред, в которых модель учится действовать как в реальной жизни у пользователей.
━━━━━━━━━━━━━━━━━━━━
🛠 Стек
Python · Docker / Kubernetes · агенты и среды запуска · инференс LLM · агентные бенчмарки · пайплайны синтетики
• Уверенный Python: данные, API, скрипты оркестрации
• Опыт ML-пайплайнов и датасетов именно в NLP: генерация, фильтрация, форматы диалогов и траекторий
• Docker и Kubernetes на практике: образы, джобы, разбор падений в кластере
• Понимание, как устроены агенты: цикл «размышления → инструмент → результат», изолированная среда, проверка результата
• Базовое понимание инференса LLM: chat/completions, чат шаблоны, парсеры тулов, как агент ходит в модель
• Форматы сохранения агентных траекторий и умение с ними работать
━━━━━━━━━━━━━━━━━━━━
🌟 Будет плюсом знание про:
• Агентные бенчмарки (SWE-bench, Terminal-Bench, SQL/BIRD, CyberGym и похожие): как устроены задачи, ораклы, оценка
• Генерация синтетики через LLM и оценка качества без ручной разметки
• Устройство агентных фреймворков: инструменты, память, сжатие контекста, субагенты, траектории
• Офисные и инфобезовские агентные задачи