Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.
Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат
Отличное владение Python и PyTorch.
Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.
Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.
Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.
Умение писать чистый, надёжный, production-ready код.
Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.
Будет плюсом
Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.
Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.
Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).
Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).
Публикации, open-source вклад или сильный прикладной track record.