CV engineer (Gigachat)

Summary

Builds and curates pretraining datasets for large vision-language models by designing experiments, automating pipelines, and validating data quality to directly influence model performance.

GigaChat увидит мир через данные, которые соберёте вы.

За GigaChat стоит одна из крупнейших ML-команд в России, которая обучает LLM и VLM полным циклом — от претрейна до релиза. Наша команда отвечает за то, с чего начинается любая сильная модель, — за данные: мы собираем визуальный корпус претрейна — ищем источники, фильтруем и дедуплицируем сырьё, ставим эксперименты и меряем влияние на бенчмарки. Именно состав и качество претрейн-данных определяют, каким получится финальный результат, и у вас будет возможность влиять на него напрямую.

Обязанности

  • ставить эксперименты: формулировать гипотезы, какие данные и в каких пропорциях улучшат модель, и проверять их: продумывать сетап и бейзлайны, запускать обучающие прогоны, по замерам решать, что попадёт в финальную смесь
  • автоматизировать подготовку данных: выстраивать очистку, дедупликацию и валидацию так, чтобы любой новый датасет без ручной доводки приходил в готовый к обучению вид
  • добывать редкие и дефицитные домены: обучать классификаторы и кластеризаторы, которые вылавливают ценные сэмплы из сырых данных, и нарезать корпус на чистые датасеты по таксономиям
  • собирать данные разных форматов: генерация VQA, синтетические задачи, interleaved-данные — каждый формат устроен по-своему и требует своего подхода
  • обрабатывать миллиарды изображений: писать распределённый код, который прогоняет пайплайны на всём корпусе быстро и стабильно
  • находить слабые места в данных: разбираться, где модель проседает из-за корпуса — чего не хватает, что зашумлено или разбалансировано, — и исправлять это
  • развивать контур оценки: подключать свежие бенчмарки, следить за чистотой методики и не пускать тестовые данные в обучающий корпус

Требования

Кто нам подходит:

Человек, который сможет провести данные от поиска источников до состава финальной смеси. Главное — умение ставить эксперименты и делать из них честные выводы. Опыт именно с VLM или LLM не обязателен: специфика осваивается быстрее, чем культура эксперимента

Что мы хотели бы видеть:

  • хорошая база ML, твёрдое знание CV и NLP
  • понимание, как данные влияют на качество модели, и привычка при странностях в метриках первым делом смотреть в данные
  • уверенный Python и опыт обучения моделей на PyTorch
  • умение спланировать эксперимент и довести его до вывода, которому можно верить
  • самостоятельность и проактивность: берёте тему, разбираетесь, доводите до результата

Плюсом будут:

  • опыт построения дата-пайплайнов и процессов контроля качества данных
  • опыт с распределённой обработкой (Spark, Dask, Airflow, YTsaurus)
  • опыт проведения ML-экспериментов на больших объёмах
  • публикации на профильных конференциях.

Мы открыты к кандидатам разного уровня, и попадать во все пункты не обязательно. Если задачи откликаются — напишите нам, остальное обсудим.

Условия

Что мы предлагаем:

  • опыт претрейна из первых рук. Команд, обучающих VLM полным циклом, в стране единицы — вы пройдёте весь путь от сырых данных до готовой модели
  • вычислительные ресурсы под ваши эксперименты. Один из самых больших GPU-кластеров в России: проверка гипотезы о данных стоит обучающего прогона, и на такие прогоны вычислений у нас хватает
  • инфраструктура, которая уже работает. S3, YTsaurus, Airflow, DataLens, GitLab CI, wandb — всё для данных и экспериментов на месте, время уходит на исследования, а не на обвязку
  • задачи, на которые ещё нет ответа. Как собрать лучшие визуальные данные для претрейна, пока не знает почти никто в мире — разбираться предстоит в том числе вам
  • короткий путь от гипотезы до модели. Данные, которые вы отберёте, и гипотезы, которые подтвердятся, уходят в обучение следующей модели — а ей пользуются миллионы людей
  • комфортный современный офис рядом с м. Кутузовская
  • возможность выбрать удобный график – офис/гибрид/удаленка (в РФ)
  • годовая премия
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • ипотека для сотрудников по дисконтной прогамме
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.