freehire launches on Product Hunt on 26 August.

Follow →

Deep Learning/CUDA Engineer (GigaChat)

Open 18d

Summary

Engineer deep-learning inference engines for GigaChat, optimizing CUDA kernels and GPU clusters to deliver sub-second LLM responses at massive scale.

Мы — команда инференса GigaChat. Всё, что модель отвечает пользователю, проходит через наш движок — и наша работа в том, чтобы это происходило быстро, дёшево и не падало никогда. У нас нет опции «подождём, пока это появится в vLLM». GigaChat — это свои архитектуры и свои мультимодальные модели, и когда исследователи приносят новую архитектуру, именно мы делаем так, чтобы она летала на проде: пишем ядра, придумываем, как разложить её по GPU, выжимаем токены в секунду там, где, казалось бы, выжимать уже нечего. Это работа, где результат меряется в миллисекундах и мегаваттах: каждый процент ускорения — это тысячи GPU-часов и реальные деньги. И где между «прочитал свежую статью» и «это крутится на проде под нагрузкой» проходят недели, а не годы.

Обязанности

Чем предстоит заниматься:

  • Заставлять новые архитектуры GigaChat (включая мультимодальные) работать на проде быстро
  • Ускорять всё, что можно ускорить: кастомные CUDA-ядра, квантизация, speculative decoding, оптимизации KV-cache, continuous batching — и то, чему ещё нет устоявшегося названия
  • Придумывать, как разложить большую модель по GPU и по кластеру так, чтобы ни один FLOPS не простаивал: тензорный/пайплайн-параллелизм, disaggregated prefill/decode, шедулинг запросов
  • Профилировать честно и глубоко: находить, куда на самом деле уходят миллисекунды — в ядре, в раскладке памяти, в сети или в планировщике — и убирать это
  • Держать прод: движок, через который проходят все запросы к GigaChat, должен успешно переживать абсолютно всё
  • Читать свежие статьи и код лучших движков (vLLM, SGLang, TensorRT-LLM) не как пользователь, а как конкурент: понимать, что у них хорошо, и делать у себя лучше — с поправкой на наши архитектуры

Требования

  • Опыт работы в области глубокого обучения, в том числе с LLM
  • Глубокое знание CUDA и Python
  • Опыт использования GigaChat, Kandinsky и аналогов в продуктах
  • Навыки создания и использования AI-агентов.

Условия

  • Комфортный современный офис рядом с м. Кутузовская
  • Возможность выбрать удобный график — офис/гибрид/удаленка (в РФ)
  • Годовая премия
  • Корпоративный спортзал и зоны отдыха
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • Ипотека для сотрудников по дисконтной программе
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • Вознаграждение за рекомендацию друзей в команду Сбера.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available