freehire launches on Product Hunt on 26 August.

Follow →

ML Engineer в команду Disrupt

Summary

ML engineer builds and scales production LLM inference on NVIDIA GPUs, tuning engines like vLLM and TensorRT-LLM for speed and throughput while optimizing memory and network bottlenecks.

Мы - команда Disrupt в Сбере, часть блока ГенИИ. Отвечаем за все новые воплощения Гиги на рынках и работаем в формате фабрики гипотез: ищем перспективные сценарии, запускаем MVP, масштабируем лучшие продукты. Ищем ML-инженера, который будет запускать в продакшен и ускорять большие языковые модели на инфраструктуре NVIDIA. * Запускать и поддерживать распределённый инференс LLM на кластере GPU. * Тюнить движки (vLLM, SGLang, TensorRT-LLM или аналоги) для максимальной скорости и утилизации железа. * Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях. * Применять квантизацию (FP8/INT8), speculative decoding и другие оптимизации без потери качества ответов. * Находить узкие места по памяти (VRAM/HBM) и сети (NVLink/InfiniBand), устранять OOM и сбои узлов. * Упаковывать сервисы в Kubernetes/Docker, настраивать автоскейлинг, выкаты и откаты. * Строить мониторинг метрик вывода (задержки, токены/сек, стоимость за 1М токенов). * Проводить нагрузочное тестирование и планировать мощности. * От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде. Обязательно хотя бы один свой GPU-сервис, доведенный до продакшена. * Уверенное владение Python и Linux. Знание Docker, Git, CI/CD и базовая работа с Kubernetes. * Практический опыт запуска моделей на PyTorch под NVIDIA GPU. * Опыт работы минимум с одним production-стеком для инференса (vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналоги). * Понимание того, как устроена память GPU, что такое mixed precision, батчинг, KV-кэш и параллелизм моделей. * Умение замерять производительность, читать профилировщики (PyTorch Profiler, Nsight, DCGM) и находить баланс между скоростью, качеством ответов и стоимостью вывода. * Базовое понимание распределенных систем: таймауты, повторы запросов, отказоустойчивость при падении узла и выкат без простоев. **Будет плюсом:** * Умение писать CUDA/Triton kernels, работать с NCCL и быстрой связкой узлов (NVLink/InfiniBand, GPUDirect/RDMA). * Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом. * Знакомство с KServe или Ray Serve; сбор метрик через Prometheus/Grafana, GPU Operator или DCGM Exporter. * Навыки конвертации весов моделей, проведения quantization-aware evaluation и сравнения разных движков инференса. * Базовый C++ или Go для написания быстрых компонентов control/data plane.* комфортный современный офис рядом с м. Кутузовская * ежегодный пересмотр зарплаты, годовая премия * корпоративный спортзал и зоны отдыха * система обучения для профессионального и карьерного развития * расширенный полис ДМС с первого дня работы и страхование для семьи * льготная программа ипотеки для сотрудников * бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров * вознаграждение за рекомендацию друзей в команду Сбера.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available