Разработчик инфраструктуры LLM
Наша команда фокусируется на скорости, надёжности и эффективности применения больших языковых моделей (LLM) в продакшн-среде, работая на кластерах с сотнями и тысячами GPU. Наша цель — выжать максимум производительности из железа и оптимизировать использование вычислительных ресурсов и сети.Оптимизация инференсных движков
Вам предстоит повышать эффективность и снижать latency при выполнении LLM-инференса на GPU. Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на стабильность и скорость инференса. Исследование и внедрение
Вам предстоит работать с методами оптимизации инференса (квантованием, прунингом) и современными подходами к параллелизации.* Владеете C++ и Python: имеете уверенные навыки низкоуровневого программирования и оптимизации * Работали с GPU (NVIDIA) и CUDA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы под CUDA * Глубоко понимаете архитектуру Transformer: знакомы с внутренними механизмами (attention, FFN, нормализацией) и их реализациями * Знаете подходы к параллелизации: понимаете Data Parallel, Tensor Parallel, Pipeline Parallel (желательно ещё Expert Parallel) для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, связанные с эксплуатацией больших моделей в продакшне * Умеете эффективно работать в команде и делиться знаниями* Работали с современными решениями для оптимизации инференса: vLLM, TensorRT-LLM (TRT-LLM) или sglang
Вам предстоит повышать эффективность и снижать latency при выполнении LLM-инференса на GPU. Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на стабильность и скорость инференса. Исследование и внедрение
Вам предстоит работать с методами оптимизации инференса (квантованием, прунингом) и современными подходами к параллелизации.* Владеете C++ и Python: имеете уверенные навыки низкоуровневого программирования и оптимизации * Работали с GPU (NVIDIA) и CUDA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы под CUDA * Глубоко понимаете архитектуру Transformer: знакомы с внутренними механизмами (attention, FFN, нормализацией) и их реализациями * Знаете подходы к параллелизации: понимаете Data Parallel, Tensor Parallel, Pipeline Parallel (желательно ещё Expert Parallel) для распределённого инференса или обучения * Интересуетесь LLM и MLOps: понимаете задачи и вызовы, связанные с эксплуатацией больших моделей в продакшне * Умеете эффективно работать в команде и делиться знаниями* Работали с современными решениями для оптимизации инференса: vLLM, TensorRT-LLM (TRT-LLM) или sglang