MLOps-инженер
Summary
MLOps engineer to run self-hosted LLM inference (vLLM/SGLang) on NVIDIA GPUs behind a LiteLLM gateway in a closed, air-gapped corporate environment — plus Prometheus/Grafana monitoring, model evaluation/licensing, client tooling setup, and a RAG retrieval layer over internal code, docs, and tasks. Remote position based in Moscow.
Обязанности
-
Развернуть и настроить сервер инференса (vLLM, при необходимости SGLang) на GPU-узле;
-
Подобрать режим работы под нагрузку: квантизация, размер батча, длина контекста, распределение моделей по картам, реплики под конкурентность;
-
Снять реальные показатели: пропускная способность, задержка, поведение под пиковой нагрузкой, давление кэша контекста;
-
Поднять единый шлюз (LiteLLM): вход через корпоративную аутентификацию, разграничение прав по командам, квоты, журналирование, защитные фильтры (вырезание секретов и персональных данных);
-
Обеспечить единственную точку входа: сервер инференса не виден клиентам напрямую, доступ только из корпоративной сети;
-
Мониторинг и оповещения: загрузка карт, память, очереди, задержки, ошибки (Prometheus, Grafana);
-
Процедура обновления моделей в закрытом контуре: подготовка в отдельной зоне, проверка подписей и контрольных сумм, перенос, внутренний реестр, выкатка с возможностью отката;
-
Дежурство по сервису, разбор инцидентов, ёмкостное планирование;
-
Отбор и проверка открытых моделей под наши задачи: чат и агент, автодополнение, работа с кодом. Сравнение кандидатов на нашем стенде, а не по публичным таблицам;
-
Проверка лицензий на право коммерческого использования внутри компании;
-
Замер полезности: доля принятых подсказок, время на правки, обратная связь команд;
-
Настройка клиентов в средах разработки (Continue, Cline, Tabby, терминальные инструменты) и браузерного интерфейса для ролей, работающих без среды разработки: тестирование, аналитика, управление проектами;
-
Подбор моделей и настроек под сценарии разных ролей, инструкции, помощь командам на старте;
-
Обучающие материалы и кооткие занятия при выходе на все команды;
-
Слой извлечения над репозиториями кода, затем над внутренней документацией и трекером задач;
-
Конвейер загрузки: разбор документов, разбиение, локальная модель эмбеддингов, векторное хранилище, инкрементальное обновление;
-
Соблюдение прав доступа при выдаче: человек не должен получить через ассистента документ, который ему не положено видеть. Вырезание секретов и персональных данных при загрузке.
Требования
-
Опыт вывода моделей в промышленную эксплуатацию: не «запускал на ноутбуке», а работающий сервис с пользователями и дежурством;
-
Практика с современными серверами инференса (vLLM, SGLang, TensorRT-LLM или аналоги), понимание непрерывного батчинга, работы с кэшем контекста, квантизации;
-
Уверенный Linux, Docker, работа с GPU NVIDIA (драйверы, CUDA, распределение ресурсов, диагностика);
-
Инфраструктура как код и автоматизация выкаток, работа с внутренними реестрами артефактов;
-
Мониторинг и разбор проблем производительности: умение находить узкое место и подтверждать выводы измерениями;
-
Python на уровне уверенной автоматизации и работы с библиотеками инференса;
-
Готовность работать в закрытом контуре: без внешних сервисов, с процедурами переноса и проверкой целостности;
-
Опыт построения слоя извлечения знаний с учётом прав доступа будет преимуществом;
-
Понимание экономики железа: расчёт ёмкости, обоснование закупки, выбор между наращиванием реплик и более крупным узлом;
-
Опыт эксплуатации в регулируемой среде (финансы, платежи): аудит, разграничение доступа, требования к журналированию;
-
Знакомство с инструментами разработчика на стороне клиента и умение объяснить их коллегам.
Условия
-
Конкурентная заработная плата — обсудим по итогам интервью;
-
Удаленный формат работы;
-
График 5/2: с 09:00 до 18:00 или с 10:00 до 19:00;
-
Предоставляем мощный рабочий ноутбук;
-
100% компенсация больничных;
-
Скидка на изучение английского языка в Skyeng.