freehire launches on Product Hunt on 26 August.

Follow →

ML Engineer (LLM)

Summary

Deploy and optimize large language models (LLMs) in production, quantize models, fine-tune with SFT/LoRA/RLHF, and build RAG/agentic pipelines for high-load systems.

Обязанности:
  • Деплой, конфигурирование и поддержка LLM-сервисов в продакшне (vLLM, SGLang, TGI и др.).
  • Оптимизация inference-пайплайнов для высоконагруженных систем (10 000+ одновременных пользователей).
  • Квантизация моделей (GPTQ, AWQ, GGUF, SmoothQuant и др.).
  • Fine-tuning и дообучение LLM (SFT, LoRA/QLoRA, RLHF/DPO).
  • Подбор моделей, проведение экспериментов и исследований в сфере LLM.
  • Разработка решений на основе LLM: RAG, агенты, function calling и др.

Улучшение существующих решений и мониторинг качества моделей в промышленной эксплуатации.

Требования:
  • Уверенное знание LLM-serving фреймворков: vLLM, SGLang и других фреймворков для Text Generation Inference— понимание их архитектурных отличий, сценариев применения, преимуществ и ограничений
  • Глубокое понимание механизмов оптимизации инференса: continuous batching, PagedAttention, speculative decoding, flash attention, tensor parallelism, pipeline parallelism
  • Опыт квантизации LLM: GPTQ, AWQ, GGUF, INT4/INT8, SmoothQuant
  • Опыт дообучения LLM: SFT, LoRA / QLoRA, DPO, RLHF — понимание когда и что применять
  • Работа с популярными open-source моделями (LLaMA, Mistral, Qwen, DeepSeek, GPT OSS) и их весами (HuggingFace Transformers)
  • Понимание и практический опыт построения RAG-систем, цепочек промптов, agentic-пайплайнов
  • Опыт работы с высоконагруженными системами: оценка throughput/latency, профилирование, горизонтальное масштабирование, балансировка запросов
  • Базовое понимание аппаратной части: GPU-архитектуры (NVIDIA A100/H100/B200), VRAM management, NVLink, multi-GPU setups
  • Понимание и изучение SOTA-решений в сфере LLM для последующей имплементации в проект
  • Знания базовых алгоритмов машинного обучения и основ трансформерных архитектур (attention, MoE, RoPE и пр.)
  • Знание OpenAI-совместимых API
  • Опыт с multimodal LLM (Kimi K2.5, Qwen-VL и пр.)
  • Знание классических и современных NLP-задач: NER, text classification, summarization, machine translation, question answering, text generation
  • Понимание этапов NLP-пайплайна: токенизация, нормализация, работа с BPE/SentencePiece/tiktoken
  • Опыт работы с embeddings-моделями (sentence-transformers, E5, BGE и пр.) и векторными хранилищами (Weaviate, Qdrant, Milvus, FAISS) в контексте RAG и semantic search
  • Понимание метрик качества NLP-моделей: BLEU, ROUGE, BERTScore, perplexity, human eval

Будет плюсом:

  • Понимание архитектур диффузионных моделей: DDPM, DDIM, LDM (Latent Diffusion), flow matching
  • Опыт работы с text-to-image моделями (Stable Diffusion, FLUX, Kandinsky и пр.) и их компонентами — VAE, UNet/DiT, CLIP/text encoder
  • Базовое понимание video generation моделей (Wan, CogVideoX, HunyuanVideo, Mochi и пр.) и их отличий от image-моделей
  • Базовое понимание audio generation моделей (AudioCraft/MusicGen, Stable Audio, Bark и пр.)
  • Опыт fine-tuning диффузионных моделей: DreamBooth, LoRA, ControlNet, IP-Adapter
  • Знание inference-оптимизаций для диффузионок: SDXL Turbo / LCM / Lightning (distillation-подходы), cfg-distillation, tiling, xformers, torch.compile

Опыт с диффузионными, image/video/audio generation моделями и их fine-tuning/оптимизацией.

Условия:​​​​​​​

Официальное трудоустройство в соответствии с ТК РФ;

Стабильная «белая» заработная плата, выплаты два раза в месяц (5 и 20 число), уровень зарплаты обсуждается по итогам интервью;

Комфортный офис в центре города (новый айти-парк);

График работы, 5/2;

Поддержка профессионального развития;

Участие в конференциях и обучающих мероприятиях за счет компании;

Демократичный, молодой коллектив.

Неформальные встречи и корпоративные мероприятия.

Бронирование через военкомат при наличии военного билета (для военнообязанных) и айти-отсрочка.

Дресс-код casual

See also