Middle AI Guardrails Developer (Platform V AI Guardrails)
Summary
Develops and maintains AI guardrails for LLM systems to prevent harmful outputs, jailbreaks, and data leaks while ensuring model utility, using Python, NLP, and ML frameworks.
Мы разрабатываем системы безопасности и контроля для LLM и генеративных AI-моделей. Наша цель — создавать надёжные guardrails, которые предотвращают нежелательное поведение моделей, токсичный контент, jailbreak-атаки, утечки данных и нарушения политик, сохраняя при этом полезность и качество ответов. Мы ищем сильного специалиста в команду разработки. Человек будет не просто писать код, а глубоко понимать предметную область: проектировать и развивать защитные механизмы вокруг LLM, проводить активную аналитику собственного решения и решений конкурентов, выявлять слабые места и предлагать улучшения на основе данных и экспериментов.
Ключевой фокус — сочетание hands-on разработки и исследовательско-аналитической работы. Нам нужен человек с экспертизой, который понимает, почему работает (или не работает) тот или иной подход, а не просто применяет готовые библиотеки.### Твои задачи:
* разрабатывать и улучшать компоненты AI Guardrails: фильтры контента, системы детекции токсичности, bias, PII, jailbreak-попыток, prompt injection и других рисков
* интегрировать и дообучать модели классификации / модерации (toxicity, hate speech, self-harm, sexual content и др.)
* проектировать и реализовывать пайплайны pre-/post-processing для LLM (input/output filtering, rewriting, refusal mechanisms)
* создавать и поддерживать evaluation-фреймворки: бенчмарки, red-teaming, adversarial testing, метрики безопасности и robustness
* работать с LLM API / open-source моделями, оптимизировать latency и качество guardrails
* участвовать в разработке политик безопасности, документировать решения
* анализировать инциденты, улучшать покрытие edge-cases и снижать false positive/negative.### Мы ожидаем, что у тебя есть:
* 2–4+ года коммерческого опыта в ML/AI-разработке (Python)
* опыт работы с LLM (OpenAI, Anthropic, open-source: Llama, Mistral, Qwen и т.д.)
* практический опыт построения систем модерации / content safety / guardrails или похожих задач (toxicity detection, PII redaction, prompt defense)
* хорошее знание NLP: классификация текста, embeddings, fine-tuning (LoRA/QLoRA), evaluation
* опыт с PyTorch / Hugging Face Transformers, LangChain / LlamaIndex / аналогичными фреймворками
* понимание основных угроз LLM (jailbreaks, prompt injection, data leakage, hallucination risks)
* умение писать чистый, тестируемый код, работать с CI/CD, Docker.
* самостоятельность и ownership: способность брать задачу end-to-end (от исследования до production)
* навыки работы с генеративными AI-моделями.
**Будет плюсом:**
* опыт red-teaming / adversarial ML / safety evaluation
* знание техник alignment (RLHF, DPO, constitutional AI) и safety benchmarks (HarmBench, JailbreakBench, AdvBench и др.)
* опыт работы с vector DB, RAG-пайплайнами и их безопасностью
* знание multi-modal guardrails (изображения + текст)
* опыт production-deployment ML-систем (FastAPI, Kubernetes, мониторинг).
* английский на уровне чтения документации.### **Работа в СберТехе - это:**
* гибридный формат работы
* годовой бонус и ежегодный пересмотр зарплаты
* статус аккредитованной ИТ-компании
* расширенный ДМС с первого дня и льготное страхование для семьи
* корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях
* 90 дней удаленной работы из любого региона РФ
* льготная ипотека в Сбере
* бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.