Ведущий инженер данных (LLM)
NewBe an early applicantSummary
Lead data engineer on ЦРТ's LLM platform for government and enterprise clients. Connects external data sources, designs data models, cleans and normalizes data, and prepares data for search and RAG — chunking, embeddings, vector/hybrid search, retrieval and reranking. Core stack: SQL, ETL/ELT pipelines, vector stores, Python, Kafka, Airflow, PostgreSQL, ClickHouse, Elasticsearch.
Сейчас мы усиливаем усиливаем продуктовую команду и ищем Ведущего инженера данных, который будет отвечать за организацию и подготовку данных для AI-решений (от подключения внешних источников и проектирования модели данных до подготовки данных для поиска и RAG).
КАКИЕ ЗАДАЧИ НЕОБХОДИМО РЕШАТЬ:
- Определять источники данных для AI-решений: базы данных, документы, API, файловые хранилища, внешние системы и потоки обновлений
- Проектировать модели данных: сущности и связи, версии, метаданные, lineage, права доступа и правила актуализации
- Организовывать сбор и обработку данных из внешних источников: очистку, нормализацию, дедупликацию, классификацию и разметку
- Формировать единое эталонное представление объекта (golden record) при объединении данных из нескольких источников
- Подготавливать данные для поиска и RAG: chunking, embeddings, индексация, векторный и гибридный поиск
- Настраивать retrieval и reranking, обеспечивать обновление индексов при изменении исходных данных
- При необходимости готовить датасеты для обучения или дообучения моделей, если задача не решается с помощью RAG
- Определять показатели качества данных и retrieval, организовывать их мониторинг: полнота, актуальность, precision/recall, latency и другие показатели
- Взаимодействовать с LLM-инженерами, аналитиками и разработчиками при проектировании AI-решений
НАШИ ОЖИДАНИЯ:
- От 4 лет опыта в Data Engineering, Data Platform, Data Architecture или смежной области
- Уверенное знание SQL и реляционных баз данных
- Опыт построения ETL/ELT-процессов и data pipelines
- Опыт интеграции данных из различных источников: БД, API, файлов и внешних систем
- Практический опыт проектирования моделей данных и работы с качеством данных, метаданными и версиями
- Опыт работы с большими объёмами данных
- Практический опыт подготовки данных для поиска, ML или LLM/RAG-систем
- Понимание принципов chunking, embeddings, vector search и hybrid search
- Опыт работы с векторными хранилищами или поисковыми системами
- Умение самостоятельно разбираться в структуре и качестве новых источников данных
БУДЕТ ПЛЮСОМ:
- Опыт разработки и эксплуатации RAG-систем в production
- Опыт оптимизации retrieval и reranking
- Python для обработки данных и разработки data pipelines
- Kafka или другие системы потоковой обработки данных
- Airflow или аналогичные инструменты оркестрации
- PostgreSQL, ClickHouse, Elasticsearch/OpenSearch, векторные хранилища и аналогичные технологии
- Опыт подготовки датасетов для supervised learning / fine-tuning
- Понимание метрик оценки RAG: retrieval quality, groundedness, faithfulness, coverage