DevOps-инженер Data-платформы
Проект «База знаний» - это внедрение базовой дисциплины управления критическими* данными корпоративного хранилища:
- как структурированными (таблицы, витрины, отчёты);
- так и неструктурированными (Confluence, Wiki — знания о данных).
Цель проекта – создание работающей системы управления критическими данными, обеспечивающей:
- полную идентификацию и описание источников,
- измеримое качество через дата-контракты,
- единую навигацию по данным и знаниям о них,
- дисциплину поддержания актуальности,
- наличие источников в целевом состоянии.
Чем предстоит заниматься:
- Разрабатывать, настраивать и поддерживать CI/CD-пайплайны для ETL-процессов, скриптов и автоматизированных проверок качества данных;
- Организовывать версионирование и управление исходным кодом всех проектных артефактов: ETL-скриптов, тестов, конфигураций и технической документации;
- Поддерживать среды разработки, тестирования и промышленной эксплуатации, обеспечивать их стабильность и согласованность;
- Автоматизировать развертывание инструментов контроля качества данных и их интеграцию с существующими пайплайнами;
- Настраивать автоматизированные проверки качества данных на инфраструктурном уровне, включая контроль доступности и потребления инфраструктурных ресурсов;
- Разрабатывать и поддерживать систему мониторинга, метрик, логирования и алертинга для ETL-процессов и инфраструктуры;
- Настраивать централизованный сбор и поиск логов, корреляцию событий и диагностику инцидентов при переносе процессов на целевую архитектуру;
- Автоматизировать повторный запуск и пересборку данных при сбоях, минимизируя ручное вмешательство и время восстановления;
- Настройка разработанной ролевой модели доступа в разворачиваемых системах;
- Контролировать и оптимизировать производительность инфраструктуры: масштабирование, распределение ресурсов, оптимизацию запросов и управление ресурсами кластера;
- Настраивать резервное копирование данных и конфигураций, регулярно проверять процедуры восстановления;
- Разрабатывать и поддерживать планы аварийного восстановления, инструкции и регламенты с учетом целевых показателей RTO/RPO;
- Участвовать в управлении инцидентами: анализировать метрики и логи, диагностировать инфраструктурные проблемы, выполнять эскалацию и проводить пост-инцидентный анализ;
- Документировать архитектуру инфраструктуры, пайплайны, процессы развертывания, мониторинга и восстановления;
- Координировать технические зависимости с инфраструктурными и платформенными командами: выделение ресурсов, настройка доступов, обновление компонентов и устранение ограничений.
Наши пожелания к кандидатам:
- Опыт работы DevOps-, DataOps-, SRE- или Platform-инженером от 3 лет;
- Опыт работы с data-платформами (DWH/Data Lake/Data Lakehouse и т.п.) и корпоративными хранилищами данных;
- Практический опыт построения и сопровождения CI/CD-пайплайнов;
- Опыт автоматизации развертывания приложений, ETL-процессов и инфраструктурных компонентов;
- Опыт работы с Linux и написания скриптов автоматизации на Bash, Python или другом подходящем языке;
- Практический опыт работы с объектными хранилищами данных, совместимыми с S3 API;
- Практический опыт работы с Kubernetes или совместимыми платформами контейнерной оркестрации, включая OKD, OpenShift или аналогичные решения;
- Опыт настройки мониторинга, метрик, логирования и алертинга;
- Опыт работы с резервным копированием, восстановлением и тестированием disaster recovery-процедур;
- Умение анализировать производительность систем, находить узкие места и оптимизировать использование ресурсов.
Будет преимуществом:
- Знание ClickHouse, Greenplum или других платформ хранения и обработки данных;
- Опыт проведения сайзинга (Capacity Planning): расчет необходимых вычислительных ресурсов (CPU, RAM, Storage, Network) под текущие и прогнозируемые нагрузки систем;
- Навык работы с ИИ.
Мы предлагаем:
-
Доступ к современным AI-инструментам;
-
Работу в стабильной и активно развивающейся компании – лидере инвестиционного рынка;
-
Современный стек технологий, амбициозные проекты, возможность профессионального развития;
-
Гибридный или удаленный режим работы;
-
ДМС с первого месяца работы.
