Архитектор данных (команда АС ЦАРС)
Summary
The Data Architect will design and maintain database schemas, optimize SQL performance, and manage data flows for a large-scale centralized archival service. The role involves working with PostgreSQL, Greenplum, and Hadoop ecosystems within a microservices-based cloud environment.
АС ЦАРС — это централизованный архивный сервис, масштабный продукт, который охватывает всю Россию. У нас хранятся все документы всех отделений банка: электронные, физические и не только. Мы знаем, когда, где, во сколько и через чьи руки проходил документ по пути от отделения в хранилище и из хранилища в утилизацию. В хранилищах трудятся 1000 человек и сотни роботов, да, мы используем полностью автоматизированные хранилища с разреженным воздухом. Наш продукт упрощает жизнь сотрудникам банка и внешним контрагентам, предоставляет возможность найти и получить скан документа или заказать оригинал с доставкой. Продукт является облачным решением в контейнерной среде, построен в микросервисной архитектуре и активно развивается. Вся наша разработка разбита на множество кросс-функциональных команд, в каждой из которых есть представители разных функций — аналитики, разработчики, специалисты по качеству, продуктовые менеджеры. Команда формируется вокруг определённой части сервиса, а её состав определяется направлением деятельности.* развитие и сопровождение СУБД: оптимизация конфигурации, мониторинг нагрузки, планирование ёмкости (Capacity Planning) и устранение инфраструктурных узких мест
* архитектурное проектирование данных: дизайн схем для новых микросервисов, выбор стратегий шардирования и партиционирования, ревью архитектурных решений аналитиков на соответствие реляционной модели.
* построение потоков данных и аналитики: настройка логической репликации и CDC между кластерами, развитие Greenplum (distribution keys, ресурсные очереди), управление ETL-процессами в экосистеме Hadoop (HDFS/Hive/Oozie/YARN)
* оптимизация производительности SQL: рефакторинг сложных запросов, анализ планов выполнения, разработка хранимых процедур (PL/pgSQL) и проведение массовых трансформаций больших объёмов данных.
* управление жизненным циклом данных: миграция данных между версиями СУБД или движками без даунтайма, вывод из эксплуатации устаревающих компонентов, обеспечение отказоустойчивости и резервного копирования
* экспертная поддержка разработки: активное участие в код-ревью SQL-запросов разработчиков, консультирование по выбору индексов и типов данных, помощь 2–3 линиям поддержки в расследовании инцидентов (блокировки, ожидания)
* мониторинг и автоматизация процессов: внедрение мониторинга метрик БД (Prometheus/Grafana/Zabbix), написание скриптов автоматизации (Bash/Python), интеграция миграций схемы данных (Flyway/Liquibase) в CI/CD пайплайны контейнерной среды (Kubernetes)
* создание стандартов работы с данными: разработка архитектурных шаблонов и паттернов доступа к данным, определение корпоративных стандартов именования, индексирования и версионирования баз
* стратегическое планирование архитектуры: формирование целевой архитектуры хранения данных продукта (монолит vs микросервисы), оценка трудозатрат и создание технического видения развития системы на горизонте 1–3 лет
* менторство и кросс-функциональное взаимодействие: обучение разработчиков и младших специалистов работе с СУБД, согласование требований к инфраструктуре со смежными архитекторами для обеспечения целостности потоков данных.* опыт работы с СУБД PostgreSQL, Greenplum (и аналогичными) — от 5 лет. Общий опыт работы с СУБД — не менее 7 лет
* опыт работы с экосистемой Hadoop: Hive, HBase, HDFS, конфигурирование Oozie, YARN
* опыт развертывания и настройки экземпляров СУБД исходя из специфики нагрузки и рабочих процессов, которые будет обслуживать база данных
* глубокое понимание устройства реляционных баз данных, понимание реляционной модели данных и того, как эта теория отражается в реализациях реляционных СУБД
* опыт работы с оптимизацией запросов
* понимание типов блокировок в СУБД (уровни изоляции, взаимоблокировки, явные и неявные блокировки) и умение диагностировать проблемы с конкуренцией
* владение принципами физической и логической репликации и CDC (Change Data Capture): pglogical, Debezium, Kafka или аналогичные механизмы
* опыт разработки хранимых процедур, функций и триггеров на PL/pgSQL или аналогичных процедурных языках СУБД
* опыт промышленной обработки больших объёмов данных: массовые исправления, перенос и трансформация таблиц, построение ETL-процессов
* навыки написания сложных SQL-запросов с использованием оконных функций, CTE, рекурсивных запросов
Будет плюсом:
* опыт написания скриптов на Bash/Python для автоматизации процессов обслуживания, резервного копирования, мониторинга и восстановления
* опыт работы в кросс-функциональных командах и участие в полном цикле разработки
* знание и понимание языков программирования (Java, Python, Rust и т.п.)
* опыт работы в контейнерных средах (Kubernetes, OpenShift) и понимание особенностей работы СУБД в таких средах
* опыт настройки мониторинга СУБД (Prometheus + экспортеры, Zabbix, Grafana) и построения алертинга
* навыки работы с генеративными AI-моделям* комфортный современный офис в Москве, ш Варшавское (Бизнес-центр Чайка Плаза), 25Астр6
* график работы – офис на период испытательного срока, далее возможен гибрид
* ежегодный пересмотр зарплаты, квартальная и годовая премия
* корпоративный спортзал и зоны отдыха
* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
* программа адаптации и помощь руководителя на старте (для Junior позиций)
* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
* подписка Прайм с возможностью совместного использования на трёх близких
* вознаграждение за рекомендацию друзей в команду Сбера