Lead Product SRE в Скоринг [Big Data, МТС Веб Сервисы]
Summary
Lead Product SRE responsible for reliability practices, SLA/SLO/SLI methodology, fault-tolerance standards, and observability across a B2B risk/anti-fraud scoring product built on Big Data infrastructure (Hadoop, ClickHouse, Kafka).
Скоринг - это коммерческий B2B продукт для уменьшения рисков и затрат B2B-клиентов. Скоринг состоит из 2-х направлений: рисковый и антифрод.
Управлять сервисами и практиками надежности ИТ-продуктов: формировать бэклог, определять стратегию SRE для продуктов;
Внедрять единую методологию управления надежностью (SLA/SLO/SLI) совместно со смежными Big Data продуктами, обеспечивая сквозную стабильность инфраструктуры и приложений кластера;
Проектировать и развивать общие стандарты отказоустойчивости распределенных систем;
Лидировать кросс-продуктовые рабочие группы по надежности: внедрять создание единых стандартов мониторинга, алертинга и распределенной трассировки для Big Data инфраструктуры;
Управлять эффективностью использования ресурсов (Capacity Planning) высоконагруженных кластеров в масштабах всей экосистемы продуктов;
Выстраивать общую культуру разбора инцидентов со смежными командами, превращая аварии на стыке систем в общие инженерные практики и системные улучшения;
Менторить команды разработки и аналитики, помогая им проектировать сервисы с учетом нефункциональных требований и продуктовых SLO.
Опыт работы в роли SRE / Infrastructure / Platform Lead или Technical Product Manager (Platform) от 3 лет в крупных высоконагруженных или Big Data проектах;
Продуктовое мышление: умение собирать требования у внутренних клиентов (разработка, дата-инженеры), приоритизировать бэклог и оцифровывать надежность в бизнес-метрики;
Практический опыт выстраивания общих технических стандартов и процессов в кросс-продуктовой среде;
Отличное понимание специфики надежности Big Data решений и Highload-архитектуры: принципы работы аналитических БД (Hadoop, Clickhouse) распределенных брокеров (Apache Kafka), и микросервисов;
Экспертные знания в области построения систем сквозного наблюдаемости (Observability: Prometheus, VictoriaMetrics, OpenTelemetry, Grafana) на стыке инфраструктуры и бизнес-метрик;
Глубокое понимание архитектурных паттернов отказоустойчивости распределенных систем и жизненного цикла поставки ценности;
Сильные коммуникативные навыки: умение договариваться, защищать продуктовые метрики перед стейкхолдерами и мягко внедрять инженерные изменения.
собственную платформу MTS Ocean для получения ИТ-ресурсов, а это значит, что деплой, мониторинг, observability — не будут для тебя проблемой, ты сможешь сосредоточиться на фичах;
профессиональные гильдии инженеров, где мы поддерживаем друг друга и помогаем стать лучше;
внутреннюю площадку TechTalks для обмена опытом, дискуссий, развития навыков самопрезентации;
участие во внешних IT конференциях. Мы выступаем на HighLoad++, DataFest, Mobius, Test Driven Conf, Joker, DevOps, Матемаркетинг и даже проводим собственную конференцию по архитектуре True Tech Arch;
полезные курсы и вебинары в корпоративном университете и электронную библиотеку.
А еще:
ДМС с первого месяца работы, включая стоматологию;
страхование от несчастных случаев с 1 месяца работы. Материальную помощь в сложных жизненных ситуациях;
отпуск 28 календарных дней;
прием врачей общей практики и массаж в офисе;
мобильная связь за счет компании и льготные тарифы для близких;
подписка на онлайн-кинотеатр KION, сервис МТС Музыка, книжный сервис Строки от МТС, безлимитные мессенджеры и соцсети.