Разработчик интеграции Apache Spark с YTsaurus
YTsaurus — это основная платформа для анализа и построения batch-процессов в Яндексе. В рамках проекта SPYT мы занимаемся интеграцией Apache Spark с YTsaurus. Ищем разработчика, который будет поддерживать все современные версии Spark, развивать интеграции и работать над опенсорс-проектом.Повышение эффективности интеграции Apache Spark и YTsaurus
Как у Spark, так и у YTsaurus регулярно выходят новые версии, которые расширяют набор предоставляемых этими инструментами возможностей. Одна из основных задач команды — постоянно интегрировать их, чтобы обеспечивать наиболее эффективное взаимодействие. Кроме того, мы проводим регулярные бенчмарки, в ходе которых определяем проблемные зоны в интеграции и устраняем их. Расширение области применения инструмента
Мы находимся в тесном контакте с дата-инженерами — как с теми, кто работает в Яндексе, так и с опенсорс-пользователями: помогаем им наиболее эффективно решать задачи при помощи нашего инструмента. На основе обратной связи от них, а также общих трендов развития инструментов для дата-инженерии мы регулярно актуализируем план дальнейшей интеграции. Продвижение опенсорс-проекта
С 2023 года код YTsaurus, в том числе и SPYT, есть в открытом доступе, поэтому мы активно работаем над развитием внешнего комьюнити вокруг проекта.* Работали с Apache Spark не менее трёх лет и знаете, как добиться от него максимальной эффективности * Умеете разрабатывать под JVM на Java и Scala, а также на Python * Понимаете принципы распределённого хранения и обработки больших объёмов данных* Работали с Hadoop-стеком (HDFS, YARN) * Работали с Docker и Kubernetes * Принимали участие в работе над опенсорс-проектом * Знаете C++
Как у Spark, так и у YTsaurus регулярно выходят новые версии, которые расширяют набор предоставляемых этими инструментами возможностей. Одна из основных задач команды — постоянно интегрировать их, чтобы обеспечивать наиболее эффективное взаимодействие. Кроме того, мы проводим регулярные бенчмарки, в ходе которых определяем проблемные зоны в интеграции и устраняем их. Расширение области применения инструмента
Мы находимся в тесном контакте с дата-инженерами — как с теми, кто работает в Яндексе, так и с опенсорс-пользователями: помогаем им наиболее эффективно решать задачи при помощи нашего инструмента. На основе обратной связи от них, а также общих трендов развития инструментов для дата-инженерии мы регулярно актуализируем план дальнейшей интеграции. Продвижение опенсорс-проекта
С 2023 года код YTsaurus, в том числе и SPYT, есть в открытом доступе, поэтому мы активно работаем над развитием внешнего комьюнити вокруг проекта.* Работали с Apache Spark не менее трёх лет и знаете, как добиться от него максимальной эффективности * Умеете разрабатывать под JVM на Java и Scala, а также на Python * Понимаете принципы распределённого хранения и обработки больших объёмов данных* Работали с Hadoop-стеком (HDFS, YARN) * Работали с Docker и Kubernetes * Принимали участие в работе над опенсорс-проектом * Знаете C++