freehire launches on Product Hunt on 26 August.

Follow →

Python-разработчик (Gigadata)

Open 25d

Summary

Develops and optimizes a large-scale web-crawling system in Python to feed AI training data, focusing on async I/O, sharding, and distributed architecture.

Команда занимается сбором качественных данных, которые принципиально важны для обучения передовых моделей ИИ.

Обязанности

  • Проектировать и разрабатывать ключевые компоненты распределённой системы массового краулинга.
  • Оптимизировать пропускную способность системы: асинхронный I/O, connection pooling, DNS-кэширование, батчинг запросов.
  • Проектировать и развивать архитектуру URL-фронтира: шардирование, приоритизация, дедупликация на масштабе миллиардов URL.
  • Разрабатывать интеллектуальные crawl-планировщики: адаптивное расписание обхода, приоритизация по freshness и значимости.
  • Реализовывать механизмы обнаружения и обхода crawler-ловушек (spider traps, infinite loops).
  • Проектировать пайплайны обработки данных: парсинг, нормализация, дедупликация контента, индексация.
  • Обеспечивать отказоустойчивость на уровне архитектуры: stateless-воркеры, автоматический failover, graceful degradation.
  • Оптимизировать использование ресурсов: CPU, память, сетевой bandwidth, стоимость облачных ресурсов.
  • Разрабатывать системы мониторинга и observability для контроля здоровья краулера в реальном времени.
  • Работать с геораспределённой инфраструктурой для снижения латентности и увеличения покрытия.

Требования

  • Коммерческий опыт разработки на Python от 6 лет.
  • Глубокая экспертиза в асинхронной и мультипоточной разработке (asyncio, uvloop, multiprocessing).
  • Отличное понимание сетевого стека: TCP/UDP, HTTP/1.1/2/3, TLS, DNS, WebSocket.
  • Опыт проектирования и эксплуатации распределённых систем высокой нагрузки.
  • Практический опыт работы с веб-краулерами на масштабе (десятки миллионов страниц в сутки).
  • Опыт работы с распределёнными очередями и потоковыми системами (Kafka, Redis Streams, RabbitMQ).
  • Опыт работы с реляционными (PostgreSQL) и нереляционными БД (Redis, ClickHouse, MongoDB).
  • Понимание принципов consistent hashing, шардирования, репликации.
  • Опыт работы с Docker, Kubernetes, CI/CD.
  • Навыки глубокого troubleshooting: tcpdump, strace, perf, flamegraphs.
  • Опыт проведения Code Review и формирования технических стандартов.

Условия

  • Крупнейшее DS&AI community — более 600 DS-специалистов банка.
  • Дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира.
  • Возможность быть соавтором НИРов и статей для международных конференций.
  • Возможность выбрать удобный формат работы: гибрид или офис.
  • Ежегодный пересмотр зарплаты, годовая премия.
  • Корпоративный спортзал и зоны отдыха.
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития.
  • Расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа.
  • Бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров.
  • Вознаграждение за рекомендацию друзей в команду Сбера.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available