Data Scientist в команду Horizontal ML Technologies
Summary
Data Scientist building OCR platforms, computer vision pipelines, and VLM solutions using Python, PyTorch, and OpenCV, taking models from data collection through to production in high-load services.
О команде: Команда Horizontal ML Technologies создаёт и развивает горизонтальные ML-технологии для Авито. Одно из направлений — OCR: распознавание текста с изображений. Также команда решает задачи, связанные с визуальным качеством фотографий.OCR-модели помогают решать задачи модерации и антифрода, а также извлекать полезную информацию из текста на фотографиях. Отдельное направление — развитие OCR-платформы для распознавания документов: команда создаёт классические пайплайны с детектором и распознавателем, а также решения на базе VLM.В каждом проекте команда проводит полный цикл ML-разработки: от сбора и разметки данных до обучения моделей и выкатки в прод высоконагруженных сервисов.Мы ищем CV-инженера с опытом решения разных задач компьютерного зрения
Примеры будущих задач: — развивать OCR-платформу: улучшать качество распознавания текущих типов документов и разрабатывать решения для новых;— строить CV- и классические OCR-пайплайны: обучать детектор и распознаватель, работать с классификацией типа текста, качеством изображения, пре- и постпроцессингом;— разрабатывать VLM-решения: дообучать модели с помощью LoRA, работать с промптингом, проектировать архитектуру решения, оценивать и контролировать качество;— собирать и размечать данные вручную и автоматически, генерировать синтетические датасеты;— оптимизировать инференс моделей и внедрять их в прод высоконагруженных сервисов.
Мы ждем, что вы: — имеете от 3 лет практического опыта работы с ML-моделями в области компьютерного зрения, опыт в OCR будет преимуществом;— умеете самостоятельно вести CV-проекты от идеи до продакшена;— глубоко понимаете устройство CV-моделей: особенности CNN и трансформерных архитектур для классификации, детекции и сегментации;— понимаете, как устроены современные VLM, и решали с их помощью прикладные задачи;— обладаете широким кругозором в Data Science: классический ML, NLP, CV, LLM;— уверенно владеете Python и PyTorch, а также знакомы с методами классического компьютерного зрения в OpenCV;— имеете опыт оптимизации и вывода моделей в прод;— умеете общаться с бизнесом простым языком, объяснять метрики и результаты.
Будет здорово, если вы: — имеете опыт написания и чтения кода на Go;— участвовали в соревнованиях или хакатонах по ML, занимали призовые места;— окончили Академию Авито, ШАД или AI Masters.
Работа у нас — это: — возможность влиять на продукт: ваши решения будут улучшать опыт миллионов пользователей;— сложные технологические задачи на большом масштабе;— мощное железо: доступ к производительным GPU-кластерам для экспериментов;— сильное комьюнити: команда экспертов, с которой можно обсуждать идеи и подходы;— развитие: бюджет на обучение, курсы, конференции и профессиональную литературу;— забота о здоровье: ДМС со стоматологией с первого дня, в офисе принимают терапевт и массажист;— гибкость: возможность работать удалённо или из офисов в 4 городах России.