freehire launches on Product Hunt on 26 August.

Follow →

Computer Vision Research Engineer

Зарплата: от 800000 KZT (на руки)

Виктори-Технолоджи занимается автоматизацией бизнес-процессов и разработкой цифровых платформ.

В команде более 50 специалистов: аналитики, разработчики (backend/frontend/fullstack), архитекторы, проектные менеджеры, команда интеграции и отдел технической поддержки.

Приглашаем в команду Computer Vision Engineer, который возглавит разработку алгоритмов глубокого анализа видео- и аудиопотоков.

Главный фокус роли: Детекция эмоций и психофизиологических состояний (мимика, жесты, тембр, интонации) с использованием передовых мультимодальных архитектур.

Задачи:
  • Разработка и внедрение ML-моделей для анализа видео и аудио данных;
  • Детекция и классификация эмоций и психофизиологических состояний (стресс, ложь, страх, гнев, нервозность) на основе мимики, микродвижений, жестов, тембра голоса и интонации;
  • Построение пайплайнов для предварительной обработки видео/аудио, извлечения признаков (landmarks, аудио-эмбеддингов, спектрограмм);
  • Разработка и внедрение моделей с использованием CNN, RNN, Transformer, Audio/Video Fusion, LLM/RAG-архитектур для интерпретации результатов;
  • Разработка методик валидации моделей, включая синхронизацию аудио и видео, cross-validation, оценку метрик (accuracy, precision, recall, F1-score);
  • Эксперименты с различными нейросетевыми архитектурами (Vision Transformers, Audio Transformers, Bi-LSTM/GRU);
  • Исследование методов интерпретируемости и объяснимости моделей для юридически значимых выводов (Explainable AI);
  • Проведение ревью кода существующих ML-моделей и оценка качества реализации;
  • Оптимизация, улучшение и изменение архитектуры моделей для повышения точности, стабильности и производительности;
  • Поддержка моделей в продакшн-среде, мониторинг результатов и устранение багов;
  • Разработка API и механизмов для передачи интерпретированных результатов моделей в действующие системы.
Требования:
  • Опыт работы 3+ лет в ML/CV/NLP/RAG, предпочтительно в проектах с анализом видео/аудио;
  • Глубокое понимание компьютерного зрения, обработки аудио и мультимодальных данных;
  • Опыт работы с PyTorch/TensorFlow;
  • Опыт разработки и внедрения CNN, RNN, Transformer, Vision/Audio Transformers, multimodal fusion;
  • Практические знания по подготовке данных, аугментации, извлечению признаков (landmarks, спектрограммы, embeddings);
  • Опыт работы с RAG-архитектурой или LLM для интерпретации результатов ML-моделей;
  • Опыт интеграции ML-моделей через API с внешними системами;
  • Опыт работы с пайплайнами ML, MLOps, Docker.
Условия:
  • Работа в офисе в районе Президентского парка;
  • Проекты в области LegalTech и цифровизации;
  • Живые задачи, быстрые решения и пространство для инициативы;
  • Оформление в штат, испытательный срок 3 месяца;
  • График: 5/2, 9:00–18:00.

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available