Point your AI agent at freehire and let it find you a job.

Get the CLI →

Sasha AI

NewBe an early applicant

Junior ML Engineer (Speech: ASR / TTS / AMD)

Posted 2 views
Discussion

Summary

Junior ML engineer at Sasha AI builds the speech pipeline behind phone-call AI agents: fine-tuning and evaluating Russian ASR on noisy 8 kHz telephony audio, improving TTS naturalness and speed, and detecting answering machines/VAD. Core stack: Python, PyTorch, speech models (Whisper, NeMo, Silero, etc.) and ONNX/TensorRT inference optimization.

Зарплата: 100000–200000 RUR (на руки)

Добрый день!

Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.

Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽.

Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.

Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.

Каждый звонок проходит через речевой пайплайн: распознавание речи, определение автоответчика, синтез голоса. От качества и скорости этих моделей зависит, будет ли разговор звучать естественно. В эту команду мы ищем junior ML-инженера.

Чем предстоит заниматься

  • ASR: дообучать и оценивать модели распознавания русской речи на телефонном аудио (8 кГц, шумы, перебивания). Считать WER/CER и разбирать ошибки.
  • TTS: улучшать естественность и скорость синтеза, работать с голосами, ударениями и нормализацией текста (числа, адреса, телефоны).
  • AMD (Answering Machine Detection): отличать живого человека от автоответчика, голосовой почты и IVR за первые секунды звонка.
  • VAD и turn-taking: определять конец реплики и перебивания, чтобы агент не молчал и не говорил поверх собеседника.
  • Собирать и размечать датасеты из реальных звонков, строить пайплайны предобработки аудио.
  • Оптимизировать инференс (latency, стриминг, ONNX/TensorRT, квантизация) вместе с backend-командой.
  • Ставить эксперименты, сравнивать open-source модели и честно докладывать результаты.

Что мы ждём

  • Уверенный Python и опыт с PyTorch.
  • Понимание основ ML/DL: функции потерь, переобучение, метрики, валидация.
  • Базовые знания цифровой обработки звука: частота дискретизации, спектрограммы, mel, MFCC.
  • Опыт хотя бы с одной речевой моделью или фреймворком: Whisper, GigaAM, NeMo, ESPnet, wav2vec2, Vosk, VITS, XTTS, Silero или похожие. Подойдут и пет-проекты, курсовые, Kaggle.
  • Умение работать с Linux, git и GPU-окружением.

Будет плюсом

  • Опыт стримингового ASR или TTS с низкой задержкой.
  • Знакомство с телефонией: SIP, кодеки G.711/Opus, особенности 8 кГц аудио.
  • Опыт классификации аудио: AMD, VAD, speaker/emotion recognition.
  • Опыт с ONNX Runtime, TensorRT, Triton, vLLM.
  • Понимание LLM-агентов и того, как ASR → LLM → TTS складывается в диалоговую систему.
  • Публичные проекты на GitHub, статьи, хорошие места в соревнованиях.

Что мы предлагаем

  • Реальные задачи в продакшене: ваши модели будут работать в тысячах живых звонков, а эффект будет виден в метриках.
  • Доступ к GPU и реальным данным для обучения.
  • Небольшая команда без лишней бюрократии: идеи быстро доходят до продакшена.

Skills

What Junior ML / AI jobs ask for — and how much of it you have →

See also

ML / AI jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available