К списку

ML-инженер в команду данных синтеза речи

Яндекс

Гибрид middleseniorАлиса и Умные УстройстваML-разработчикSQLPython

Команда синтеза речи делает такие продукты Яндекса, как перевод видео, аудиокниги, голос Алисы. В синтезе наступила эпоха перехода от low resource (даже для основных языков) к большим данным и претрейнам. Новые модели позволяют спеть известные песни вашим голосом и произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.

Какие задачи вас ждут

Работа с данными
Вам предстоит разрабатывать систему хранения действительно больших данных и доступа к ним для ML-разработчиков. В вашем распоряжении будут петабайты аудио, которые необходимо эффективно хранить и быстро обрабатывать.

Майнинг данных
Вы будете улучшать пропускную способность текущих пайплайнов сбора данных и масштабировать их для поддержки множества языков, работать с разнородными источниками и строить процессы майнинга аудиоданных.

Оценивание качества данных
Вам предстоит работать с процессами оценивания параметров данных, разрабатывать и применять ML-модели детекции шума, музыки, языка, нескольких голосов, синтетической речи, несовпадения текста и аудио. Эти оценки позволят отфильтровать данные и сделать наш синтез лучшим в мире.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

  • Пишете на Python
  • Строили пайплайны сбора данных для ML
  • Понимаете, как работать с большими объёмами данных
  • Применяли на практике, а лучше — обучали ML-модели
  • Мотивированны и готовы глубоко погружаться в область

Источник: yandex.ru (Яндекс) 9 сентября 2026