К списку

Инженер данных в Автономный транспорт

Яндекс

ГибридСанкт-Петербург, Москва middleseniorАвтономный транспортSQLPython

Мы занимаемся инженерией данных в очень амбициозном и инновационном направлении Яндекса — в Автономном транспорте. Наша главная задача — обеспечивать полную и своевременную поставку данных с автономного флота в аналитические инструменты, благодаря которым команда может своевременно принимать решения и увеличивать скорость разработки.

Технологии, которые мы используем:

  • Языки программирования — Python, SQL
  • Хранилища — YTsaurus, ClickHouse, Logbroker (Kafka)
  • Оркестраторы ETL-процессов, разработанные в Яндексе, — Nirvana, Logos

Какие задачи вас ждут

Поставка и обработка данных в околореальном времени
Ключевая метрика автономного транспорта — среднее расстояние, пройденное до вмешательства водителя в управление автономным транспортным средством. Чтобы отслеживать эту метрику и оперативно реагировать на её изменения, крайне важно как можно быстрее получать структурированные и обработанные данные.

Повышение надёжности и оптимизация долговременного хранилища данных
Хранилище данных автономного транспорта занимает более 180 петабайт, и с увеличением размеров флота приток данных становится всё больше. Нам нужно уметь хранить данные как можно эффективнее, поскольку на их запись и хранение тратится много средств. Также необходимо внедрить систему бэкапов, чтобы обезопасить ключевые данные от массовых аварий в дата-центре.

Мониторинг скорости и полноты поставки данных
Нам крайне важно, чтобы разработанные нами пайплайны поставляли полные данные своевременно, а в случае проблем мы бы узнавали о них как можно раньше. Для этого мы разрабатываем систему сбора и визуализации метрик работы наших пайплайнов.

Поддержка и развитие аналитического DWH
Кроме основного массива данных с сенсоров машин, существует множество сервисов для операционного управления флотом. Чтобы снабжать аналитиков и операционных менеджеров необходимыми данными, мы построили DWH на основе данных этих сервисов.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

Мы ждём, что вы

  • Работали с Hadoop/YTsaurus/ClickHouse/другими MPP СУБД
  • Уверенно владеете Python и SQL
  • Умеете писать надёжные и производительные пайплайны обработки данных
  • Не пренебрегаете инженерной культурой и инструментами разработки

Будет плюсом, если вы

  • Участвовали в проектировании и разработке хранилищ больших данных
  • Владеете или хотите овладеть C++

Источник: yandex.ru (Яндекс) 29 августа 2026