К списку

Инженер данных в DWH Лавки — RT/NRT и AI‑агенты

Яндекс

ОфисМосква juniorseniorЯндекс ЛавкаБэкенд-разработчик

Команда DWH Лавки работает над хранилищем, которое поддерживает аналитику и ключевые операционные процессы бизнеса. В основе хранилища — зрелый batch‑контур. Он включает тысячи расчётов и зависимостей: сохраняет историю и предоставляет проверенные данные за прошедший день.

Сейчас мы развиваем направление RT/NRT‑данных для AI‑систем Лавки. Речь идёт о потоковых и микробатчевых поставках, единых контрактах и контроле качества. Оперативные данные позволяют быстро получать сигналы и контекст для принятия решений, а batch‑слой обеспечивает полноту данных, сохраняет историю и финальную версию информации. Нам требуется опытный инженер данных. Его задача — связать эти контуры и развить платформенную основу для AI‑продуктов, которые используют операционные и управленческие команды.

Роль инженерная, с полной ответственностью за результат. Нужно самостоятельно выбирать задачи, в которых RT/NRT‑данные будут действительно полезны, проектировать решения, запускать их в промышленную эксплуатацию и развивать вместе с продуктовыми командами.

Мы работаем со следующим стеком технологий:

  • Python, SQL и YQL
  • Внутренний Code Driven фреймворк DMP Suite
  • YT, Greenplum и ClickHouse
  • Apache Flink / Flink Flow и LogBroker для потоковой обработки
  • Встроенные инструменты Data Quality, мониторинга и управления ETL‑процессами

Какие задачи вас ждут

Развитие поставок данных
Вы будете проектировать и развивать RT/NRT‑поставки данных для разных сценариев работы продуктовых команд — например, для жизненного цикла заказа, работы сотрудников, складских операций и отслеживания доступности товаров. При этом нужно тщательно продумать, как будут взаимодействовать оперативный и batch‑контуры, и подобрать архитектуру, которая обеспечит нужную скорость, полноту, стоимость и надёжность данных.

Проектирование RT‑данных
Вам предстоит помогать системным аналитикам и продуктовым командам проектировать RT‑данные: подбирать источники и способы обработки, определять модель событий, контракты, требования к свежести и качеству данных, а также прорабатывать правила работы с запаздывающими событиями и предварительными результатами.

Поиск возможностей по RT‑данным
Вам нужно будет искать новые способы работы с RT‑данными, разрабатывать универсальные подходы и помогать внутренним заказчикам разобраться, какие задачи можно решить с их помощью. При этом проектирование прикладных агентов и бизнес‑сценариев останется за продуктовыми командами.

Инженерные задачи и развитие DWH
В ваши обязанности войдёт ведение инженерных задач: исследование процессов и источников данных, запуск решений в промышленную эксплуатацию, контролирование их работы и безопасное развитие DWH, который имеет большой граф зависимостей.

Развитие AI‑агентов для DWH
Вы будете расширять возможности AI‑агентов в автономном DWH: предоставлять им качественный контекст и инструменты, устанавливать ограничения и проверки, оценивать результаты работы и превращать сложные случаи в новые сценарии автоматизации. Также вам предстоит работать с нетиповыми инцидентами — выявлять их системные причины и на этой основе создавать новые проверки, инструменты и возможности для агентов.

Больше о разработке в Яндексе — в канале Yandex for Developers

Мы ждём, что вы

  • Проектировали и поддерживали промышленные RT/NRT‑пайплайны, понимаете, чем их разработка и эксплуатация отличаются от batch‑обработки
  • Занимались разработкой в крупном DWH или распределённой платформе, понимаете, как безопасно менять процессы с большим графом зависимостей
  • Умеете проектировать надёжную обработку событийных данных с учётом задержек, повторной обработки и изменений источников
  • Уверенно владеете Python и SQL, понимаете принципы моделирования данных, качества, наблюдаемости и надёжной эксплуатации
  • Умеете превращать не до конца сформулированную бизнес‑задачу в модель данных и техническое решение, сравнивать архитектурные варианты, объяснять компромиссы и договариваться с владельцами источников
  • Уже используете AI‑агентов в инженерной работе и хотите развивать подход, в котором человек управляет целями, качеством и архитектурой, а значительную часть реализации и поддержки выполняют агенты
  • Готовы брать ответственность за результат поставки данных, а не только за написанный код

Будет плюсом, если вы

  • Имели глубокий практический опыт работы с Apache Flink
  • Практиковали построение lambda‑ или kappa‑архитектуры и объединение оперативного и batch‑контуров
  • Запускали новое платформенное направление или развивали внутренние data‑продукты
  • Практиковали проектирование data contracts и интеграцию нескольких продуктовых систем
  • Разрабатывали инструменты, контекст, проверки или evaluation‑процессы для инженерных AI‑агентов

Источник: yandex.ru (Яндекс) 29 августа 2026