К списку

Team Lead в команду ML-инфраструктуры R&D

Яндекс

middleYandex R&DБэкенд-разработчик

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Эти модели используют в Алисе, Поиске, Рекламе и других сервисах Яндекса. Для обучения таких моделей нужны десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снизить риски сбоев.

Чем сложнее система, тем больше точек отказа. Чем больше ресурсов требуется для обучения, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры. Мы должны разбираться и в особенностях аппаратного обеспечения (GPU, сети, шины данных, диски, память), и в нюансах процесса обучения — например, понимать составные части, взаимодействие компонентов и узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением (Reinforcement Learning, RL). Метод становится всё более востребованным, вместе с этим усложняются подходы, растёт потребность в вычислительных ресурсах — появляется необходимость строить специализированную инфраструктуру.

Какие задачи вас ждут

Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков.

Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.

Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям.

Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

  • Знаете Python и работали в системном программировании, разработке библиотек или фреймворков
  • Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed
  • Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения
  • Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене
  • Можете эффективно работать в команде и делиться знаниями

Будет плюсом, если вы

  • Участвовали в создании инфраструктуры обучения ML-моделей
  • Внедряли и оптимизировали RL-решения
  • Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM)
  • Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton
  • Владеете C++ и работали с низкоуровневым программированием и оптимизацией

Источник: yandex.ru (Яндекс) 29 августа 2026