К списку

ML-инженер в лабораторию ИИ

Яндекс

ОфисМосква juniorseniorОбщие сервисы ЯндексаML-разработчикPythonМашинное обучение

Наша лаборатория занимается прикладными исследованиями: мы улучшаем продукты Яндекса и делаем прототипы новых решений. Работаем с NLP, CV, RL, звуком и, конечно, на стыке этих областей. В общем, сначала разбираемся, какая реальная боль перед нами стоит, какую задачу решать, а уже потом выбираем подходящие инструменты.

Несколько последних продуктовых результатов нашей команды: детектор сгенерированных текстов, изображений и кода; механизм автоматической оценки уровня знаний студентов; технический писатель. Из исследовательских — методология анализа предпочтений LLM; анализ условий, при которых в мультиагентном RL возникает язык как механизм коммуникации. Цель одних проектов — выход в прод, других — научная публикация, а третьих — и то и другое.

Ищем человека, которому интересно работать над задачами, где пока не очень понятно, как вообще подступиться к решению. Интересно пробовать, проверять гипотезы, разбираться, почему не получилось, и пробовать ещё. Хотим, чтобы вы предлагали свои идеи и развивались вместе с нами. Многому готовы научить: руководитель группы ML-разработки — опытный преподаватель ;)

P. S. А ещё мы пишем научные статьи на A*. Присоединяйтесь!

Какие задачи вас ждут

Механизм для оценки значимости научных публикаций
Ищем новый способ оценить вклад научных публикаций: просто оценка количества цитирований достаточно грубая. Это может помочь и фильтровать информационный поток (все публикации всё равно не прочитать), и готовить данные для обучения новых поколений языковых моделей.

Нейродетектор для текстов, изображений и кода
Учим модели отличать сгенерированные тексты, изображения и код от созданных человеком. При этом генераторы тоже развиваются, поэтому хочется, чтобы детектор справлялся и с новыми моделями. Как этого добиться — один из вопросов, с которыми предстоит разбираться.

Автоматизация проверки уровня знаний
Автоматизируем проверку знаний там, где личная проверка один на один с собеседующим/преподавателем невозможна. Здесь много открытых вопросов: как собирать данные, как проверять качество оценки и насколько вообще ей можно доверять.

Методология анализа предпочтений LLM
Исследуем, что предпочитают языковые модели, как это измерить и чем можно объяснить результат. Разрабатываем методологию и проверяем её экспериментами. Тут придётся подумать и над самими экспериментами, и над тем, какие выводы из них действительно можно сделать.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

  • Хорошо понимаете современный ML и его основы. Огромная LLM нужна далеко не для каждой задачи, хотя иногда очень хочется
  • Сами проходили основные этапы решения ML-задач: сбор и предобработку данных, обучение, валидацию, деплой, дообучение и поддержку
  • Доводите идеи до работающего решения. Jupyter-ноутбуки мы тоже когда-то использовали, но это не считается
  • Работали с AI-ассистентами: Cursor, Claude Code, Codex и другими. Понимаете, что им можно поручить, где они могут ошибаться и как проверять результат
  • Уверенно пишете на Python. Да, с появлением агентов это всё ещё нужно :)
  • Готовы самостоятельно искать решения и предлагать, что ещё стоит попробовать
  • Хотите развиваться в ИИ и разбираться в новом

Будет плюсом, если вы

  • Работали с Linux и знаете что-то, кроме ls и cd :)
  • Умеете выходить из Vim — это приветствуется!
  • Пользовались Docker
  • Настраивали CI/CD
  • Писали научные статьи

Это дополнительные плюсы, а не обязательные требования. Поможем разобраться. Агенты тоже помогут, но результат всё равно будем проверять ;)

Источник: yandex.ru (Яндекс) 22 сентября 2026