К списку

Аналитик-разработчик в команду оценки достоверности Алисы AI

Яндекс

Гибрид middleseniorYandex R&DАналитик-разработчик

Наша основная задача — сделать с высоким качеством сервис разметки достоверности ответов LLM-моделей. На вход он получает диалог и ответы разных релиз-кандидатов, прода, конкурентов и т. д. (в целом всё что угодно), а на выходе выдаёт размеченные ошибками части ответа. Пример можно посмотреть в HTML.

Для оценки качества мы используем три метрики:

  • Средний по заданиям f1-score (для каждого задания следим, насколько хорошо попали в красный или красный + жёлтый).
  • Accuracy вердиктов (у нас есть режим сравнения ответов SBS, где нам важно быть согласованными с эталоном).
  • Accuracy выставленных оценок ответов (каждый ответ оценивается по 5-балльной шкале, мы стремимся максимально точно попадать в эталон).

Есть три зоны ответственности: 1) голденсеты, бенчмарки и инструкция; 2) исполнители-агенты; 3) исполнители-люди (асессоры + редакторы).

Какие задачи вас ждут

Голденсеты и инструкция
Это ключевая область — можно сказать, сердце разметки.

В ней четыре больших задачи:

  1. Собирать эталоны и узкие бенчи (например, сложная корзинка) для оценки качества исполнителей и агентов.
  2. Валидировать инструкцию на противоречия и вносить в неё правки, обсуждать с редакторами правки и изменения.
  3. Размечать ответы для новых направлений. (Например, ответы с файлами на входе — как проверять в случае противоречий в файле и интернете? Как относиться к пропускам информации? А к креативу на фактических данных? — и т. д., всегда много вопросов.)
  4. Отвечать за качество голденсета — то есть на вопрос «почему мы можем верить, что наш голденсет собран достаточно хорошо?»

Исполнители-агенты
Новое направление, много низко висящих фруктов. В нём находятся задачи, связанные с развитием нашего основного агента-фактчекера, и создание новых дополнительных пайплайнов с LLM (например, для сбора голденсетов).

Задачи направления:

  • Развивать имеющегося агента: довести f1 агента на критах до уровня редактора, сделать прокачку дешёвой.
  • Собрать набор агентов, которые с высокой полнотой и приемлемой точностью будут готовить разметку.

Исполнители-люди
Классическая работа с асессорами и редакторами для роста качества разметки и достижения нужной производительности. С учётом текущих реалий тут также важно выстраивать пайплайны с LLM:

  • Подготовка хинтов (чтобы помогать исполнителям улучшать качество разметки).
  • Оценка качества комментариев.
  • Раздебаг проблем и обучение людей (найти проблему и срез людей, у которых она наблюдается).
  • Система оплаты и мотивации.
  • Аналитические: строим рейтинг исполнителей (развиваем подход, например модель Брэдли — Терри или микротюнинг текущего алгоритма), придумываем, как оценивать сложность заданий, а позже — как подбирать под задание группу исполнителей.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

Мы ждём, что вы

  • Понимаете, почему важно всегда смотреть в данные
  • Уверенно пишете на Python и знаете алгоритмы
  • Знаете математическую статистику и проверяли гипотезы с её помощью

Будет плюсом, если вы

  • Интересуетесь продуктом, стремитесь понять, каким он должен быть и почему
  • Умеете общаться, ясно излагать мысли, понимать и учитывать мнение коллег, убеждать
  • Работали с табличными данными на SQL
  • Имели дело с крауд-проектами, например делали разметку в Толоке
  • Знаете основы машинного обучения

Источник: yandex.ru (Яндекс) 29 августа 2026