К списку

Ведущий инженер по AI/LLM-платформе

билайн

Удалённо3–5 лет ИТ-решения и продуктыML/AI

Мы развиваем внутреннюю корпоративную платформу для запуска open-weight LLM и агентных решений на собственной GPU-инфраструктуре.

Ищем опытного инженера, готового работать на стыке эксплуатации LLM, распределённых систем, платформенной архитектуры и быстро развивающихся агентных технологий.

Мы не ожидаем, что один человек будет одинаково глубоко разбираться во всех перечисленных областях. Важно иметь сильную экспертизу как минимум в двух-трёх направлениях и быть готовым погружаться в смежные задачи.

Чем предстоит заниматься:

  • Следить за развитием open-weight LLM, систем инференса, coding agents и связанной инфраструктуры.
  • Находить перспективные модели и технологии, оценивать их зрелость и принимать решение о целесообразности тестирования и внедрения.
  • Проводить тестирование и сравнительную оценку моделей на GPU-серверах.
  • Сравнивать модели по качеству, скорости генерации, задержкам, пропускной способности, поддерживаемой конкурентной нагрузке, потреблению памяти, сложности эксплуатации и стоимости инференса.
  • Переводить успешные прототипы и эксперименты в надёжные промышленные решения.
  • Повышать производительность, отказоустойчивость, наблюдаемость и эксплуатационную надёжность платформы инференса.
  • Проектировать компоненты внутренней AI-платформы, в том числе собственный LLM-роутер, механизмы управления нагрузкой, приоритизации, квотирования, кэширования, отказоустойчивости и выбора моделей.
  • Прототипировать агентов, MCP-серверы, скиллов, интеграции с агентными фреймворками, системы оценки качества и другие компоненты AI-платформы.
  • Разрабатывать архитектурные и организационные подходы к корпоративному использованию MCP-серверов, скиллов, моделей, харнессов и других расширений платформы.
  • Формировать инженерные стандарты в области безопасности, разграничения прав, версионирования, тестирования, публикации, аудита, сопровождения и жизненного цикла компонентов AI-платформы.
  • Взаимодействовать с внутренними пользователями и инженерными командами, превращая неформализованные потребности в работающие платформенные решения.
  • Использовать кодовых агентов и другие инструменты AI-assisted development для ускорения разработки, тестирования, исследований и подготовки документации, сохраняя полную ответственность за качество результата.

Основные требования:

  • Сильная инженерная база и опыт проектирования промышленных программных систем.
  • Опыт работы с LLM, ML-инфраструктурой, распределёнными системами, высокопроизводительными вычислениями или близкими по сложности технологическими областями.
  • Понимание основных компромиссов при инференсе LLM: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация, параллелизм и управление KV-кэшем.
  • Опыт эксплуатации сервисов под Linux с использованием контейнеров, систем мониторинга и современных практик развёртывания.
  • Понимание принципов построения распределённых систем: маршрутизации, балансировки нагрузки, backpressure, admission control, повторных запросов, тайм-аутов, отказоустойчивости, планирования ресурсов и graceful degradation.
  • Умение проектировать понятные API, границы сервисов, потоки данных и эксплуатационные интерфейсы.
  • Уверенное владение как минимум одним универсальным языком программирования. Опыт работы с Python будет преимуществом, но мы не привязаны к конкретному технологическому стеку.
  • Умение диагностировать проблемы производительности и надёжности на уровне приложения, инфраструктуры, операционной системы, сети и GPU.
  • Опыт разработки сопровождаемых систем с автоматизированным тестированием, code review, документацией, мониторингом и контролируемым процессом выпуска изменений.
  • Самостоятельность, умение работать с неопределёнными требованиями, находить недостающую информацию и принимать прагматичные инженерные решения.
  • Практический опыт использования coding agents или других инструментов разработки с применением LLM: декомпозиция задач, подготовка контекста, проверка сгенерированного кода, тестирование, отладка и валидация результата.

Будет преимуществом:

  • Опыт промышленного запуска open-weight LLM с использованием SGLang, vLLM, TensorRT-LLM, TGI или аналогичных решений.
  • Опыт эксплуатации крупных dense- или mixture-of-experts-моделей на многопроцессорных GPU-системах.
  • Понимание tensor, pipeline, data, expert или sequence parallelism.
  • Опыт работы с квантизацией моделей, speculative decoding, prefix caching, многоуровневым KV-кэшем, disaggregated inference или другими технологиями оптимизации инференса.
  • Опыт проектирования или эксплуатации OpenAI-совместимых API.
  • Опыт работы с tool calling, structured output, reasoning-моделями, потоковой генерацией и продолжительными агентными сценариями.
  • Опыт разработки систем маршрутизации между моделями, cache-aware routing, динамического выбора модели, управления квотами, приоритетами и многопользовательской нагрузкой.
  • Опыт оценки coding-моделей, coding agents, систем использования инструментов или многошаговых агентных сценариев.
  • Опыт разработки агентов, агентных рантаймов, MCP-клиентов или серверов, портируемых скиллов, workflow-движков или интеграций с агентными фреймворками.
  • Опыт обеспечения безопасности агентных систем: управление учётными данными, права на вызов инструментов, sandboxing, изоляция данных, approval flows, аудит и контроль цепочки поставки.
  • Опыт внедрения решений в крупных корпоративных или изолированных средах с повышенными требованиями к безопасности, соответствию внутренним регламентам, идентификации пользователей и сетевому доступу.
  • Опыт работы с Kubernetes, Docker Compose, Docker Swarm, Prometheus, Grafana, OpenTelemetry или аналогичными технологиями.
  • Участие в профильных open-source-проектах, публикация технических материалов, создание публичных бенчмарков или значительный опыт разработки внутренних платформенных решений.

Что для нас важно:

  • Инженерное мышление и отсутствие привязки к конкретному фреймворку, вендору или технологическому стеку.
  • Принятие технических решений на основании измерений и проверяемых данных.
  • Интерес к новым технологиям в сочетании со здоровым скептицизмом.
  • Готовность быстро создавать прототипы и затем качественно переводить успешные решения в промышленную эксплуатацию.
  • Понимание, что полноценная AI-платформа — это не только запуск моделей, но и API, маршрутизация, безопасность, управление доступом, governance, developer experience, оценка качества, мониторинг и эксплуатация.
  • Готовность переключаться между исследованиями, архитектурой, разработкой, оптимизацией производительности и решением производственных проблем.
  • Умение работать в команде, делиться знаниями и участвовать в формировании общих инженерных практик.

Что мы предлагаем:

  • Сплоченную команду профессионалов, в которой можно не только успешно реализовывать проекты, но и перенимать опыт и развиваться.
  • Обучение, участие в интересных проектах и расширение профессиональной экспертизы: мы участвуем в конференциях, митапах, публикуемся на Хабр и т.д.
  • Конструктивную и открытую рабочую атмосферу.
  • Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+.
  • Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж.
  • Материальную помощь.
  • Детские подарки.
  • Доплату по листу нетрудоспособности.
  • Корпоративные скидки на товары и услуги от партнеров компании.
  • Служебную сотовую связь.
  • Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока.
  • Формат работы удалённый на территории РФ. Работа по московскому часовому поясу.

Источник: job.beeline.ru (билайн) 4 сентября 2026