Перейти к содержанию

AI Serving

Планы технологического развития

Описанная функциональность находится в разработке и планируется к поставке через Магазин приложений платформы Боцман.

Ценность

Масштабируемый production-инференс: высокопроизводительный вывод (vLLM) по стандартным интерфейсам (KServe) — надёжный путь модели из эксперимента в прод.

Описание

AI Serving (ИИ Сервинг) — планируемый набор открытых компонентов платформы Боцман для развёртывания и эксплуатации моделей машинного обучения в production. Решение закрывает этап между завершением эксперимента и регулярным использованием модели сервисами и приложениями: обученная модель упаковывается в стандартизованный сервис инференса и обслуживается на GPU-нодах кластера Kubernetes.

Решением пользуются ML-инженеры и эксплуатационные команды: первые выкатывают модель в прод без ручной настройки serving-инфраструктуры, вторые получают предсказуемые интерфейсы, масштабирование и централизованное управление инференсом средствами платформы Боцман через Apps & Marketplace.

Состав (компоненты)

Компонент Что это Зачем в связке
vLLM Высокопроизводительный движок инференса LLM с высокой пропускной способностью и эффективным использованием GPU-памяти Обеспечивает быстрый и экономичный вывод больших языковых моделей на GPU-нодах кластера
KServe Стандартная платформа развёртывания и эксплуатации моделей (inference) на Kubernetes Стандартизует жизненный цикл serving-сервисов: упаковку, развёртывание, масштабирование и обновление моделей

vLLM — высокопроизводительный движок инференса больших языковых моделей. Отличается высокой пропускной способностью и эффективным использованием GPU-памяти, что снижает себестоимость обслуживания моделей в кластере. В связке является исполнительным слоем: именно он выполняет вычисления вывода на GPU-нодах. Включён, потому что без производительного движка стоимость production-инференса при заметной нагрузке становится высокой.

KServe — стандартная платформа развёртывания и эксплуатации моделей на Kubernetes. Обеспечивает единый способ упаковки модели, её развёртывания, масштабирования под нагрузку и обновления без простоя сервиса. В связке выступает управляющим слоем: принимает запросы по стандартным интерфейсам и направляет их на выполнение в vLLM. Включён, потому что стандартизует весь жизненный цикл serving и избавляет команду от ручной оркестрации инференс-сервисов.

Помимо перечисленных компонентов, связка предоставляет возможность GPU-ускорения на GPU-нодах кластера для выполнения вычислений вывода.

Ключевые возможности

  • Развёртывание обученной модели как стандартизованного serving-сервиса в кластере Kubernetes.
  • Высокопроизводительный вывод больших языковых моделей с эффективным использованием GPU-памяти.
  • Стандартные интерфейсы инференса, единые для всех развёрнутых моделей.
  • Масштабирование serving-сервисов под нагрузку средствами Kubernetes.
  • Обновление моделей без прерывания обслуживания потребителей.
  • Управление инференсом средствами платформы Боцман через Apps & Marketplace.

Архитектура

graph LR
    App[Потребители и сервисы] --> KServe[KServe - управление serving]
    KServe --> vLLM[vLLM - движок инференса]
    vLLM --> GPU[GPU-нода кластера]
    Model[Обученная модель] --> KServe

Потребители и сервисы обращаются к serving-сервису через стандартные интерфейсы, которые предоставляет KServe. KServe управляет жизненным циклом модели и направляет запросы на выполнение в движок инференса vLLM, который выполняет вычисления вывода на GPU-нодах кластера. Обученная модель попадает в serving в виде стандартизованной упаковки. Схема концептуальная и не отражает конкретных имён объектов и параметров развёртывания.

Варианты использования

  • Вывод больших языковых моделей, обученных и дообученных на платформе, в production-сценариях.
  • Замена экспериментальных запусков модели на стабильный serving-сервис с гарантированной доступностью.
  • Обслуживание моделей для внутренних сервисов и интеграций по стандартным интерфейсам.
  • Масштабирование инференса под пиковую нагрузку без простоя сервиса.
  • Регулярное обновление моделей новыми версиями без прерывания работы потребителей.

Установка

Описанная функциональность находится в ограниченном доступе для клиентов, поставляется через Магазин приложений платформы Боцман.

Подключение репозиториев приложений → установка из раздела «Чарты» (см. страницу Приложения (Apps)).

Note

На текущий момент перечисленные чарты могут отсутствовать среди подключённых репозиториев приложений. Они будут добавлены по мере готовности функциональности.

Связанные страницы

Набор компонентов и планы развития могут быть изменены в одностороннем порядке.