Bootsman AI
Планы технологического развития
Описанная функциональность находится в разработке и планируется к поставке через Магазин приложений платформы Боцман.
Ценность
Приватный ИИ на своих кластерах: запуск моделей и OpenAI-совместимый API за пару кликов — данные не покидают периметр, команды получают готовый эндпоинт для интеграции.
Описание
Bootsman AI (Боцман ИИ) — Kubernetes-оператор платформы Боцман, который запускает AI-модели (LLM, embeddings, rerank, audio) на on-prem кластерах и выставляет наружу OpenAI-совместимый API. Модель описывается декларативным манифестом AIModel — оператор берёт на себя материализацию весов, serving-под, GPU-safe rollout и подключение к gateway.
Устанавливается в 2 клика через Apps & Marketplace платформы Боцман.
Для кого
| Роль | Описание |
|---|---|
| Платформенная команда | Управляет жизненным циклом моделей через Kubernetes-манифесты; задаёт cluster-scoped «золотые дефолты» через AIModelProfile и AIRuntimeClass |
| Прикладной разработчик | Обращается к привычному OpenAI-эндпоинту (например, /v1/chat/completions); не думает об инфраструктуре |
| DevOps / SRE | Устанавливает оператор через Apps & Marketplace или Helm, контролирует rollout и мониторинг |
Состав (компоненты)
| Компонент | Что это | Зачем в связке |
|---|---|---|
| vLLM | Open-source движок инференса LLM | Быстрый serving больших моделей на GPU |
| Ollama | Open-source среда запуска моделей | Простой запуск и управление моделями |
| SGLang | Open-source движок инференса LLM | Альтернативный движок serving |
| FasterWhisper | Open-source движок распознавания речи | Транскрибация аудио на своих GPU |
| PostgreSQL | Открытая реляционная СУБД | Хранилище данных биллинга (опция) |
| KEDA | Open-source компонент автоскейлинга | Автоскейлинг serving-подов 1→N |
| VictoriaMetrics | Open-source система мониторинга | Метрики serving, gateway и оператора; данные для автоскейлинга |
| cert-manager | Open-source менеджер TLS-сертификатов | TLS для вебхука оператора |
Ядро связки — сам продукт (оператор AI Model Operator и gateway) — является платформенным компонентом Боцман и поставляется через Apps & Marketplace. Остальные компоненты таблицы — open-source, они используются оператором как движки и подсистемы.
CRD-модель оператора построена на 6 CustomResourceDefinition в API-группе ai.bootsman.tech/v1alpha2: 4 core CRD — AIModel, AIModelProfile, AIRuntimeClass, CacheProfile — и 2 billing CRD — APIClient, ModelPricing, которые включаются вместе с биллингом (opt-in).
- vLLM, Ollama, SGLang, FasterWhisper — четыре встроенных движка инференса. Каждый движок реализован отдельным адаптером, поэтому добавление нового движка не затрагивает остальные. Дополнительно поддерживается псевдо-движок
externalдля OpenAI-совместимого upstream-провайдера. - PostgreSQL — используется только при включённом биллинге (
billing.enabled=true): хранит API-клиентов, бюджеты, каталог цен и append-only usage ledger. Без биллинга PostgreSQL не требуется. - KEDA — обеспечивает автоскейлинг serving-подов 1→N по метрикам из Prometheus-совместимого источника (опция).
- VictoriaMetrics — собирает метрики gateway и оператора, используется как источник данных для автоскейлинга 0→1 (холодный старт модели).
- cert-manager — выпускает сертификаты для TLS validating-вебхука оператора.
Ключевые возможности
- Декларативное описание модели — один манифест
AIModelописывает модель, движок, GPU-ресурсы, кэш, chat-темплейт и стратегию балансировки; оператор материализует веса, настраивает serving-под и подключает его к gateway. - OpenAI-совместимый API — gateway принимает запросы по протоколу OpenAI (
/v1/chat/completionsсо стримингом SSE,/v1/completions,/v1/embeddings,/v1/audio/transcriptions,/v1/audio/translations,/v1/rerank,/v1/tokenize,/v1/detokenize); любой клиент OpenAI SDK подключается сменойbase_url. Пути вне канонического каталога роутов не обслуживаются (deny-by-default). - GPU-safe rollout — обновление модели без потери трафика: сначала стартует новая реплика, после её готовности удаляется старая (
maxUnavailable=0, surge-before-delete); GPU не простаивают. - Многоуровневый автоскейлинг — 0→1: холодный старт модели через cold-start hold-and-forward (gateway удерживает запрос с бюджетом 90 секунд и сигналит спрос); 1→N: KEDA-масштабирование по Prometheus-метрикам (опция,
keda.enabled=true); scale-to-zero опционален (scaling.minReplicas: 0). - Несколько движков и external-провайдер — vLLM, Ollama, SGLang, FasterWhisper; каждый движок реализован отдельным адаптером. Псевдо-движок
externalпроксирует запросы на OpenAI-совместимый upstream-провайдер. - API-key auth и биллинг (opt-in) — включается
billing.enabled=true;APIClientс мульти-тенантными ключами и бюджетами (токены, деньги, аудио-секунды),ModelPricingкак каталог цен, append-only usage ledger, дашборд затрат Grafana (опционально). Ключи хэшируютсяargon2id, raw secrets не хранятся. - Security & Compliance — deny-by-default gateway, validating admission webhook (TLS через cert-manager), audit-логи (опция), защита secret-значений (не попадают в CRD, статус и логи), PSA
restricted-совместимые securityContext, distroless-образы. - Установка на платформе — через Apps & Marketplace (в 2 клика) или Helm, либо Kustomize; дефолтные
AIRuntimeClassдля всех движков поставляются чартом.
Архитектура
graph BT
GPU[GPU] --- K8s[Kubernetes + Bootsman]
Storage[Storage] --- K8s
Monitoring[Monitoring] --- K8s
K8s --- LLM[LLM-модели]
K8s --- Embed[Embeddings-модели]
K8s --- Speech[Speech AI-модели]
LLM --- GW[Bootsman AI Gateway]
Embed --- GW
Speech --- GW
GW --- API[OpenAI-compatible API]
API --- Chat[Чат-Боты]
API --- RAG[RAG]
API --- Svc[AI-Сервисы]
Варианты использования
- Приватный LLM-инференс — развёртывание open-source моделей на on-prem GPU и предоставление командам OpenAI-совместимого API без отправки данных во внешние сервисы.
- Embeddings для RAG — генерация векторных представлений на своих GPU через
/v1/embeddings. - Распознавание речи — транскрибация аудио через
/v1/audio/transcriptionsна базе FasterWhisper. - Гибрид on-prem + external — локальные модели для базовых запросов + OpenAI-совместимый внешний провайдер для сложных сценариев.
- Экономия GPU — scale-to-zero: модели без запросов освобождают GPU, а при обращении «просыпаются» через холодный старт.
- Управление жизненным циклом моделей — кластерные «золотые дефолты» для платформенных команд и декларативные манифесты для повторяемых развёртываний.
Установка
Описанная функциональность находится в ограниченном доступе для клиентов, поставляется через Магазин приложений платформы Боцман.
Подключение репозиториев приложений → установка из раздела «Чарты» (см. страницу Приложения (Apps)).
Note
На текущий момент перечисленные чарты могут отсутствовать среди подключённых репозиториев приложений. Они будут добавлены по мере готовности функциональности.
Связанные страницы
Набор компонентов и планы развития могут быть изменены в одностороннем порядке.