Перейти к содержанию

AI Training

Планы технологического развития

Описанная функциональность находится в разработке и планируется к поставке через Магазин приложений платформы Боцман.

Ценность

Обучение и дообучение моделей на своих GPU с очередями и распределением нагрузки — эффективная утилизация GPU, запуск крупных обучающих задач без внешних сервисов.

Описание

AI Training (ИИ Трейнинг) — набор open-source компонентов платформы Боцман для организации обучения и дообучения моделей машинного обучения на собственной инфраструктуре. Раздел адресован командам data science и MLOps, которым нужен управляемый процесс запуска обучающих задач без зависимости от внешних сервисов.

Связка компонентов берёт на себя оркестрацию тренировочных заданий в Kubernetes, управление очередями и приоритетами, а также оптимизацию самого процесса обучения. Это позволяет запускать как небольшие экспериментальные задачи, так и крупные обучающие запуски на доступных GPU-ресурсах.

Состав (компоненты)

Компонент Что это Зачем в связке
Kubeflow Trainer Оркестрация заданий обучения в Kubernetes Запуск, масштабирование и управление жизненным циклом тренировочных задач
Kueue Очереди и планирование пакетных заданий Приоритезация и справедливое распределение ресурсов между задачами
PyTorch Фреймворк машинного обучения Построение и обучение моделей
DeepSpeed Библиотека оптимизации обучения больших моделей Распределённое обучение и экономия памяти

Kubeflow Trainer — компонент для оркестрации заданий обучения (тренировочных задач) в Kubernetes. В связке выступает исполнительным уровнем: принимает описание обучающей задачи, разворачивает под неё поды и управляет их жизненным циклом. Включён, так как обеспечивает воспроизводимый и управляемый запуск обучения в кластере.

Kueue — система очередей и планирования пакетных заданий. Обеспечивает приоритезацию задач и справедливое распределение ресурсов, не допуская монополизации GPU одной командой. Включён, так как превращает конкуренцию за ресурсы в предсказуемый процесс с очередями и политиками.

PyTorch — фреймворк машинного обучения для построения и обучения моделей. В связке используется как основа обучающего кода и модели. Включён, так как широко применяется для обучения моделей.

DeepSpeed — библиотека оптимизации обучения больших моделей. Обеспечивает распределённое обучение и экономию памяти (в том числе за счёт sharding и offload). Включён, так как позволяет обучать крупные модели на ограниченном числе GPU.

Дополнительно связка рассчитана на использование open-source библиотек и готовых предобученных моделей: их можно загружать и применять в обучающих задачах, не обращаясь к внешним сервисам.

Ключевые возможности

  • Запуск и оркестрация обучающих задач как стандартных заданий Kubernetes.
  • Очереди заданий с приоритезацией и справедливым распределением GPU-ресурсов между командами и проектами.
  • Эффективная утилизация GPU за счёт уплотнения и выравнивания загрузки.
  • Обучение и дообучение моделей на собственной инфраструктуре без внешних сервисов.
  • Распределённое обучение и оптимизация памяти для больших моделей.
  • Использование open-source библиотек и предобученных моделей в обучающих задачах.

Архитектура

graph LR
    A[Пользователь / data science команда] --> B[Очереди заданий: Kueue]
    B --> C[Оркестрация обучения: Kubeflow Trainer]
    C --> D[GPU-ресурсы кластера]
    C --> E[Обучающий код и модели: PyTorch + DeepSpeed]

Задачи обучения попадают в очередь Kueue, которая определяет приоритет и выделяет ресурсы. Далее оркестратор Kubeflow Trainer разворачивает задание в кластере, а сам процесс обучения выполняют PyTorch и DeepSpeed на выделенных GPU. Схема концептуальная, детали реализации уточняются по мере разработки.

Варианты использования

  • Обучение модели с нуля на собственных GPU по выделенной очереди.
  • Дообучение (fine-tuning) предобученной модели под собственную задачу.
  • Запуск обучающих экспериментов в порядке очереди без ручного управления ресурсами.
  • Распределённое обучение большой модели на нескольких GPU с оптимизацией памяти.
  • Выделение и контроль GPU-квот между несколькими командами data science.

Установка

Описанная функциональность находится в ограниченном доступе для клиентов, поставляется через Магазин приложений платформы Боцман.

Подключение репозиториев приложений → установка из раздела «Чарты» (см. страницу Приложения (Apps)).

Note

На текущий момент перечисленные чарты могут отсутствовать среди подключённых репозиториев приложений. Они будут добавлены по мере готовности функциональности.

Связанные страницы

Набор компонентов и планы развития могут быть изменены в одностороннем порядке.