Сейчас в платформе
ДоступноРеестр моделей и данных
Единое хранилище с версиями и владельцами, доступ по роли, журнал действий и работа через привычные библиотеки и git - внутри контура компании. Документация
Roadmap
Сегодня AI-Vault отвечает за порядок в моделях и данных. Дальше платформа закрывает то, что идет после хранения: обучение, работу модели под нагрузкой и вычисления, на которых все это живет.
Сейчас в платформе
ДоступноЕдиное хранилище с версиями и владельцами, доступ по роли, журнал действий и работа через привычные библиотеки и git - внутри контура компании. Документация
Скоро в платформе
В разработкеСегодня AI-Vault отвечает за порядок в моделях и данных. Следующий шаг - обучение внутри того же контура: без переноса данных наружу, без самодельных скриптов на чьем-то ноутбуке и без вопроса «а на чем это вообще обучали».
Выбираете модель и датасет из реестра, указываете свой обучающий скрипт. Настройку окружения AI-Vault берет на себя.
Для каждой задачи задается объем вычислений, GPU и диска. Система видит, сколько ресурсов доступно, и планирует очередь обучения.
Метрики и логи обучения собираются в реальном времени и приходят на дашборд. Видно, что процесс идет не туда, - на первых шагах, а не через сутки.
Промежуточные результаты и метрики сохраняются по ходу обучения в AI-Vault. Обученная модель становится новой версией в реестре - с историей: на каких данных, с какими параметрами и с каким результатом.
Скоро в платформе
В разработкеОбученная модель не должна ждать отдельного проекта по внедрению. AI-Vault запускает ее прямо из реестра и показывает, как она ведет себя под реальной нагрузкой.
Выбираете версию модели и объем ресурсов - платформа поднимает сервис и выдает адрес для обращений. Собирать окружение вручную не нужно.
Обращение к модели идет по стандартному протоколу: в приложениях меняется только адрес, переписывать код не нужно.
Нагрузка, скорость ответа, ошибки и потребление ресурсов - на одном экране в реальном времени. О проблеме вы узнаете раньше, чем о ней сообщат пользователи.
Новая версия запускается рядом с текущей, переключение и откат - в одно действие. В журнале видно, кто обращался к модели и какая версия отвечала.
Скоро в платформе
В разработкеОбучение и работа моделей опираются на один пул вычислений. Все GPU-серверы компании - на одной площадке или на нескольких - платформа держит как общий ресурс и сама решает, где запустить задачу. Работает поверх Kubernetes, включая k3s на небольших площадках, - в то, что уже развернуто, вписывается без отдельной инфраструктуры.
Все машины с GPU собираются в общий ресурс с понятной картиной: где какие мощности есть, что занято, что свободно прямо сейчас.
Платформа сама подбирает площадку и объем ресурсов под конкретную задачу - обучение или работу модели. Не нужно вручную решать, кто на какой машине запускается.
Когда обращений к модели становится больше, добавляются копии, когда нагрузка спадает - ресурсы освобождаются под другие задачи.
Загрузка видеокарт, очередь задач и потребление по командам - на одном экране. Понятно, где узкое место и когда действительно пора докупать железо.
Обучение, запуск и мониторинг - в одном контуре, вокруг одного реестра моделей. Расскажем о сроках и подключим к раннему доступу.