Перейти к содержанию

Мастер подбора и первого запуска модели

Мастер первого запуска нужен, чтобы новая установка ИИ Студии не встречала администратора состоянием «модель не настроена» и не заставляла вручную изучать вариант весов, CUDA и требования к памяти.

Он превращает настройку в управляемую цепочку:

проверить сервер → временный Bootstrap → подобрать рабочую модель →
предварительная проверка → скачать → проверить → запустить → проверка готовности → начать работу

Кто проходит мастер

Мастер предназначен для ADMIN. Обычный пользователь не устанавливает модели и не управляет среда выполнения GPU. Пока развёртывание не завершён, USER получает только информационное состояние.


Перед началом

Проверьте:

  • контейнерный стек Студии запущен;
  • NVIDIA GPU предоставлен серверу;
  • драйвер работает;
  • контейнерная среда видит GPU;
  • есть исходящий HTTPS, если веса скачиваются из интернета;
  • на диске есть запас;
  • вы вошли администратором.

Для изолированного контура без интернета используется отдельная процедура автономной подготовки модели.


Состояние хранится на сервере

Мастер — не браузерный баннер. Его состояние хранит Model Manager.

Поэтому:

  • очистка cookies не сбрасывает настройку;
  • приватное окно не начинает всё заново;
  • другой компьютер видит тот же этап;
  • перезапуск браузера не отменяет серверную установку.

Этапы первого запуска

UNINITIALIZED
HARDWARE_DETECTED
BOOTSTRAP_INSTALLING
BOOTSTRAP_READY
PRODUCTION_SELECTED
PRODUCTION_INSTALLING
PRODUCTION_VALIDATING
READY

Специальные состояния:

  • DEGRADED — администратор сознательно завершил настройку на временном Bootstrap;
  • FAILED — подготовка модели или среда выполнения validation завершились ошибкой.

Шаг 1. Откройте мастер

На новой установке мастер появляется автоматически, пока сервер сообщает, что first boot не завершён.

На уже рабочей системе для обучения/проверки используйте:

Модели → Обзор → Протестировать мастер с шага 1.

Этот режим:

  • показывает реальное железо;
  • рассчитывает реальную рекомендацию;
  • выполняет безопасную предварительную проверку метаданных и совместимости;
  • не скачивает рабочую модель;
  • не переключает активный route;
  • не изменяет server-side state.

Шаг 2. Проверьте отчёт об оборудовании

Мастер показывает:

  • модель и количество GPU;
  • VRAM;
  • вычислительной совместимости;
  • vCPU и RAM;
  • свободный диск;
  • доступность control/среда выполнения.

Если GPU определён неправильно — остановитесь

Сначала исправьте драйвер или контейнерную среду выполнения. Установка модели поверх неверного отчёт об оборудовании усложнит диагностику.

Название профиля виртуальной машины не является источником истины: финальный выбор строится по фактически обнаруженному железу.


Шаг 3. NiceSoft Bootstrap

Мастер может установить NiceSoft Bootstrap · Qwen3 0.6B.

Это временная локальная модель:

  • официальный Qwen GGUF;
  • Q4_K_M;
  • размер порядка нескольких сотен мегабайт;
  • llama.cpp среда выполнения;
  • не участвует в рабочем рейтинге;
  • может обслуживать базовый чат во время скачивания основной модели.

Warning

Bootstrap — диагностическая модель. Нельзя по её ответам оценивать качество рабочей системы.


Шаг 4. Установите Bootstrap, если он предложен

  1. Прочитайте пояснение мастера.
  2. Нажмите установку Bootstrap.
  3. Дождитесь загрузки.
  4. Дождитесь запуска диагностического среда выполнения.
  5. Проверьте состояние Bootstrap готов.
  6. Продолжите к рабочую рекомендацию.

Bootstrap может временно обслуживать nicesoft-active, пока основная модель скачивается.


Когда Bootstrap можно пропустить

Это оправдано, если рабочий контур уже проверен или развёртывание выполняется по контролируемому регламенту. Пропуск Bootstrap не отменяет предварительная проверка основной модели.


Шаг 5. Изучите рабочую рекомендацию

Recommendation engine выбирает кандидата из квалифицированного каталога.

Учитываются:

  • GPU/VRAM;
  • совместимость среды выполнения;
  • контекст;
  • тип нагрузки;
  • качество/ранг;
  • число GPU;
  • tensor parallelism;
  • лицензия;
  • допустимость автоматической установки.

Tip

Не заменяйте рекомендацию выбором «самой большой модели». Отчёт совместимости отвечает на вопрос, что безопасно эксплуатировать здесь.


Шаг 6. Preflight до большой загрузки

Перед скачиванием десятков гигабайт проверяются:

  1. hardware compatibility;
  2. доступность среды выполнения;
  3. видимость GPU внутри контейнера;
  4. свободный диск;
  5. адрес метаданных источника модели без загрузки весов.

Для диска используется защитный ориентир:

download_gb × 1.15 + 5 ГБ

Если метаданные недоступны, мастер не должен начинать огромную загрузку вслепую.


Если предварительная проверка не прошёл

Симптом Действие
Недостаточно диска освободите/увеличьте диск
среда выполнения GPU недоступен исправьте container среда выполнения GPU
Hardware incompatible выберите квалифицированную модель
Метаданные недоступны проверьте DNS/HTTPS/proxy/CA
Установка заблокирована дождитесь другой админ-операции

Подробнее: Ошибки моделей.


Шаг 7. Установите рекомендованную модель

  1. Проверьте название и соответствие.
  2. Посмотрите расчёт диска/VRAM.
  3. Нажмите Установить рекомендованную модель.
  4. Следите за серверным прогрессом.
  5. Не запускайте параллельно другую модель.
  6. Дождитесь verified install.

Model Manager сохраняет желаемую модель серверно, поэтому кратковременный перезапуск управляющего сервиса не должен забыть выбор.


Шаг 8. Что происходит после скачивания

install
verified install
pending activation
остановка конфликтующей среды выполнения
запуск рабочей среды выполнения
/v1/models проверка готовности
active_local_model
READY

Файлы на диске ещё не означают готовность. Студия ждёт реального inference готовность.


Шаг 9. PRODUCTION_VALIDATING

Большая модель может загружаться в VRAM заметное время. Если этап завис надолго:

  1. не запускайте вторую модель;
  2. откройте логи среда выполнения;
  3. проверьте OOM;
  4. проверьте CUDA/архитектуру;
  5. проверьте вариант весов и текущую pending operation.

Шаг 10. READY

Мастер успешно завершён, когда модель:

  • установлена;
  • запущена;
  • отвечает как сервер вывода модели;
  • назначена активным маршрутом.

Затем администратор подтверждает финальный экран Начать работу.


Ручная проверка

  1. Откройте Модели → Обзор.
  2. Проверьте конкретное имя модели.
  3. Убедитесь в готовность.
  4. Создайте новый чат.
  5. Отправьте короткий тест.
  6. Проверьте подпись фактической модели.
  7. Выполните один реальный smoke-test: документ, код или корпоративный вопрос.

Несколько администраторов

Параллельная установка защищена серверной блокировкой.

Правило:

одна изменяющая модельная операция — много наблюдателей.

Если ADMIN A устанавливает модель, ADMIN B может видеть прогресс, но не должен параллельно переключать модельный маршрут. Серверная часть возвращает provisioning_locked даже при попытке обойти интерфейс.


DEGRADED

Если подходящей рабочие модели нет, администратор может осознанно оставить Bootstrap в ограниченном режиме, если этот путь доступен.

Это означает: базовый inference есть, но сервер не считается полноценно квалифицированным рабочим развёртыванием.


FAILED

Типовые причины:

  • диск;
  • GPU недоступен;
  • OOM;
  • несовместимость среды выполнения;
  • ошибка загрузки;
  • повреждённая установка.

После устранения причины используйте штатный retry/recovery.


Безопасный тест мастера на рабочем сервере

Не сбрасывайте рабочее состояние ради демонстрации. Используйте Протестировать мастер с шага 1. Проверочный запуск не скачивает веса и не меняет активную модель.


CPU-only ограничение

Текущий рабочий путь не должен объявлять CPU-only Bootstrap полноценной корпоративной моделью. Если NVIDIA GPU/среда выполнения отсутствует, мастер показывает проблему. Для CPU-only архитектуры нужен отдельный поддерживаемый сценарий модельного сервера.


Что мастер не делает

Он не должен:

  • устанавливать произвольный repository;
  • исполнять случайную shell-команду;
  • принимать лицензию frontier-модели без review;
  • молча переключать на Yandex AI;
  • объявлять модель готовой до готовность;
  • менять NVIDIA driver приложения;
  • игнорировать нехватку VRAM.

Что дальше