Перейти к содержанию

Управление локальными моделями

Что вы сделаете

Вы научитесь безопасно устанавливать, проверять, активировать и удалять локальные модели без переполнения GPU, диска и без случайной остановки рабочей Студии.


1. Почему локальная модель — это инфраструктура

Модель состоит не только из файла весов.

Рабочая конфигурация включает:

конкретный файл модели
+
среду выполнения
+
драйвер GPU
+
объём контекста
+
параметры памяти
+
маршрутизацию
+
проверку готовности

Поэтому копирование файла в каталог моделей ещё не делает модель рабочей.


2. Перед установкой

Проверьте:

nvidia-smi

Затем:

df -h

И в Центре управления моделями:

  • совместимость;
  • требуемый формат;
  • предполагаемый объём скачивания;
  • запас видеопамяти;
  • рабочий контекст;
  • разрешённость автоматической установки.

3. Диск

Не рассчитывайте свободное место как:

размер модели = необходимый диск

Во время загрузки и проверки могут потребоваться:

  • временный файл;
  • метаданные;
  • промежуточное состояние;
  • старая модель для отката.

Оставляйте запас.

Если мастер рассчитывает минимальный запас автоматически — не обходите эту проверку ручным копированием.


4. Видеопамять

Вес модели — только часть потребления.

На GPU также расходуется память на:

  • служебные структуры;
  • кэш контекста;
  • параллельные запросы;
  • выбранную среду выполнения.

Поэтому модель весом 14 ГБ не означает, что 16 ГБ GPU всегда достаточно для устойчивой работы.


5. Установка рекомендуемой модели

  1. Откройте каталог.
  2. Найдите модель со статусом рекомендации.
  3. Откройте подробности совместимости.
  4. Проверьте диск.
  5. Нажмите «Установить».
  6. Наблюдайте прогресс.
  7. Дождитесь проверки файла.
  8. Дождитесь запуска среды.
  9. Дождитесь готовности.
  10. Выполните тестовую генерацию.

Не закрывайте проблему словами «скачалось 100%», если модель после этого не прошла проверку готовности.


6. Метаданные и происхождение

Рабочий каталог должен использовать конкретные проверенные артефакты.

Перед загрузкой система должна знать:

  • поставщика;
  • точный идентификатор;
  • формат;
  • источник;
  • лицензирование;
  • совместимость со средой выполнения.

Если исходный файл поставщика изменился неожиданно — это повод остановить автоматическую активацию и проверить происхождение.


7. NiceSoft Bootstrap

Bootstrap нужен для:

  • первого запуска;
  • проверки маршрута;
  • диагностики базового чата;
  • временной работы мастера.

Bootstrap не является рекомендуемой постоянной производственной моделью.

Если после установки основной модели интерфейс продолжает показывать Bootstrap:

  • проверьте готовность основной модели;
  • проверьте последний сбой активации;
  • проверьте состояние маршрута.

8. Активация установленной модели

Если модель уже установлена:

  1. проверьте состояние её файлов;
  2. проверьте совместимость текущего оборудования;
  3. нажмите активацию;
  4. дождитесь готовности;
  5. создайте новый разговор;
  6. проверьте фактическую модель ответа.

Важно

Не активируйте новую модель непосредственно перед критичным массовым использованием без предварительного теста.


9. Нагрузочная проверка

Один успешный вопрос не показывает устойчивость.

Для рабочей квалификации проверьте:

  • одиночный короткий запрос;
  • длинный запрос;
  • ответ по документу;
  • несколько одновременных пользователей;
  • длительную генерацию;
  • повторные запросы после нескольких минут работы.

Наблюдайте:

watch -n 1 nvidia-smi

Проверяйте:

  • память;
  • загрузку GPU;
  • наличие процессов;
  • отсутствие постоянных OOM.

10. Ошибка нехватки видеопамяти

Симптомы:

  • модель не стартует;
  • процесс падает;
  • запросы завершаются ошибкой памяти;
  • контейнер постоянно перезапускается.

Действия:

  1. остановите повторные пользовательские запросы;
  2. проверьте nvidia-smi;
  3. убедитесь, что GPU не занят посторонним процессом;
  4. проверьте выбранный контекст;
  5. вернитесь на меньший проверенный профиль;
  6. не уменьшайте защитные запасы вслепую.

11. Несколько GPU

Дополнительные GPU не означают автоматически, что одна модель станет быстрее.

Если модель помещается на один GPU, часто разумнее:

  • оставить один экземпляр на одном GPU;
  • использовать второй GPU под параллельную нагрузку;
  • не включать распределение без квалификации конкретной модели.

Многокарточная топология должна быть частью проверенного профиля, а не случайной ручной настройки.


12. Старые GPU

Если GPU определяется системой, это ещё не означает поддержку текущей среды модели.

Проверяйте вычислительную совместимость.

Например, старые поколения могут не поддерживаться текущей версией используемой среды выполнения.

В таком случае правильное решение — не «убрать проверку», а выбрать совместимый стек или внешний модельный маршрут.


13. Обновление модели

Не заменяйте файл «на месте» без версионирования.

Правильнее:

новый артефакт
отдельная проверка
установка
приёмочные тесты
активация
возможность вернуться к предыдущему

14. Удаление

Удаляйте модель только после ответа на вопросы:

  • активна ли она;
  • нужна ли как откат;
  • есть ли другая готовая модель;
  • не идёт ли установка;
  • не используется ли она для диагностического профиля.

После удаления проверьте:

df -h

и новый разговор.


15. Резервное копирование весов

Веса моделей часто можно повторно загрузить из проверенного источника, поэтому включать их в каждую резервную копию необязательно.

Но обязательно сохраняйте:

  • идентификатор модели;
  • версию артефакта;
  • источник;
  • контрольную сумму, если используется;
  • параметры квалифицированного профиля;
  • сведения о том, какая модель была активна.

16. Мониторинг

Регулярно проверяйте:

  • ошибки среды модели;
  • количество перезапусков;
  • видеопамять;
  • диск;
  • время до первого токена;
  • скорость генерации;
  • количество параллельных запросов;
  • жалобы на качество.

Качество и инфраструктура — разные вещи

Плохой ответ может быть следствием:

  • плохого запроса;
  • неправильного RAG;
  • недостаточного контекста;
  • слабой модели;
  • устаревшей базы знаний.

Не заменяйте модель при каждой жалобе пользователя без диагностики.


17. Приёмка новой локальной модели

Перед производственным использованием проверьте не менее:

  1. обычный русский текст;
  2. длинный документ;
  3. код, если это целевой сценарий;
  4. следование формату;
  5. отказ при отсутствии данных;
  6. работу с RAG;
  7. параллельные запросы;
  8. устойчивость после перезапуска;
  9. фактическую видеопамять;
  10. возможность отката.

Что дальше

Для внешнего модельного контура перейдите к управлению Yandex AI.