Ошибки моделей и диагностика¶
Начинайте с симптома. Не удаляйте вариант весов, state-файл или Docker тома хранения как первый способ «починить»: большинство проблем диагностируются без разрушительных действий.
Быстрая проверка¶
Журналы Model Manager:
Диагностика YC/Yandex AI:
Danger
Перед отправкой логов в поддержку удалите секреты, токены, внутренние адреса и чувствительные идентификаторы согласно политике организации.
«Модель не выбрана»¶
Возможные причины:
- first boot не завершён;
- активная модель удалена, резервная модель отсутствует;
- предыдущая активация завершилась ошибкой;
- route сознательно оставлен в
none.
Действия¶
- Откройте Модели → Обзор.
- Посмотрите active source.
- Проверьте развёртывание state.
- Если есть установленная локальная модель — активируйте её.
- Для Yandex AI сначала проверьте интеграцию.
- Выполните smoke-test.
GPU отсутствует¶
Возможные причины:
- VM без GPU;
- драйвер не работает;
- GPU не передан контейнеру;
- NVIDIA Container Toolkit или среда выполнения неисправны;
- после изменения VM устройство не появилось в контейнере.
Действия¶
Проверьте GPU на хосте, затем отчёт об оборудовании Model Manager. Именно то, что видит среда выполнения модели, определяет возможность запуска.
Не устанавливайте модель вручную мимо мастера, если среда выполнения не видит GPU.
GPU есть, но модель несовместима¶
Это может быть нормальным результатом.
Причины:
- мало VRAM;
- вычислительной совместимости ниже минимального рабочего уровня;
- FP8 не поддерживается;
- требуется больше GPU;
- контекст не помещается с резервом;
- профиль среды выполнения не квалифицирован.
V100¶
Большая VRAM сама по себе не делает старую GPU поддерживаемой. Текущая рабочая матрица может считать V100 устаревшей архитектуры из-за архитектуры среда выполнения.
Недостаточно диска¶
Мастер требует запас:
Действия¶
- Посмотрите required free space в preflight.
- Проверьте раздел, где хранятся модели.
- Удалите ненужные неактивные модели штатным UI.
- При необходимости увеличьте диск.
- Повторите preflight.
Не удаляйте вручную файлы активной модели.
Не удалось получить метаданные / HTTPS недоступен¶
Мастер специально не начинает большой download без предварительной проверки метаданных.
Проверьте:
- DNS;
- HTTPS egress;
- corporate proxy;
- TLS inspection;
- trusted CA;
- системное время;
- доступность источника модели.
После исправления повторите preflight.
Модель очень долго скачивается¶
Файл весов модели может занимать десятки или сотни гигабайт.
Проверьте:
- серверный progress;
- пропускную способность;
- диск;
- retry/error в логах;
- перезапуски контейнера;
- ограничения proxy на большие файлы.
Не ориентируйтесь только на визуальный процент в браузере.
Download завершён, но модель не активна¶
После файлов идёт validation.
Проверьте:
- installed/verified status;
- pending model;
- запуск среда выполнения;
- inference готовность;
- совпадение идентификатора модели в среде выполнения;
last_activation_error.
Частая причина — OOM при реальной загрузке в VRAM.
CUDA OOM / Out of memory¶
Причины:
- модель слишком велика;
- контекст слишком большой;
- недостаточный reserve;
- другой процесс занял GPU;
- неверный tensor parallel;
- сторонний GPU workload.
Действия¶
- Не повторяйте запуск бесконечно.
- Проверьте процессы GPU.
- Уберите стороннюю нагрузку по регламенту.
- Вернитесь к соответствие recommendation.
- Выберите более компактный artifact/контекст.
- При необходимости увеличьте GPU-класс.
Не обнуляйте запас безопасности только ради единичного запуска.
Модель отвечает медленно¶
Разделите проблему.
Долго до первого токена¶
- слишком большой запрос;
- большой документ;
- длинный prefill;
- очередь;
- cold start.
Медленная генерация¶
- тяжёлая модель;
- несколько пользователей;
- GPU throttling;
- неудачный parallel profile.
Диагностика¶
Сравните:
- короткий запрос без файла;
- длинный запрос;
- запрос с документом;
- одного пользователя;
- параллельную нагрузку.
После reboot модель не поднялась¶
Model Manager должен восстановить выбранную локальную модель, если она установлена.
Проверьте:
- файлы на месте;
- контейнер среды выполнения жив;
- GPU доступен после reboot;
- active model сохранена;
- среда выполнения не обслуживает другой ID;
- health/готовность.
Причина неуспешного восстановления должна быть в журналы среды выполнения.
Установка заблокирована другой операцией¶
Другой администратор уже выполняет изменяющую модельную операцию.
Действия¶
- Не обходите lock.
- Посмотрите текущую операцию/владельца.
- Дождитесь завершения.
- При аварийном завершении используйте штатный recovery/reset.
- Не редактируйте state вручную без аварийного регламента.
Удалили активную модель¶
Model Manager пытается:
- найти другую установленную совместимую локальную рабочую модель;
- активировать её;
- только если локальной нет — использовать уже явно настроенный внешний модельный сервер;
- иначе оставить
none.
Проверьте Обзор и состояние возможной резервной модели.
Старый ответ показывает прежнюю модель¶
Это правильное поведение. Студия сохраняет модель, реально сформировавшую исторический ответ. Глобальное переключение не переписывает атрибуцию.
Пользователь не может сам включить YandexGPT¶
Это нормально для текущей архитектуры. Provider меняется администратором, потому что операция меняет:
- privacy boundary;
- платную обработку;
- глобальный модельный маршрут.
Yandex AI: 403 PERMISSION_DENIED¶
Проверьте:
- авторизованный ключ загружен;
- определён AI Studio Folder;
ai.languageModels.userвыдана служебной учётной записи на этот Folder/родителя;- роль выдана на ресурс, а не объект служебной учётной записи;
- активен Billing Account;
- модель доступна проекту;
- повторите Проверить доступ;
- выполните:
403 обычно означает, что запрос дошёл до Yandex AI, но не получил разрешение.
Yandex AI: модель недоступна¶
Возможные причины:
- модель не предоставлена этому проекту;
- облачный каталог изменился;
- curated-карточка есть, probe вернул unavailable;
- есть ограничение доступа.
Не подменяйте URI вручную. Проверяйте официальный каталог и повторяйте probe.
Yandex AI подключён, но отвечает локальная модель¶
Сам факт загрузки ключа не активирует облачную модель. Проверьте active source в Модели → Обзор. Yandex AI требует явного выбора ADMIN.
Локальная модель отказала, Yandex не включился¶
Это ожидаемое безопасное поведение. Студия не должна молча отправить приватный запрос в облако. Решение принимает администратор.
Модель видна, но нет кнопки установки¶
Возможные варианты:
- frontier candidate;
- license review;
- обновление среды выполнения required;
- hardware incompatible;
- supporting model service;
- test/diagnostic artifact.
Посмотрите gate/status карточки.
Размер вариант весов отличается от старой документации¶
Исходный репозиторий и ревизия могут измениться. Для реальной установки используйте:
- текущую карточку;
- текущую предварительную проверку метаданных;
- pinned revision релиза.
Не планируйте огромную модель только по старой таблице.
Качество ответов слабое¶
Перед заменой модели проверьте:
- какая модель фактически ответила;
- не Bootstrap ли это;
- качество запроса;
- переданные RAG-источники;
- соответствует ли модель workload;
- достаточно ли контекста;
- одинаковый сравнительный тест другой модели.
Ответ по документу выдумывает факты¶
Это может быть не модель, а retrieval.
Проверьте:
- parsing файла;
- статус индексации;
- найденные фрагменты;
- цитаты;
- область поиска;
- формулировку «отвечай только по документу».
Подробнее: Проблемы с файлами.
Что приложить в поддержку¶
Полезно:
- версия Студии;
- время ошибки;
- GPU/VRAM;
- модель;
- этап install/activate/inference;
- безопасный текст ошибки;
- request ID;
- небольшой фрагмент model-manager/журналы среды выполнения;
- результат health;
- для Yandex — HTTP status/request-id.
Не прикладывайте:
- JSON private key;
- IAM token;
- пароли;
- полный
.env; - конфиденциальный чат без необходимости.
Универсальная последовательность восстановления¶
- Не удаляйте данные.
- Откройте Модели → Обзор.
- Определите active source.
- Определите фактическую модель.
- Проверьте отчёт об оборудовании.
- Выполните
./nicesoft.sh health. - Посмотрите model-manager logs.
- Для local проверьте среду выполнения и GPU.
- Для Yandex выполните
yc-doctor. - Исправьте конкретную причину.
- Повторите штатную операцию.
- Выполните новый smoke-test.
Что дальше¶
После восстановления переходите к Файлам и знаниям.