Локальные модели¶
Локальная модель — основной вариант, когда организация хочет выполнять генерацию текста на собственном GPU и контролировать вычислительный контур.
ИИ Студия специально скрывает техническую сложность: администратор выбирает проверенную модель в Центре управления моделями, а Model Manager управляет установкой, запуском, проверкой готовности и маршрутизацией.
Что означает локальная обработка¶
При обычном диалоге путь выглядит так:
Модельный запрос не требуется отправлять внешнему поставщику ИИ. Внутри контролируемой инфраструктуры могут оставаться:
- сообщения чатов;
- переданный модели контекст;
- фрагменты загруженных документов;
- корпоративные инструкции;
- внутренний код и конфигурации;
- ответы модели.
Локальная модель не означает полный запрет внешнего трафика
Если в запросе отдельно включён интернет-поиск, сервис Яндекс Облака или иная внешняя интеграция, данные, необходимые этой функции, могут быть переданы наружу. Оценивайте всю цепочку запроса.
Для рабочие модели нужен подходящий GPU¶
Локальный рабочий каталог ориентирован на серверные NVIDIA GPU и проверенные профили среды выполнения. Студия учитывает:
- модель ускорителя;
- количество GPU;
- VRAM;
- вычислительной совместимости;
- доступность GPU внутри контейнера;
- совместимость со средой выполнения.
CPU-only¶
NiceSoft Bootstrap не заявляется как полноценный CPU-only рабочий контур. Если NVIDIA GPU/среда выполнения отсутствуют, мастер должен показать проблему, а не имитировать готовность полноценной локальной модели.
VRAM — не только веса¶
VRAM — память видеокарты. В ней должны помещаться не только веса модели:
Поэтому вариант весов 9 ГБ не означает, что 10 ГБ VRAM достаточно для безопасной эксплуатации.
Размер загрузки и размер памяти — разные числа¶
Размер вариант весов помогает оценить:
- объём трафика;
- свободный диск;
- время загрузки.
Но он не равен required VRAM.
Перед установкой мастер отдельно проверяет диск. Защитный ориентир:
Контекст тоже потребляет память¶
Контекст — объём текста, который модель учитывает за один запрос. Больший контекст увеличивает рабочий memory envelope.
Поэтому одна модель может иметь разные эксплуатационные профили при 8K, 16K, 32K, 64K или 128K.
Студия использует рабочий целевой контекст — рабочее значение, квалифицированное для конкретного artifact и железа, а не автоматически максимальное число из карточки исходного проекта.
AWQ¶
AWQ — способ квантизации. Практический смысл:
- меньше памяти под веса;
- возможность использовать модели класса 7B/8B на T4 16 ГБ;
- хороший баланс для локального корпоративного ИИ.
Например, Qwen3 8B AWQ и Qwen2.5 Coder 7B AWQ являются ключевыми компактными рабочими профилями.
BF16¶
BF16 обычно требует больше VRAM, но сохраняет высокую точность весов. Он становится естественным выбором на более мощных GPU.
Нельзя применять правило «веса 55 ГБ → 56 ГБ VRAM достаточно»: среда выполнения и контекст требуют дополнительного резерва.
FP8¶
FP8 может дать более компактный memory profile и высокий throughput на подходящих современных GPU.
Но:
- старые GPU могут не поддерживать нужные операции;
- среда выполнения должна быть квалифицирован;
- конкретный вариант весов должен пройти проверку.
Поэтому Model Manager не выбирает FP8 только потому, что файл меньше.
Один активный среда выполнения модели¶
Во время первоначального запуска могут существовать рабочая среда выполнения и среда Bootstrap, но они не должны конкурировать за GPU как две одновременно активные рабочие модели.
При переключении Model Manager:
- фиксирует желаемую модель;
- останавливает конфликтующий среда выполнения;
- запускает нужный;
- ждёт готовность;
- только после этого переводит активный маршрут.
Несколько пользователей на одном GPU¶
Одна локальная модель обслуживает множество сотрудников, но GPU остаётся общим ресурсом.
При росте нагрузки возможны:
- очередь;
- рост времени до первого токена;
- снижение скорости генерации;
- увеличение KV-кэша;
- достижение лимита параллельности.
Поэтому рабочий выбор проверяют не только на одном красивом ответе, но и под ожидаемой нагрузкой.
Пример: T4 16 ГБ¶
Текущая модельная стратегия использует на T4 компактные квалифицированные варианты. Типичные кандидаты:
- Qwen3 8B AWQ — универсальные задачи;
- Qwen2.5 Coder 7B AWQ — программирование.
Финальный выбор всё равно делает актуальный Model Manager по отчёт об оборудовании.
Пример: T4i 24 ГБ¶
Дополнительная VRAM расширяет выбор. Могут становиться доступны более тяжёлые FP8/BF16-профили, но 24 ГБ не означают «любая модель до 24 ГБ подходит»: требуется рабочий резерв.
Пример: A100 80 ГБ¶
80 ГБ VRAM переводят систему в другой класс локальных моделей. В текущей матрице для универсальной нагрузки естественным кандидатом является Qwen3.8 27B, а для специализированных сценариев каталог содержит кодовые, reasoning и long-context варианты.
Несколько GPU и tensor parallelism¶
Некоторые модели распределяются между несколькими GPU. Центр управления моделями показывает расчётное число GPU.
Не складывайте VRAM вручную как единственный критерий: важны среда выполнения, архитектура, межсоединение и распределение KV-кэша.
Почему V100 может быть несовместим даже с большой VRAM¶
Суммарная память не гарантирует поддержку. В текущей рабочей матрице V100 относится к устаревшему классу из-за более старой вычислительной совместимости относительно минимального рабочего уровня среда выполнения.
Восемь старых GPU не становятся автоматически лучшим вариантом только из-за суммарной VRAM.
Локальная модель и документы¶
Когда пользователь прикрепляет документ, Студия может:
- извлечь текст;
- проиндексировать его;
- найти релевантные фрагменты;
- передать их локальной модели.
Это позволяет организовать ответы по внутренним материалам без необходимости отправлять содержание в публичный ИИ API.
Подробнее: Файлы и знания.
Локальная модель и интернет-поиск¶
Если интернет-поиск выключен, модель использует собственные знания, контекст чата и локальные документы.
Если поиск включён, сама генерация может оставаться локальной, но поисковый запрос и чтение внешних страниц являются отдельным сетевым каналом.
Как проверить, что активна локальная модель¶
Пользователь смотрит на подпись фактической модели у ответа.
Администратор дополнительно проверяет Модели → Обзор:
- источник — локальный;
- конкретное название модели;
- среда выполнения готова;
- маршрут активен;
- нет pending/error.
Bootstrap локальный, но не рабочая модель¶
NiceSoft Bootstrap предназначен для проверки локального вывода модели и временной работы мастера. Он не должен использоваться для оценки качества полноценной Студии и не входит в рабочие рекомендации.
Когда локальная модель особенно полезна¶
- данные нельзя передавать внешнему ИИ-провайдеру;
- сотрудники работают с внутренними документами;
- анализируется исходный код;
- требуется контролируемый вычислительный контур;
- организация может выделить GPU;
- нагрузка достаточно стабильна.
Когда облачная модель может быть рациональнее¶
- облачная обработка разрешена;
- нет подходящего GPU;
- нагрузка нерегулярна;
- требуется конкретная модель Яндекса;
- эксплуатация крупной локальной модели экономически невыгодна.
В таком случае администратор осознанно активирует Yandex AI.
Проверка после установки¶
- Откройте Модели → Обзор.
- Проверьте источник и конкретное название.
- Убедитесь в готовность.
- Создайте новый тестовый чат.
- Задайте короткий вопрос.
- Проверьте подпись фактической модели.
- Выполните один реальный тест по документу или коду.
- Только после этого допускайте модель к рабочей нагрузке.