Матрица моделей — выпуск 0.3.66¶
Эта страница — справочная фиксация каталога, поставляемого вместе с НайсСофт — ИИ Студией 0.3.66. При обновлении продукта значения нужно сверять с новым config/models/catalog.json и состоянием Центра управления моделями.
Warning
Статическая таблица не заменяет проверку совместимости на реальном сервере. Решение об установке принимает мастер по фактическим GPU, видеопамяти, вычислительной совместимости, числу ускорителей, диску и доступности среды выполнения.
1. Как читать таблицу¶
- минимальная VRAM — нижняя техническая граница профиля, а не рекомендуемый рабочий запас;
- рекомендуемая VRAM — более безопасный класс для нормальной эксплуатации;
- нативный контекст — возможность исходной модели, а не обещание использовать весь объём на любом GPU;
- размер загрузки — ориентир по файлам модели на диске, а не требуемая VRAM;
- вычислительная совместимость — минимальный класс архитектуры NVIDIA для текущего профиля;
- среда выполнения — управляемая серверная среда Студии, а не возможность запуска пользователем произвольного кода.
2. Квалифицированный локальный каталог¶
| Модель | Идентификатор | Статус в каталоге | Среда | Формат | Мин. совместимость | Мин./реком. VRAM | Нативный контекст | Загрузка | Лицензия |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3 8B · AWQ | qwen3-8b-awq |
рабочая, компактный класс | vllm | AWQ · 4 бита | 7.5+ | 12 / 16 ГБ | 40,960 | 6.11 ГБ | Apache-2.0 |
| Qwen2.5 Coder 7B · AWQ | qwen25-coder-7b-awq |
рабочая, специализированная | vllm | AWQ · 4 бита | 7.5+ | 12 / 16 ГБ | 131,072 | 5.57 ГБ | Apache-2.0 |
| Qwen3.5 4B | qwen35-4b |
рабочая альтернатива | vllm | Нет | 7.5+ | 14 / 16 ГБ | 262,144 | 9.4 ГБ | Apache-2.0 |
| Qwen3.5 9B | qwen35-9b |
рабочая, малый запас памяти | vllm | Нет | 7.5+ | 23 / 32 ГБ | 262,144 | 19.4 ГБ | Apache-2.0 |
| Qwen3.8 27B | qwen38-27b |
основная рабочая | vllm | Нет | 7.5+ | 72 / 80 ГБ | 262,144 | 55.7 ГБ | Apache-2.0 |
| Qwen3.8 27B · FP8 | qwen38-27b-fp8 |
рабочая оптимизированная | vllm | FP8 W8A8 | 8.9+ | 48 / 64 ГБ | 262,144 | 30.9 ГБ | Apache-2.0 |
| Qwen3 Coder 30B-A3B | qwen3-coder-30b |
специализированная совместимость | vllm | Нет | 7.5+ | 76 / 80 ГБ | 262,144 | 61.2 ГБ | Apache-2.0 |
| Qwen3 Coder Next | qwen3-coder-next |
специализированная совместимость | vllm | Нет | 7.5+ | 220 / 256 ГБ | 262,144 | 159.0 ГБ | Apache-2.0 |
| Ministral 3 8B · FP8 | ministral3-8b-fp8 |
рабочая альтернатива | vllm | веса FP8 | 7.5+ | 16 / 24 ГБ | 262,144 | 10.4 ГБ | Apache-2.0 |
| Ministral 3 14B · FP8 | ministral3-14b-fp8 |
рабочая альтернатива | vllm | веса FP8 | 7.5+ | 23 / 24 ГБ | 262,144 | 15.7 ГБ | Apache-2.0 |
| GLM-4.7-Flash | glm47-flash |
рабочая специализированная | vllm | официальный набор весов производителя | 8.0+ | 76 / 80 ГБ | 202,752 | 62.5 ГБ | MIT |
| Kimi Linear 48B-A3B | kimi-linear-48b-a3b |
рабочая специализированная | vllm | Нет | 8.0+ | 112 / 141 ГБ | 1,048,576 | 98.3 ГБ | MIT |
| Mistral Small 4 119B · FP8 | mistral-small4-119b-fp8 |
рабочая специализированная | vllm | веса FP8 | 8.0+ | 150 / 160 ГБ | 262,144 | 120.9 ГБ | Apache-2.0 |
| Начальная модель Найс Софт · Qwen3 0.6B | qwen3-06b-test |
только начальная диагностика | llamacpp-test | Q4_K_M | 6.1+ | 1.2 / 2 ГБ | 32,768 | 0.397 ГБ | Apache-2.0 |
Числа контекста приведены в токенах. В рабочем профиле фактический контекст может быть меньше.
3. Практические классы¶
NVIDIA T4 16 ГБ¶
Основные проверенные варианты:
- Qwen3 8B · AWQ — универсальная рабочая модель;
- Qwen2.5 Coder 7B · AWQ — программирование и технические задачи;
- Qwen3.5 4B — современная компактная альтернатива по результату проверки совместимости.
Не пытайтесь выбирать модель только по числу параметров: AWQ и BF16 имеют разный профиль памяти.
T4i 24 ГБ¶
Доступен больший запас. В зависимости от конкретного профиля мастер может рассматривать:
- Qwen3 8B AWQ;
- Qwen2.5 Coder 7B AWQ;
- Qwen3.5 4B;
- Ministral 3 8B FP8;
- Ministral 3 14B FP8 — только когда фактический расчёт оставляет достаточный запас.
Qwen3.5 9B имеет минимальную оценку около 23 ГБ и поэтому на 24-ГБ GPU остаётся слишком близко к границе для безусловной рабочей рекомендации.
A100 80 ГБ¶
Основной универсальный профиль:
- Qwen3.8 27B BF16.
Также по задаче могут использоваться:
- GLM-4.7-Flash;
- Ministral 3 14B FP8;
- Qwen3 Coder 30B-A3B — если профиль кода оправдан.
Почему не Qwen3.8 27B FP8 на A100¶
Профиль qwen38-27b-fp8 требует вычислительную совместимость 8.9+. NVIDIA A100 имеет 8.0, поэтому наличие 80 ГБ VRAM не отменяет архитектурного ограничения.
Несколько A100 / Gen2 / V4¶
Дополнительные GPU позволяют размещать более крупные модели и увеличивать параллелизм, но сами по себе не делают одну и ту же 27B-модель «умнее».
Например, в квалифицированной матрице для 2×A100 long-context задач рассматривается Kimi Linear 48B-A3B.
V100¶
V100 может иметь большой суммарный объём VRAM, но её вычислительная совместимость — 7.0, а основной vLLM-профиль поставки требует 7.5+.
Поэтому V100 в 0.3.66 не является поддерживаемой конфигурацией для рабочей локальной модели. Начальная диагностическая модель может иметь другой технический путь, но это не делает V100 рабочей платформой Студии.
Полная привязка 27 профилей Яндекс Облака приведена в развёртывании в Яндекс Облаке.
4. Начальная диагностическая модель¶
Начальная модель Найс Софт · Qwen3 0.6B:
- идентификатор:
qwen3-06b-test; - среда:
llama.cppдиагностического профиля; - формат: Q4_K_M;
- загрузка: около 0,397 ГБ;
- минимальная VRAM: около 1,2 ГБ;
- назначение: проверить цепочку GPU → контейнер → загрузка → активация → ответ.
Danger
Не используйте её для оценки качества продукта, больших документов или рабочих корпоративных сценариев. Это диагностический инструмент первого запуска.
5. Перспективные модели¶
Они присутствуют в планировочной части реестра, но не должны автоматически устанавливаться, пока не снята соответствующая блокировка.
| Модель | Идентификатор | Поставщик | Минимум GPU | Минимум VRAM | Загрузка | Лицензия | Почему заблокирована |
|---|---|---|---|---|---|---|---|
| Qwen3.8 Flash Next | qwen38-flash-next |
Qwen | 4 GPU | 420 ГБ | 360.0 ГБ | Лицензия сообщества Qwen 1.0 | проверка лицензии |
| DeepSeek V4.1 Flash | deepseek-v41-flash |
DeepSeek | 4 GPU | 560 ГБ | 510.0 ГБ | MIT | нужна новая среда выполнения |
| GLM-5.3-Flash | glm53-flash |
Z.ai | 4 GPU | 380 ГБ | 332.0 ГБ | MIT | нужна новая среда выполнения |
| MiniMax M2.5 | minimax-m25 |
MiniMax | 2 GPU | 270 ГБ | 230.0 ГБ | Изменённая MIT / лицензия модели MiniMax | проверка лицензии и среды |
Отображение перспективной модели в интерфейсе означает возможность планировать оборудование, а не разрешение обходить проверку лицензии или среды выполнения.
6. Управляемые текстовые модели Yandex AI¶
Эти модели не выполняются локально. При их выборе нужное содержимое запроса передаётся в Yandex AI Studio.
| Модель | Идентификатор Студии | Контекст | Назначение |
|---|---|---|---|
| Alice AI LLM | aliceai-llm |
131,072 | Флагманская языковая модель Яндекса для бизнес-диалогов, документов, поиска по знаниям, редактирования и генерации текста. |
| Alice AI LLM Flash | aliceai-llm-flash |
65,536 | Быстрая и экономичная модель Яндекса для массовых диалогов, суммаризации, классификации и обработки документов. |
| YandexGPT Pro 5.1 | yandexgpt-5.1 |
32,768 | Актуальная профессиональная версия YandexGPT для корпоративных текстовых сценариев, извлечения данных, поиска по знаниям и интеграций. |
| YandexGPT Pro 5 | yandexgpt-5-pro |
32,768 | Предыдущее поколение YandexGPT Pro. Оставлено для совместимости существующих бизнес-сценариев; для новых внедрений предпочтительнее 5.1 или Alice AI LLM. |
| YandexGPT Lite 5 | yandexgpt-5-lite |
32,768 | Экономичная YandexGPT для простых текстовых задач, классификации, коротких ответов и массовой обработки. |
Для облачных моделей не фиксируйте стоимость в постоянной справочной таблице: тарифы являются внешней динамической величиной. Используйте актуальную страницу тарификации Yandex AI Studio.
7. Модели Яндекса, которые видны справочно, но не включены как чат-модель¶
В реестре 0.3.66 дополнительно описаны:
- дообученная YandexGPT Lite — зависит от конкретного Folder клиента;
- Yandex Text Embeddings v1/v2 — вспомогательные модели представлений;
- Alice AI ART — генерация изображений, не входит в текущий текстовый профиль Студии;
- Speech Realtime — голосовые модели, голосовой режим продукта сейчас не поставляется.
Не рекламируйте такую строку реестра как функцию пользовательского чата.
8. Статусы жизненного цикла¶
В интерфейсе фактические подписи могут меняться, но смысл сводится к следующим состояниям:
Отдельно возможны:
- несовместима с текущим оборудованием;
- заблокирована политикой/лицензией;
- ошибка загрузки;
- ошибка запуска;
- ожидает активации;
- диагностическая;
- перспективная.
9. Источник истины¶
В порядке убывания актуальности:
- текущая карточка «Модели» на реальном сервере;
- результат проверки оборудования и совместимости;
config/models/catalog.jsonименно установленного выпуска;docs/YC_MODEL_MATRIX.mdтого же выпуска;- эта справочная страница.
Если значения расходятся, не устанавливайте модель вслепую — сначала выясните версию выпуска.