Перейти к содержанию

Матрица моделей — выпуск 0.3.66

Эта страница — справочная фиксация каталога, поставляемого вместе с НайсСофт — ИИ Студией 0.3.66. При обновлении продукта значения нужно сверять с новым config/models/catalog.json и состоянием Центра управления моделями.

Warning

Статическая таблица не заменяет проверку совместимости на реальном сервере. Решение об установке принимает мастер по фактическим GPU, видеопамяти, вычислительной совместимости, числу ускорителей, диску и доступности среды выполнения.


1. Как читать таблицу

  • минимальная VRAM — нижняя техническая граница профиля, а не рекомендуемый рабочий запас;
  • рекомендуемая VRAM — более безопасный класс для нормальной эксплуатации;
  • нативный контекст — возможность исходной модели, а не обещание использовать весь объём на любом GPU;
  • размер загрузки — ориентир по файлам модели на диске, а не требуемая VRAM;
  • вычислительная совместимость — минимальный класс архитектуры NVIDIA для текущего профиля;
  • среда выполнения — управляемая серверная среда Студии, а не возможность запуска пользователем произвольного кода.

2. Квалифицированный локальный каталог

Модель Идентификатор Статус в каталоге Среда Формат Мин. совместимость Мин./реком. VRAM Нативный контекст Загрузка Лицензия
Qwen3 8B · AWQ qwen3-8b-awq рабочая, компактный класс vllm AWQ · 4 бита 7.5+ 12 / 16 ГБ 40,960 6.11 ГБ Apache-2.0
Qwen2.5 Coder 7B · AWQ qwen25-coder-7b-awq рабочая, специализированная vllm AWQ · 4 бита 7.5+ 12 / 16 ГБ 131,072 5.57 ГБ Apache-2.0
Qwen3.5 4B qwen35-4b рабочая альтернатива vllm Нет 7.5+ 14 / 16 ГБ 262,144 9.4 ГБ Apache-2.0
Qwen3.5 9B qwen35-9b рабочая, малый запас памяти vllm Нет 7.5+ 23 / 32 ГБ 262,144 19.4 ГБ Apache-2.0
Qwen3.8 27B qwen38-27b основная рабочая vllm Нет 7.5+ 72 / 80 ГБ 262,144 55.7 ГБ Apache-2.0
Qwen3.8 27B · FP8 qwen38-27b-fp8 рабочая оптимизированная vllm FP8 W8A8 8.9+ 48 / 64 ГБ 262,144 30.9 ГБ Apache-2.0
Qwen3 Coder 30B-A3B qwen3-coder-30b специализированная совместимость vllm Нет 7.5+ 76 / 80 ГБ 262,144 61.2 ГБ Apache-2.0
Qwen3 Coder Next qwen3-coder-next специализированная совместимость vllm Нет 7.5+ 220 / 256 ГБ 262,144 159.0 ГБ Apache-2.0
Ministral 3 8B · FP8 ministral3-8b-fp8 рабочая альтернатива vllm веса FP8 7.5+ 16 / 24 ГБ 262,144 10.4 ГБ Apache-2.0
Ministral 3 14B · FP8 ministral3-14b-fp8 рабочая альтернатива vllm веса FP8 7.5+ 23 / 24 ГБ 262,144 15.7 ГБ Apache-2.0
GLM-4.7-Flash glm47-flash рабочая специализированная vllm официальный набор весов производителя 8.0+ 76 / 80 ГБ 202,752 62.5 ГБ MIT
Kimi Linear 48B-A3B kimi-linear-48b-a3b рабочая специализированная vllm Нет 8.0+ 112 / 141 ГБ 1,048,576 98.3 ГБ MIT
Mistral Small 4 119B · FP8 mistral-small4-119b-fp8 рабочая специализированная vllm веса FP8 8.0+ 150 / 160 ГБ 262,144 120.9 ГБ Apache-2.0
Начальная модель Найс Софт · Qwen3 0.6B qwen3-06b-test только начальная диагностика llamacpp-test Q4_K_M 6.1+ 1.2 / 2 ГБ 32,768 0.397 ГБ Apache-2.0

Числа контекста приведены в токенах. В рабочем профиле фактический контекст может быть меньше.


3. Практические классы

NVIDIA T4 16 ГБ

Основные проверенные варианты:

  • Qwen3 8B · AWQ — универсальная рабочая модель;
  • Qwen2.5 Coder 7B · AWQ — программирование и технические задачи;
  • Qwen3.5 4B — современная компактная альтернатива по результату проверки совместимости.

Не пытайтесь выбирать модель только по числу параметров: AWQ и BF16 имеют разный профиль памяти.

T4i 24 ГБ

Доступен больший запас. В зависимости от конкретного профиля мастер может рассматривать:

  • Qwen3 8B AWQ;
  • Qwen2.5 Coder 7B AWQ;
  • Qwen3.5 4B;
  • Ministral 3 8B FP8;
  • Ministral 3 14B FP8 — только когда фактический расчёт оставляет достаточный запас.

Qwen3.5 9B имеет минимальную оценку около 23 ГБ и поэтому на 24-ГБ GPU остаётся слишком близко к границе для безусловной рабочей рекомендации.

A100 80 ГБ

Основной универсальный профиль:

  • Qwen3.8 27B BF16.

Также по задаче могут использоваться:

  • GLM-4.7-Flash;
  • Ministral 3 14B FP8;
  • Qwen3 Coder 30B-A3B — если профиль кода оправдан.

Почему не Qwen3.8 27B FP8 на A100

Профиль qwen38-27b-fp8 требует вычислительную совместимость 8.9+. NVIDIA A100 имеет 8.0, поэтому наличие 80 ГБ VRAM не отменяет архитектурного ограничения.

Несколько A100 / Gen2 / V4

Дополнительные GPU позволяют размещать более крупные модели и увеличивать параллелизм, но сами по себе не делают одну и ту же 27B-модель «умнее».

Например, в квалифицированной матрице для 2×A100 long-context задач рассматривается Kimi Linear 48B-A3B.

V100

V100 может иметь большой суммарный объём VRAM, но её вычислительная совместимость — 7.0, а основной vLLM-профиль поставки требует 7.5+.

Поэтому V100 в 0.3.66 не является поддерживаемой конфигурацией для рабочей локальной модели. Начальная диагностическая модель может иметь другой технический путь, но это не делает V100 рабочей платформой Студии.

Полная привязка 27 профилей Яндекс Облака приведена в развёртывании в Яндекс Облаке.


4. Начальная диагностическая модель

Начальная модель Найс Софт · Qwen3 0.6B:

  • идентификатор: qwen3-06b-test;
  • среда: llama.cpp диагностического профиля;
  • формат: Q4_K_M;
  • загрузка: около 0,397 ГБ;
  • минимальная VRAM: около 1,2 ГБ;
  • назначение: проверить цепочку GPU → контейнер → загрузка → активация → ответ.

Danger

Не используйте её для оценки качества продукта, больших документов или рабочих корпоративных сценариев. Это диагностический инструмент первого запуска.


5. Перспективные модели

Они присутствуют в планировочной части реестра, но не должны автоматически устанавливаться, пока не снята соответствующая блокировка.

Модель Идентификатор Поставщик Минимум GPU Минимум VRAM Загрузка Лицензия Почему заблокирована
Qwen3.8 Flash Next qwen38-flash-next Qwen 4 GPU 420 ГБ 360.0 ГБ Лицензия сообщества Qwen 1.0 проверка лицензии
DeepSeek V4.1 Flash deepseek-v41-flash DeepSeek 4 GPU 560 ГБ 510.0 ГБ MIT нужна новая среда выполнения
GLM-5.3-Flash glm53-flash Z.ai 4 GPU 380 ГБ 332.0 ГБ MIT нужна новая среда выполнения
MiniMax M2.5 minimax-m25 MiniMax 2 GPU 270 ГБ 230.0 ГБ Изменённая MIT / лицензия модели MiniMax проверка лицензии и среды

Отображение перспективной модели в интерфейсе означает возможность планировать оборудование, а не разрешение обходить проверку лицензии или среды выполнения.


6. Управляемые текстовые модели Yandex AI

Эти модели не выполняются локально. При их выборе нужное содержимое запроса передаётся в Yandex AI Studio.

Модель Идентификатор Студии Контекст Назначение
Alice AI LLM aliceai-llm 131,072 Флагманская языковая модель Яндекса для бизнес-диалогов, документов, поиска по знаниям, редактирования и генерации текста.
Alice AI LLM Flash aliceai-llm-flash 65,536 Быстрая и экономичная модель Яндекса для массовых диалогов, суммаризации, классификации и обработки документов.
YandexGPT Pro 5.1 yandexgpt-5.1 32,768 Актуальная профессиональная версия YandexGPT для корпоративных текстовых сценариев, извлечения данных, поиска по знаниям и интеграций.
YandexGPT Pro 5 yandexgpt-5-pro 32,768 Предыдущее поколение YandexGPT Pro. Оставлено для совместимости существующих бизнес-сценариев; для новых внедрений предпочтительнее 5.1 или Alice AI LLM.
YandexGPT Lite 5 yandexgpt-5-lite 32,768 Экономичная YandexGPT для простых текстовых задач, классификации, коротких ответов и массовой обработки.

Для облачных моделей не фиксируйте стоимость в постоянной справочной таблице: тарифы являются внешней динамической величиной. Используйте актуальную страницу тарификации Yandex AI Studio.


7. Модели Яндекса, которые видны справочно, но не включены как чат-модель

В реестре 0.3.66 дополнительно описаны:

  • дообученная YandexGPT Lite — зависит от конкретного Folder клиента;
  • Yandex Text Embeddings v1/v2 — вспомогательные модели представлений;
  • Alice AI ART — генерация изображений, не входит в текущий текстовый профиль Студии;
  • Speech Realtime — голосовые модели, голосовой режим продукта сейчас не поставляется.

Не рекламируйте такую строку реестра как функцию пользовательского чата.


8. Статусы жизненного цикла

В интерфейсе фактические подписи могут меняться, но смысл сводится к следующим состояниям:

не установлена
→ проверка
→ загрузка
→ установлена
→ активация
→ готова

Отдельно возможны:

  • несовместима с текущим оборудованием;
  • заблокирована политикой/лицензией;
  • ошибка загрузки;
  • ошибка запуска;
  • ожидает активации;
  • диагностическая;
  • перспективная.

9. Источник истины

В порядке убывания актуальности:

  1. текущая карточка «Модели» на реальном сервере;
  2. результат проверки оборудования и совместимости;
  3. config/models/catalog.json именно установленного выпуска;
  4. docs/YC_MODEL_MATRIX.md того же выпуска;
  5. эта справочная страница.

Если значения расходятся, не устанавливайте модель вслепую — сначала выясните версию выпуска.

См. также