Перейти к содержанию

Модели Qwen в ИИ Студии

Qwen — важная часть локального каталога, но не единственная. Разные Qwen-профили используются от диагностической 0.6B до крупных моделей для серьёзной GPU-инфраструктуры.


Быстрая карта

Модель Роль Практический смысл
NiceSoft Bootstrap · Qwen3 0.6B диагностика первый запуск, не рабочая модель
Qwen3 8B AWQ универсальная локальный baseline для T4
Qwen2.5 Coder 7B AWQ код coding specialist для T4
Qwen3.5 4B компактная современный BF16 profile
Qwen3.5 9B сбалансированная более тяжёлый универсальный profile
Qwen3.8 27B флагманская 80 ГБ class
Qwen3.8 27B FP8 throughput современный FP8 GPU
Qwen3 Coder 30B-A3B мощный coding 80 ГБ class
Qwen3 Coder Next максимальный coding крупный GPU/multi-GPU

Всегда ориентируйтесь на текущий соответствие Model Manager.


NiceSoft Bootstrap · Qwen3 0.6B

Специальная продуктовая роль минимальной модели.

Она:

  • основана на официальном Qwen3 0.6B GGUF;
  • использует Q4_K_M;
  • запускается через llama.cpp;
  • занимает несколько сотен мегабайт;
  • не участвует в рабочем рейтинге;
  • может временно отвечать во время загрузки основной модели.

Подходит

  • проверить inference path;
  • smoke-test чата;
  • первичная диагностика.

Не подходит

  • оценивать качество рабочей Студии;
  • сложный корпоративный анализ;
  • серьёзное программирование;
  • массовая рабочая нагрузка.

Qwen3 8B AWQ

Один из ключевых универсальных профилей для T4 16 ГБ.

AWQ 4-bit уменьшает память под веса и позволяет получить полезную 8B-модель при ограниченной VRAM.

Типовые задачи:

  • корпоративный чат;
  • письма;
  • краткие резюме;
  • технические вопросы;
  • Linux/DevOps;
  • базовый анализ кода;
  • ответы по найденным фрагментам документов.

Рабочий context target каталога — около 16K.


Qwen2.5 Coder 7B AWQ

Специализированная модель программирования для компактного GPU.

Типовые задачи:

  • объяснить функцию;
  • найти ошибку;
  • написать unit test;
  • провести refactoring;
  • shell/Python/JavaScript;
  • SQL;
  • Docker/CI;
  • stack trace.

Кодовая специализация не делает её автоматически лучшей для деловых писем и общих офисных задач.


Qwen3.5 4B

Компактный BF16-профиль.

4B BF16 и 8B AWQ нельзя сравнивать только по числу параметров: формат весов, память и профиль потребления среды выполнения различаются.

Меньшая модель в BF16 может требовать сопоставимый объём памяти с большей AWQ-моделью.


Qwen3.5 9B

Сбалансированный BF16-вариант. Он предназначен для более свободного GPU-класса, чем типичная T4 16 ГБ.

Рассматривайте его, если:

  • соответствие положительный;
  • есть достаточный VRAM reserve;
  • нужен современный универсальный profile;
  • 27B избыточна или не помещается.

Qwen3.8 27B

Флагманский универсальный Qwen-профиль текущего локального каталога.

Подходит для:

  • более сложного анализа;
  • серьёзной работы с документами;
  • технических задач;
  • мощного корпоративного помощника.

Естественный аппаратный класс текущей матрицы — около 80 ГБ VRAM и выше, если соответствие подтверждён.

Рабочий целевой контекст может быть порядка 64K.


Qwen3.8 27B FP8

Отдельный развёртывание artifact той же размерной категории.

FP8:

  • уменьшает объём весов;
  • может повысить throughput;
  • требует подходящей современной GPU-архитектуры.

BF16 и FP8 — не одна и та же установка. Model Manager квалифицирует их отдельно.


Qwen3 Coder 30B-A3B

Крупная специализированная модель для программирования.

Полезна, если:

  • много разработчиков;
  • код должен оставаться локально;
  • есть сложные репозитории;
  • используется инфраструктурный код;
  • имеется GPU класса около 80 ГБ.

Не стоит занимать большой GPU кодовой моделью, если подавляющая нагрузка — офисные тексты.


Qwen3 Coder Next

Ещё более крупный coding-профиль. Это не «обязательный апгрейд».

Перед внедрением сравните:

  • качество на вашем коде;
  • latency;
  • throughput;
  • стоимость GPU;
  • стабильность;
  • выигрыш относительно Coder 30B-A3B.

Универсальная Qwen или Coder

Универсальная

Если преобладают:

  • документы;
  • письма;
  • общие вопросы;
  • технические консультации смешанного типа;
  • корпоративные знания.

Coder

Если преобладают:

  • программирование;
  • code review;
  • тесты;
  • конфигурации;
  • DevOps scripts;
  • stack traces.

Смешанная организация

Возьмите 10–20 реальных задач и сравните модели на одинаковом наборе критериев.


Пример T4

Для NVIDIA T4 16 ГБ базовое сравнение логично провести между:

  • Qwen3 8B AWQ;
  • Qwen2.5 Coder 7B AWQ.

Тесты:

  1. деловое письмо;
  2. резюме документа;
  3. Linux log;
  4. Python bug;
  5. SQL;
  6. nginx config;
  7. описание архитектуры;
  8. структурирование документа.

Почему не нужна самая большая Qwen любой ценой

Большая модель может улучшить сложные ответы, но требует:

  • больше VRAM;
  • более дорогой GPU;
  • более долгий cold start;
  • больше диска;
  • возможно меньший throughput;
  • сложнее multi-GPU эксплуатацию.

Для большого числа коротких корпоративных запросов компактная быстрая модель может быть полезнее.


Qwen и приватность

Локальный Qwen вариант весов работает внутри вашей инфраструктуры. Но оценивайте всю цепочку:

Qwen + локальный документ = локальный модельный контур
Qwen + интернет-поиск = локальная генерация + внешний поиск
Qwen + YC сервис = локальная генерация + разрешённый запрос к YC

Лицензии

Основные рабочие варианты Qwen текущего квалифицированного реестра используют Apache-2.0. Новые новые перспективные модели могут иметь другие условия, поэтому лицензия проверяется для конкретного варианта модели, а не для бренда целиком.


Что дальше