Перейти к содержанию

Как выбрать модель под задачу

Правильный вопрос — не «какая модель самая умная?», а:

Какая модель даёт достаточное качество для нашей задачи, на нашем железе, с приемлемой скоростью, стоимостью и границей данных?


Шаг 1. Сначала определите границу данных

До сравнения качества ответьте:

Можно ли передавать содержимое этой задачи внешнему облачному ИИ?

Нельзя

Рассматривайте только локальные модели и разрешённые локальные источники.

Можно

Можно сравнивать локальные модели и Yandex AI.

Это первый фильтр, а не последний.


Шаг 2. Определите тип нагрузки

Задача С чего начать
Письма, тексты, общие вопросы General recommendation
Код на T4 Qwen2.5 Coder 7B AWQ
Универсальный чат на T4 Qwen3 8B AWQ
Сложный локальный анализ на 80 ГБ Qwen3.8 27B class
Серьёзное программирование на большом GPU Qwen3 Coder class
Длинный контекст Long Context recommendation
Агентные сценарии Agentic recommendation
Быстрая облачная массовая обработка Alice AI LLM Flash / YandexGPT Lite
Сильный универсальный Yandex AI Alice AI LLM / YandexGPT Pro 5.1

Это стартовые ориентиры, а не абсолютный рейтинг.


Обычный корпоративный помощник

Типовые задачи:

  • письма;
  • резюме;
  • инструкции;
  • общие вопросы;
  • документы;
  • технические объяснения среднего уровня.

T4 16 ГБ

Начните с Qwen3 8B AWQ.

Большой GPU

Сравните General recommendation более высокого класса, например Qwen3.8 27B, с компактным baseline.

Облако разрешено

Добавьте Alice AI LLM и/или YandexGPT Pro 5.1 в тестовый набор.

Не делайте вывод по одному вопросу.


Программисты

Используйте реальные задачи команды:

  • bug fix;
  • unit tests;
  • refactoring;
  • SQL;
  • CI;
  • Docker;
  • code review;
  • старый код.

Компактный GPU

Qwen2.5 Coder 7B AWQ — логичный coding baseline.

80 ГБ class

Сравните Qwen3 Coder 30B-A3B с универсальной Qwen3.8 27B.

Очень крупный GPU

Coder Next рассматривайте только после доказанного выигрыша на вашем коде.


Системный администратор / DevOps

Задачи смешанные:

  • журналы;
  • конфигурации;
  • Bash/Python;
  • Linux;
  • сеть;
  • Docker/Kubernetes;
  • документация;
  • объяснение рисков.

Чистая coding-модель не всегда выигрывает. Сравните универсальную и кодовую модели, а при разрешённом облаке — Pro/Flagship Яндекса.

Оценивайте не только правильность команды, но и объяснение последствий.


Документы и корпоративная база знаний

Критерии качества:

  • модель опирается на найденный контекст;
  • не выдумывает отсутствующие факты;
  • корректно следует цитатам;
  • хорошо пишет по-русски;
  • умеет сказать «в документе этого нет».

Для RAG дисциплина по источникам часто важнее максимального размера модели.


Длинный контекст

Не выбирайте модель только по рекламе «128K context».

Проверьте:

  • рабочий целевой контекст;
  • VRAM при этом контексте;
  • prefill latency;
  • время до первого токена;
  • качество поиска факта в длинном тексте;
  • устойчивость при параллельных запросах.

Много коротких запросов

Если важен throughput:

  • компактная локальная модель может быть выгоднее большой;
  • FP8 на подходящем GPU может дать преимущество;
  • в Yandex AI Flash/Lite могут быть экономичнее Pro.

Смотрите не только качество единичного ответа, но:

  • запросов в минуту;
  • p95 latency;
  • время до первого токена;
  • стоимость 1000 реальных запросов;
  • долю ручных исправлений.

Чувствительные документы

Если политика запрещает внешнюю обработку:

  1. активная модель должна быть локальной;
  2. интернет-поиск выключен, если отдельно не разрешён;
  3. внешние сервисы не используются;
  4. документ обрабатывается локальным файловым/RAG-контуром;
  5. пользователь проверяет фактическую модель ответа.

Облачная модель в такой shortlist не включается независимо от качества.


Нет мощного собственного GPU

Если облачная обработка разрешена, Yandex AI может быть эксплуатационно проще:

  • не нужно скачивать веса;
  • не нужно держать мощный GPU постоянно;
  • проще нерегулярная нагрузка.

Но появляются:

  • стоимость по использованию;
  • внешняя граница данных;
  • зависимость от облачного API;
  • IAM/Billing.

Сравнивайте полную стоимость владения.


Упрощённая матрица

Вариант Граница модельного запроса Инфраструктура Переменная стоимость
Локальная компактная внутри контура собственный GPU внутренняя
Локальная крупная внутри контура дорогой GPU/multi-GPU внутренняя
Yandex AI Lite/Flash облачная GPU не нужен по использованию
Yandex AI Pro/Flagship облачная GPU не нужен по использованию, обычно выше

Это схема принятия решения, а не бухгалтерский расчёт.


Как провести честный тест моделей

1. Соберите 20–50 реальных задач

Разделите на категории:

  • офис;
  • документы;
  • код;
  • администрирование;
  • анализ;
  • специализированные.

2. Подготовьте критерии

Для части задач заранее определите правильный ответ или обязательные элементы.

3. Используйте одинаковый запрос

Не улучшайте запрос для одной модели и не ухудшайте для другой.

4. Оценивайте вслепую

Если возможно, скрывайте название модели от эксперта.

5. Считайте больше, чем «понравилось»

Фиксируйте:

  • корректность;
  • полноту;
  • галлюцинации;
  • latency;
  • throughput;
  • VRAM;
  • стоимость;
  • ручные исправления.

6. Проведите нагрузочный тест

Модель, отличная для одного пользователя, может оказаться плохой для 50.

7. Зафиксируйте решение

Запишите:

  • модель/вариант весов;
  • hardware profile;
  • workload;
  • причину выбора;
  • дату теста;
  • дату следующего пересмотра.

Не смешивайте качество модели и RAG

Плохой ответ по документу может быть вызван:

  • ошибкой parsing;
  • плохим chunking;
  • неправильным retrieval;
  • устаревшим документом;
  • неверной областью поиска.

Перед заменой модели проверьте, какие источники ей реально передали.


Не смешивайте модель и качество запроса

Проверь конфиг и

Проверь nginx-конфиг на синтаксис, безопасность и риск недоступности. Для каждого замечания укажи фрагмент и исправление.

создают разные условия. Сначала стандартизируйте рабочие запросы.


Не выбирайте по бренду

«Qwen лучше Mistral» или «Alice лучше Qwen» — слишком широкие фразы. Внутри одного производителя есть компактные, кодовые, flash, long-context и flagship-модели.

Сравнивайте конкретный artifact на конкретной задаче.


Рекомендованный путь администратора

Если не знаете, с чего начать:

  1. возьмите General recommendation Model Manager;
  2. проведите реальный тест;
  3. отдельно протестируйте Coding recommendation;
  4. только затем рассматривайте более тяжёлые модели;
  5. Yandex AI включайте как осознанный внешний профиль;
  6. документируйте решение.

Что дальше