Как выбрать модель под задачу¶
Правильный вопрос — не «какая модель самая умная?», а:
Какая модель даёт достаточное качество для нашей задачи, на нашем железе, с приемлемой скоростью, стоимостью и границей данных?
Шаг 1. Сначала определите границу данных¶
До сравнения качества ответьте:
Можно ли передавать содержимое этой задачи внешнему облачному ИИ?
Нельзя¶
Рассматривайте только локальные модели и разрешённые локальные источники.
Можно¶
Можно сравнивать локальные модели и Yandex AI.
Это первый фильтр, а не последний.
Шаг 2. Определите тип нагрузки¶
| Задача | С чего начать |
|---|---|
| Письма, тексты, общие вопросы | General recommendation |
| Код на T4 | Qwen2.5 Coder 7B AWQ |
| Универсальный чат на T4 | Qwen3 8B AWQ |
| Сложный локальный анализ на 80 ГБ | Qwen3.8 27B class |
| Серьёзное программирование на большом GPU | Qwen3 Coder class |
| Длинный контекст | Long Context recommendation |
| Агентные сценарии | Agentic recommendation |
| Быстрая облачная массовая обработка | Alice AI LLM Flash / YandexGPT Lite |
| Сильный универсальный Yandex AI | Alice AI LLM / YandexGPT Pro 5.1 |
Это стартовые ориентиры, а не абсолютный рейтинг.
Обычный корпоративный помощник¶
Типовые задачи:
- письма;
- резюме;
- инструкции;
- общие вопросы;
- документы;
- технические объяснения среднего уровня.
T4 16 ГБ¶
Начните с Qwen3 8B AWQ.
Большой GPU¶
Сравните General recommendation более высокого класса, например Qwen3.8 27B, с компактным baseline.
Облако разрешено¶
Добавьте Alice AI LLM и/или YandexGPT Pro 5.1 в тестовый набор.
Не делайте вывод по одному вопросу.
Программисты¶
Используйте реальные задачи команды:
- bug fix;
- unit tests;
- refactoring;
- SQL;
- CI;
- Docker;
- code review;
- старый код.
Компактный GPU¶
Qwen2.5 Coder 7B AWQ — логичный coding baseline.
80 ГБ class¶
Сравните Qwen3 Coder 30B-A3B с универсальной Qwen3.8 27B.
Очень крупный GPU¶
Coder Next рассматривайте только после доказанного выигрыша на вашем коде.
Системный администратор / DevOps¶
Задачи смешанные:
- журналы;
- конфигурации;
- Bash/Python;
- Linux;
- сеть;
- Docker/Kubernetes;
- документация;
- объяснение рисков.
Чистая coding-модель не всегда выигрывает. Сравните универсальную и кодовую модели, а при разрешённом облаке — Pro/Flagship Яндекса.
Оценивайте не только правильность команды, но и объяснение последствий.
Документы и корпоративная база знаний¶
Критерии качества:
- модель опирается на найденный контекст;
- не выдумывает отсутствующие факты;
- корректно следует цитатам;
- хорошо пишет по-русски;
- умеет сказать «в документе этого нет».
Для RAG дисциплина по источникам часто важнее максимального размера модели.
Длинный контекст¶
Не выбирайте модель только по рекламе «128K context».
Проверьте:
- рабочий целевой контекст;
- VRAM при этом контексте;
- prefill latency;
- время до первого токена;
- качество поиска факта в длинном тексте;
- устойчивость при параллельных запросах.
Много коротких запросов¶
Если важен throughput:
- компактная локальная модель может быть выгоднее большой;
- FP8 на подходящем GPU может дать преимущество;
- в Yandex AI Flash/Lite могут быть экономичнее Pro.
Смотрите не только качество единичного ответа, но:
- запросов в минуту;
- p95 latency;
- время до первого токена;
- стоимость 1000 реальных запросов;
- долю ручных исправлений.
Чувствительные документы¶
Если политика запрещает внешнюю обработку:
- активная модель должна быть локальной;
- интернет-поиск выключен, если отдельно не разрешён;
- внешние сервисы не используются;
- документ обрабатывается локальным файловым/RAG-контуром;
- пользователь проверяет фактическую модель ответа.
Облачная модель в такой shortlist не включается независимо от качества.
Нет мощного собственного GPU¶
Если облачная обработка разрешена, Yandex AI может быть эксплуатационно проще:
- не нужно скачивать веса;
- не нужно держать мощный GPU постоянно;
- проще нерегулярная нагрузка.
Но появляются:
- стоимость по использованию;
- внешняя граница данных;
- зависимость от облачного API;
- IAM/Billing.
Сравнивайте полную стоимость владения.
Упрощённая матрица¶
| Вариант | Граница модельного запроса | Инфраструктура | Переменная стоимость |
|---|---|---|---|
| Локальная компактная | внутри контура | собственный GPU | внутренняя |
| Локальная крупная | внутри контура | дорогой GPU/multi-GPU | внутренняя |
| Yandex AI Lite/Flash | облачная | GPU не нужен | по использованию |
| Yandex AI Pro/Flagship | облачная | GPU не нужен | по использованию, обычно выше |
Это схема принятия решения, а не бухгалтерский расчёт.
Как провести честный тест моделей¶
1. Соберите 20–50 реальных задач¶
Разделите на категории:
- офис;
- документы;
- код;
- администрирование;
- анализ;
- специализированные.
2. Подготовьте критерии¶
Для части задач заранее определите правильный ответ или обязательные элементы.
3. Используйте одинаковый запрос¶
Не улучшайте запрос для одной модели и не ухудшайте для другой.
4. Оценивайте вслепую¶
Если возможно, скрывайте название модели от эксперта.
5. Считайте больше, чем «понравилось»¶
Фиксируйте:
- корректность;
- полноту;
- галлюцинации;
- latency;
- throughput;
- VRAM;
- стоимость;
- ручные исправления.
6. Проведите нагрузочный тест¶
Модель, отличная для одного пользователя, может оказаться плохой для 50.
7. Зафиксируйте решение¶
Запишите:
- модель/вариант весов;
- hardware profile;
- workload;
- причину выбора;
- дату теста;
- дату следующего пересмотра.
Не смешивайте качество модели и RAG¶
Плохой ответ по документу может быть вызван:
- ошибкой parsing;
- плохим chunking;
- неправильным retrieval;
- устаревшим документом;
- неверной областью поиска.
Перед заменой модели проверьте, какие источники ей реально передали.
Не смешивайте модель и качество запроса¶
Проверь конфиг и
Проверь nginx-конфиг на синтаксис, безопасность и риск недоступности. Для каждого замечания укажи фрагмент и исправление.
создают разные условия. Сначала стандартизируйте рабочие запросы.
Не выбирайте по бренду¶
«Qwen лучше Mistral» или «Alice лучше Qwen» — слишком широкие фразы. Внутри одного производителя есть компактные, кодовые, flash, long-context и flagship-модели.
Сравнивайте конкретный artifact на конкретной задаче.
Рекомендованный путь администратора¶
Если не знаете, с чего начать:
- возьмите General recommendation Model Manager;
- проведите реальный тест;
- отдельно протестируйте Coding recommendation;
- только затем рассматривайте более тяжёлые модели;
- Yandex AI включайте как осознанный внешний профиль;
- документируйте решение.