Использование контекста¶
У любой модели есть ограниченный объём информации, который она может одновременно учитывать. ИИ Студия показывает заполненность контекста разговора, чтобы пользователь видел, сколько места занимают сообщения, инструкции, файлы и сервисные схемы.
В выпуске 0.3.66 эта функция включена.
Что вы сделаете¶
Вы научитесь:
- понимать индикатор заполненности контекста;
- видеть, какие части разговора занимают место;
- отличать окно контекста от всей истории чата;
- понимать влияние файлов, сервисов и дочерних помощников;
- правильно трактовать показываемую стоимость.
Контекст — не вся история¶
Разговор может храниться в базе годами, но модель не обязана получать весь его текст в каждом запросе.
Упрощённо:
Поэтому два понятия различаются:
История — сохранённые сообщения пользователя и помощника.
Контекст — информация, которую модель получает именно для текущего шага.
Что может занимать контекст¶
В зависимости от режима в индикаторе могут учитываться:
| Категория | Что это |
|---|---|
| Системные инструкции | правила Студии и помощника |
| Сообщения | история текущей ветви разговора |
| Сервисы | схемы доступных операций |
| Отложенные сервисы | операции, которые доступны через поиск, но не загружены полностью |
| Файлы | текст, переданный непосредственно в контекст |
| Сводка | компактное представление старой части длинного разговора |
| Дочерние помощники | данные, необходимые для координации многопомощниковой работы |
Почему контекст заполняется¶
Чем больше вы добавляете:
- длинных сообщений;
- больших файлов в режиме чтения целиком;
- подробных инструкций;
- постоянно загруженных сервисных схем;
- длинных результатов операций;
тем меньше места остаётся для новых сообщений и ответа.
Что происходит при длинном разговоре¶
Студия и модельный маршрут могут использовать сокращение старой части разговора, чтобы продолжать работу в пределах окна модели.
Это означает, что очень старые детали могут быть представлены не дословно, а через сводку.
Если конкретная формулировка критична, лучше:
- повторить её в новом сообщении;
- вынести устойчивое правило в инструкции помощника;
- поместить факты в документ/базу знаний;
- сохранить устойчивое предпочтение в памяти, если это действительно память.
Контекст локальной модели¶
Размер окна зависит от реально активной модели и её рабочего профиля.
Например, модель может теоретически поддерживать большое окно, но Студия использовать более консервативный рабочий предел для устойчивости на выбранной GPU.
Смотрите фактическое значение в карточке активной модели и в разделе управления моделями.
Контекст Yandex AI¶
Для Yandex AI размер окна определяется выбранной управляемой моделью.
Важно понимать и границу данных:
всё, что попало в рабочий контекст облачной модели, передаётся в Yandex AI для выполнения запроса.
Локальная индексация документа сама по себе не отменяет этого: найденный RAG-фрагмент может стать частью облачного контекста.
Почему отложенные сервисы полезны¶
Если помощнику доступно много сервисных операций, полные описания каждой операции могут занимать значительную часть контекста.
Студия поддерживает отложенную загрузку:
много доступных операций
↓
в контексте только механизм поиска
↓
помощник находит нужную операцию
↓
загружает её описание по требованию
Подробнее: Отложенная загрузка сервисов.
Стоимость в индикаторе¶
В 0.3.66 интерфейс также включает отображение стоимости контекста.
Не используйте эту цифру как бухгалтерский источник
Маршрут nicesoft-active может указывать на локальную модель или на Yandex AI. Показатель интерфейса — техническая оценка учёта токенов, а не официальный счёт Яндекс Облака и не FinOps-отчёт.
Для финансового анализа Яндекс Облака используйте:
- Расходы и финансовый анализ;
- фактический Billing Account;
- данные FinOps Студии.
Для локальной модели денежная цифра вообще не отражает реальную себестоимость электроэнергии, GPU, ВМ и эксплуатации.
Как уменьшить расход контекста¶
Если индикатор приближается к пределу:
- начните новый разговор с короткой сводкой принятого решения;
- используйте поиск по файлам вместо передачи большого документа целиком;
- уберите ненужные сервисы у помощника;
- включайте отложенную загрузку крупных наборов операций;
- не вставляйте повторно длинные журналы без необходимости;
- для подзадач используйте дочерних помощников, если это уместно.
Дочерний помощник и контекст¶
Дочерний помощник получает своё изолированное окно контекста.
Он может выполнить длинную исследовательскую или сервисную подзадачу, а главному помощнику вернуть компактный результат.
Это одна из причин использовать дочерних помощников для длинных промежуточных операций.
Подробнее: Дочерние помощники.
Что не нужно делать¶
Не удаляйте важные сообщения только ради «красивого процента» индикатора.
Не пытайтесь вручную считать токены по количеству символов: разные модели используют разные токенизаторы, а в контексте есть служебные данные, которые не видны как обычный текст.
Как проверить результат¶
Откройте длинный разговор и найдите индикатор контекста.
Проверьте:
- текущую заполненность;
- подробную разбивку;
- изменение после большого сообщения или файла;
- изменение после нового хода;
- отсутствие путаницы между технической стоимостью и FinOps.
Частые вопросы¶
Почему разговор короткий, а контекст уже большой?¶
Помощник может иметь длинные инструкции, файлы и множество доступных сервисных операций.
Почему число изменилось после повторного открытия разговора?¶
Студия восстанавливает сохранённые данные использования и может учитывать уже сформированную сводку длинного контекста.
Почему дочерний помощник тоже расходует токены?¶
У него отдельный модельный запуск. Его использование относится к общей работе родительского помощника.
Почему стоимость не совпадает с Яндекс Облаком?¶
Потому что это разные системы учёта. Официальные расходы берутся из Billing/FinOps.