Перейти к содержанию

Использование контекста

У любой модели есть ограниченный объём информации, который она может одновременно учитывать. ИИ Студия показывает заполненность контекста разговора, чтобы пользователь видел, сколько места занимают сообщения, инструкции, файлы и сервисные схемы.

В выпуске 0.3.66 эта функция включена.


Что вы сделаете

Вы научитесь:

  • понимать индикатор заполненности контекста;
  • видеть, какие части разговора занимают место;
  • отличать окно контекста от всей истории чата;
  • понимать влияние файлов, сервисов и дочерних помощников;
  • правильно трактовать показываемую стоимость.

Контекст — не вся история

Разговор может храниться в базе годами, но модель не обязана получать весь его текст в каждом запросе.

Упрощённо:

история разговора
подготовка рабочего контекста
ограниченное окно модели
ответ

Поэтому два понятия различаются:

История — сохранённые сообщения пользователя и помощника.

Контекст — информация, которую модель получает именно для текущего шага.


Что может занимать контекст

В зависимости от режима в индикаторе могут учитываться:

Категория Что это
Системные инструкции правила Студии и помощника
Сообщения история текущей ветви разговора
Сервисы схемы доступных операций
Отложенные сервисы операции, которые доступны через поиск, но не загружены полностью
Файлы текст, переданный непосредственно в контекст
Сводка компактное представление старой части длинного разговора
Дочерние помощники данные, необходимые для координации многопомощниковой работы

Почему контекст заполняется

Чем больше вы добавляете:

  • длинных сообщений;
  • больших файлов в режиме чтения целиком;
  • подробных инструкций;
  • постоянно загруженных сервисных схем;
  • длинных результатов операций;

тем меньше места остаётся для новых сообщений и ответа.


Что происходит при длинном разговоре

Студия и модельный маршрут могут использовать сокращение старой части разговора, чтобы продолжать работу в пределах окна модели.

Это означает, что очень старые детали могут быть представлены не дословно, а через сводку.

Если конкретная формулировка критична, лучше:

  • повторить её в новом сообщении;
  • вынести устойчивое правило в инструкции помощника;
  • поместить факты в документ/базу знаний;
  • сохранить устойчивое предпочтение в памяти, если это действительно память.

Контекст локальной модели

Размер окна зависит от реально активной модели и её рабочего профиля.

Например, модель может теоретически поддерживать большое окно, но Студия использовать более консервативный рабочий предел для устойчивости на выбранной GPU.

Смотрите фактическое значение в карточке активной модели и в разделе управления моделями.


Контекст Yandex AI

Для Yandex AI размер окна определяется выбранной управляемой моделью.

Важно понимать и границу данных:

всё, что попало в рабочий контекст облачной модели, передаётся в Yandex AI для выполнения запроса.

Локальная индексация документа сама по себе не отменяет этого: найденный RAG-фрагмент может стать частью облачного контекста.


Почему отложенные сервисы полезны

Если помощнику доступно много сервисных операций, полные описания каждой операции могут занимать значительную часть контекста.

Студия поддерживает отложенную загрузку:

много доступных операций
в контексте только механизм поиска
помощник находит нужную операцию
загружает её описание по требованию

Подробнее: Отложенная загрузка сервисов.


Стоимость в индикаторе

В 0.3.66 интерфейс также включает отображение стоимости контекста.

Не используйте эту цифру как бухгалтерский источник

Маршрут nicesoft-active может указывать на локальную модель или на Yandex AI. Показатель интерфейса — техническая оценка учёта токенов, а не официальный счёт Яндекс Облака и не FinOps-отчёт.

Для финансового анализа Яндекс Облака используйте:

Для локальной модели денежная цифра вообще не отражает реальную себестоимость электроэнергии, GPU, ВМ и эксплуатации.


Как уменьшить расход контекста

Если индикатор приближается к пределу:

  1. начните новый разговор с короткой сводкой принятого решения;
  2. используйте поиск по файлам вместо передачи большого документа целиком;
  3. уберите ненужные сервисы у помощника;
  4. включайте отложенную загрузку крупных наборов операций;
  5. не вставляйте повторно длинные журналы без необходимости;
  6. для подзадач используйте дочерних помощников, если это уместно.

Дочерний помощник и контекст

Дочерний помощник получает своё изолированное окно контекста.

Он может выполнить длинную исследовательскую или сервисную подзадачу, а главному помощнику вернуть компактный результат.

Это одна из причин использовать дочерних помощников для длинных промежуточных операций.

Подробнее: Дочерние помощники.


Что не нужно делать

Не удаляйте важные сообщения только ради «красивого процента» индикатора.

Не пытайтесь вручную считать токены по количеству символов: разные модели используют разные токенизаторы, а в контексте есть служебные данные, которые не видны как обычный текст.


Как проверить результат

Откройте длинный разговор и найдите индикатор контекста.

Проверьте:

  1. текущую заполненность;
  2. подробную разбивку;
  3. изменение после большого сообщения или файла;
  4. изменение после нового хода;
  5. отсутствие путаницы между технической стоимостью и FinOps.

Частые вопросы

Почему разговор короткий, а контекст уже большой?

Помощник может иметь длинные инструкции, файлы и множество доступных сервисных операций.

Почему число изменилось после повторного открытия разговора?

Студия восстанавливает сохранённые данные использования и может учитывать уже сформированную сводку длинного контекста.

Почему дочерний помощник тоже расходует токены?

У него отдельный модельный запуск. Его использование относится к общей работе родительского помощника.

Почему стоимость не совпадает с Яндекс Облаком?

Потому что это разные системы учёта. Официальные расходы берутся из Billing/FinOps.


Что дальше