Файлы и корпоративные знания¶
ИИ Студия умеет работать не только с тем, что пользователь написал в поле сообщения. Вы можете дать ей документ, исходный код, журнал работы системы, таблицу, инструкцию или целую коллекцию внутренних материалов и задавать вопросы по их содержимому.
Но слово «загрузить файл» скрывает несколько разных способов работы. От выбранного режима зависит, сколько текста увидит модель, как быстро будет обработан документ, можно ли искать по десяткам файлов и появятся ли ссылки на источники.
Эта страница объясняет общую логику. После неё вы сможете правильно выбрать способ работы с документом ещё до загрузки файла.
Главное за минуту¶
В текущей ИИ Студии есть два основных пользовательских режима работы с документами.
| Задача | Что использовать | Что происходит |
|---|---|---|
| Прочитать небольшой документ целиком | Прочитать файл целиком | из файла извлекается текст и передаётся модели в контексте разговора |
| Найти сведения в большом документе или коллекции | Поиск по документам | документ индексируется, а при вопросе в модель передаются только наиболее подходящие фрагменты |
Есть и третий технический подход — передача исходного вложения непосредственно внешнему поставщику модели. Он зависит от конкретного провайдера и мультимодальной модели. В текущей базовой поставке ИИ Студии этот способ не является гарантированным пользовательским режимом: локальный модельный контур и квалифицированные Yandex AI текстовые модели документируются как текстовые сценарии.
Простое правило
Если вам важно, чтобы модель увидела весь небольшой документ, используйте чтение целиком. Если материалов много или документ большой — используйте поиск по документам.
Почему одного способа недостаточно¶
Представим два документа.
Первый — договор на 7 страниц. Пользователь хочет:
«Прочитай договор полностью и перечисли все обязательства сторон».
В этом случае логично передать модели весь извлечённый текст. Документ относительно небольшой, а для ответа важны связи между разными разделами.
Второй — комплект из 60 технических инструкций общей длиной несколько тысяч страниц. Пользователь спрашивает:
«Где описан порядок ротации ключей доступа?»
Передавать в каждый запрос все тысячи страниц невозможно и бессмысленно. Студия сначала находит несколько наиболее относящихся к вопросу фрагментов, а затем передаёт их модели.
Это и есть фундаментальная разница между чтением целиком и поиском по документам.
1. Прочитать файл целиком¶
Этот режим предназначен для разовой работы с документом в текущем разговоре.
Что происходит¶
Упрощённо процесс выглядит так:
Файл пользователя
↓
извлечение текста
↓
очистка и нормализация
↓
текст добавляется в контекст разговора
↓
модель получает вопрос + содержимое файла
↓
ответ
Модель не «открывает файл как человек». Сначала серверная часть Студии извлекает из него текст, после чего этот текст становится частью контекста запроса.
Когда это удобно¶
Используйте чтение целиком, если нужно:
- сделать краткое содержание небольшого документа;
- проверить договор;
- объяснить отдельный регламент;
- сравнить два коротких текста;
- разобрать конфигурационный файл;
- проанализировать небольшой журнал;
- проверить исходный код одного или нескольких небольших файлов;
- переписать или структурировать статью;
- извлечь из документа перечень требований.
Главное ограничение¶
Контекст любой модели конечен.
Даже если сервер способен извлечь очень большой объём текста, это не означает, что модель сможет одновременно использовать его целиком вместе с историей диалога, системными инструкциями и собственным ответом.
Если извлечённого текста слишком много, часть содержимого может не попасть в эффективный контекст. Поэтому для больших материалов используйте поиск по документам.
2. Поиск по документам¶
Поиск по документам нужен, когда материалов больше, чем разумно передавать модели целиком.
Что происходит¶
Упрощённая схема:
Документ
↓
извлечение текста
↓
разделение на фрагменты
↓
создание поискового представления
↓
локальное хранилище знаний
Пользователь задаёт вопрос
↓
Студия ищет подходящие фрагменты
↓
модель получает только найденные фрагменты
↓
ответ + источники
Внутри текущей поставки для этого используется локальный контур индексирования и векторного поиска. Обычному пользователю не нужно знать устройство базы данных: достаточно понимать, что в модель отправляется не весь архив документов, а небольшая релевантная выборка.
Когда это удобно¶
Поиск по документам лучше подходит для:
- больших PDF;
- десятков и сотен внутренних документов;
- технической документации;
- регламентов и политик;
- базы инструкций;
- документации продукта;
- длительно используемого ИИ-помощника;
- корпоративной базы знаний.
3. Прямая передача файла модели¶
Некоторые внешние модели и поставщики умеют принимать PDF, изображения или другие файлы напрямую и разбирать их на стороне поставщика.
Это отдельная технология. Она отличается и от чтения целиком, и от локального поиска по документам.
В базовом документируемом контуре ИИ Студии:
- локальные модели рассматриваются как текстовые модели;
- Yandex AI в текущем квалифицированном профиле используется для текстовых сценариев;
- произвольная передача файла внешнему поставщику не считается универсальной возможностью Студии;
- наличие кнопки или capability базовой платформы само по себе не означает, что конкретная модель прошла квалификацию НайсСофт для такого сценария.
Граница данных
Если в будущей конфигурации администратор включит прямую передачу файла внешнему поставщику, содержимое такого файла покидает локальную VM и обрабатывается внешним сервисом. Это должно быть отдельно отражено в политике организации.
Как выбрать режим¶
Сценарий 1. Договор на 8 страниц¶
Задача:
«Прочитай договор полностью. Выдели обязательства, сроки, штрафы и условия расторжения».
Выбор: прочитать файл целиком.
Почему: для ответа важна общая структура договора, а объём обычно позволяет передать текст модели полностью.
Сценарий 2. Техническое руководство на 900 страниц¶
Задача:
«Как включить журналирование этой службы?»
Выбор: поиск по документу.
Почему: нет смысла помещать все 900 страниц в каждый запрос.
Сценарий 3. 40 внутренних инструкций¶
Задача:
«Как в компании оформляется аварийный доступ?»
Выбор: корпоративная база знаний / поиск по документам.
Почему: система должна сначала определить, в какой инструкции находится ответ.
Сценарий 4. nginx.conf¶
Задача:
«Проверь конфигурацию и укажи потенциальные ошибки».
Выбор: прочитать файл целиком.
Почему: конфигурация обычно компактна, а связи между директивами важны.
Сценарий 5. Журнал на 300 МБ¶
Задача:
«Почему сервис перестал работать вчера в 14:10?»
Не стоит загружать весь журнал как один текстовый файл.
Лучше заранее вырезать интересующий диапазон времени и только затем анализировать его. Поиск по документам тоже не превращает ИИ Студию в специализированную систему анализа многогигабайтных журналов.
Подробнее: Работа с кодом и журналами.
Сценарий 6. Скан договора¶
Если PDF состоит из фотографий страниц и не содержит текстового слоя, обычный локальный parser может извлечь мало текста или ничего.
Текущая базовая поставка использует локальный разбор документов, но не заявляет полноценное распознавание пикселей сканированных документов как гарантированную функцию.
Для такого файла:
- сначала проверьте, выделяется ли текст в PDF;
- если нет — выполните OCR в доверенном инструменте организации;
- загрузите распознанную версию PDF или TXT/DOCX;
- проверьте несколько фрагментов после распознавания.
Подробнее: PDF и DOCX.
Что такое «корпоративная база знаний»¶
Корпоративная база знаний — это не одна огромная системная инструкция и не один чат, в который когда-то загрузили документы.
Это управляемая коллекция материалов, по которой Студия может выполнять смысловой поиск и давать ответы на основании найденных фрагментов.
Хорошая база знаний включает:
- актуальные документы;
- понятные названия файлов;
- владельца каждого набора документов;
- даты или версии;
- правила обновления;
- удаление устаревших редакций;
- тестовые вопросы;
- контроль цитат;
- разграничение доступа.
Подробнее: Корпоративная база знаний.
Что происходит с файлами внутри Студии¶
Для понимания безопасности полезно разделять несколько сущностей.
Исходное вложение¶
Файл, который пользователь передал Студии.
Извлечённый текст¶
Текстовое представление, полученное серверным parser-ом. Именно оно используется при режиме «прочитать целиком».
Индексированные фрагменты¶
Части документа, подготовленные для поиска по документам.
Поисковое представление¶
Числовое представление смысла фрагмента, позволяющее находить похожие по смыслу участки. Технический термин — embedding.
Цитата¶
Ссылка из ответа на найденный фрагмент исходного документа.
Note
История чата, файл, извлечённый текст и поисковый индекс — разные объекты. Удаление одного объекта не следует автоматически считать удалением всех остальных, если интерфейс явно этого не подтверждает. Политики хранения и удаления определяет текущая конфигурация Студии.
Где обрабатываются документы¶
Локальная модель + локальный поиск по документам¶
В этом варианте:
- файл загружается в инфраструктуру Студии;
- извлечение и индексирование выполняются серверными компонентами Студии;
- найденные фрагменты передаются локальной модели;
- содержимое не требуется отправлять внешнему поставщику модели.
Yandex AI¶
Если администратор активировал модель Yandex AI, вопрос, контекст разговора и включённые в модель фрагменты документа передаются в Yandex AI Studio.
Сам индекс документов может оставаться локальным, но выбранные фрагменты, необходимые для ответа, становятся частью запроса к облачной модели.
Это важная граница данных.
Что поиск по документам не делает¶
Поиск по документам не гарантирует, что:
- каждый вопрос будет отвечен правильно;
- нужный фрагмент всегда попадёт в первые результаты;
- устаревший документ автоматически проиграет новой версии;
- таблица будет понята так же точно, как специализированной системой анализа данных;
- изображение внутри PDF будет распознано;
- модель не сделает ошибочный вывод из найденного текста.
Поэтому для критически важных ответов используйте цитаты и открывайте исходный фрагмент.
Как повысить качество работы с документами¶
Формулируйте вопрос конкретно¶
Слабый запрос:
«Что тут написано?»
Лучше:
«На основании приложенного регламента перечисли условия предоставления аварийного доступа. Для каждого условия укажи источник. Если какого-либо условия в документе нет, так и напиши».
Указывайте границы¶
Например:
«Отвечай только по приложенным документам. Не дополняй ответ общими знаниями».
Просите подтверждение источником¶
Например:
«Для каждого вывода покажи документ и относящийся к нему фрагмент».
Разделяйте разные задачи¶
Сначала извлеките факты, затем попросите сделать вывод. Это проще проверить, чем один огромный запрос «проанализируй всё».
Быстрая таблица выбора¶
| Если вам нужно… | Используйте |
|---|---|
| кратко пересказать небольшой документ | чтение целиком |
| проверить небольшой договор | чтение целиком |
| разобрать конфигурацию | чтение целиком |
| проверить небольшой код | чтение целиком |
| найти факт в большом PDF | поиск по документам |
| работать с десятками инструкций | поиск по документам |
| создать знания для ИИ-помощника | поиск по документам |
| работать со сканом без текстового слоя | сначала OCR вне базового parser-а |
| анализировать огромный лог | сначала сократить диапазон данных |
| гарантированно обработать сложную таблицу | подготовить упрощённый CSV/текст или использовать специализированный инструмент |
Что читать дальше¶
Если вы впервые работаете с файлами, идите по порядку:
- Прикрепление файла — загрузка и проверка статуса.
- Прочитать файл целиком — полный текст в контексте.
- Поиск по большим документам — RAG и смысловой поиск.
- Источники и цитаты — проверка ответа.
- Поддерживаемые форматы — что загружать.
- PDF и DOCX — особенности офисных документов.
- Код и журналы — безопасная техническая диагностика.
- Корпоративная база знаний — постоянная коллекция документов.
- Проблемы с файлами — если файл не читается или поиск даёт плохой результат.