Проблемы с файлами и поиском по документам¶
Эта страница построена по симптомам. Сначала найдите, что именно видит пользователь, затем выполняйте проверки по порядку.
Не начинайте диагностику со смены модели: большинство проблем с документами возникает до этапа генерации ответа — при загрузке, извлечении текста, индексировании или retrieval.
Быстрая схема диагностики¶
Файл принят сервером?
├─ нет → размер / MIME / права / сеть
└─ да
↓
Текст извлечён?
├─ нет → формат / скан / parser
└─ да
↓
File Search проиндексировал документ?
├─ нет → RAG service / embedding / vector DB
└─ да
↓
Правильный фрагмент находится?
├─ нет → запрос / версия / chunking / дубли
└─ да
↓
Модель правильно его интерпретирует?
├─ нет → prompt / модель / контекст
└─ да → исправно
Файл не прикрепляется¶
Симптом¶
После выбора файл не появляется или интерфейс сообщает об ошибке.
Проверьте¶
- размер файла;
- тип файла;
- суммарный размер выбранных файлов;
- число файлов;
- сетевое соединение;
- наличие прав на загрузку;
- не истекла ли сессия пользователя.
Что делать¶
Попробуйте маленький TXT-файл. Если TXT загружается, проблема специфична для исходного файла или формата.
«Неподдерживаемый тип файла»¶
Расширение и MIME могут отличаться.
Не переименовывайте файл искусственно.
Проверьте реальный тип локально:
На НАЙС.ОС/Linux это поможет понять, что именно видит серверная логика.
Если MIME корректен, но тип запрещён, обратитесь к администратору — allowlist может быть ограничена политикой.
Файл слишком большой¶
Что делать¶
Для документа:
- используйте File Search;
- разделите по разделам;
- удалите приложения, не относящиеся к задаче.
Для лога:
- ограничьте временной диапазон;
- фильтруйте по компоненту/ID.
Для CSV:
- оставьте нужные столбцы;
- подготовьте выборку строк.
Не архивируйте файл в ZIP только ради обхода лимита.
Файл загрузился, но модель его «не видит»¶
Сначала определите режим.
Если читали целиком¶
Попросите назвать уникальную строку из файла.
Если не может:
- текст мог не извлечься;
- контекст мог быть обрезан;
- файл мог не прикрепиться к отправленному сообщению;
- длинная история могла вытеснить часть текста.
Если использовали File Search¶
Попросите сначала найти источник без итогового ответа.
Если источник не находится — проблема retrieval, а не модели.
PDF даёт пустой текст¶
Вероятный сценарий — скан.
Проверка:
- откройте PDF;
- попробуйте выделить текст;
- выполните поиск внутри PDF.
Если текстового слоя нет, выполните OCR вне текущего базового parser-а.
PDF даёт бессмысленный порядок абзацев¶
Причина часто в:
- нескольких колонках;
- сложной вёрстке;
- плавающих блоках;
- таблицах;
- нестандартных шрифтах.
Решение:
- подготовить чистую текстовую версию;
- разделить документ;
- использовать File Search с проверкой цитат;
- пересохранить PDF.
DOCX теряет часть структуры¶
Проверьте, где находится информация.
Если она в:
- SmartArt;
- изображении;
- комментарии;
- track changes;
- header/footer;
parser может не передать её как обычный текст.
Для критичной задачи экспортируйте нужное содержимое в обычный текст или PDF с текстовым слоем.
Таблица выглядит «сломанной»¶
Текстовый parser может потерять сетку.
Решение:
- экспортировать нужный лист/таблицу в CSV;
- сохранить заголовки;
- убрать объединённые ячейки;
- объяснить колонки в запросе.
Код читается, но номера строк не совпадают¶
Parser мог нормализовать текст.
Для точного патча:
- укажите commit;
- добавьте номера строк вручную;
- сверяйте изменение в IDE/diff.
Лог читается, но причина определяется неправильно¶
Возможно, в фрагменте присутствуют только ошибки-следствия.
Расширьте окно времени назад.
Попросите:
«Найди самую раннюю ошибку в хронологии и отдели её от последующих повторных ошибок».
Если есть request ID, соберите все строки по нему.
File Search долго индексирует¶
Для большого документа это может быть нормально, но бесконечное состояние требует проверки.
Пользователь может:
- не загружать повторно тот же файл;
- подождать разумное время;
- обновить интерфейс;
- попробовать маленький TXT;
- сообщить администратору имя файла и время загрузки.
Администратор должен проверить RAG API и vector DB.
File Search не находит очевидную фразу¶
Используйте точный тест.
Возьмите уникальное предложение из документа и спросите о нём.
Если даже оно не находится:
- файл мог не индексироваться;
- parser мог не извлечь эту часть;
- используется не та коллекция;
- нет доступа к файлу;
- индекс повреждён/недоступен.
File Search находит нерелевантный раздел¶
Попробуйте:
- сделать вопрос конкретнее;
- добавить термин из документа;
- указать имя файла;
- попросить 3 источника без ответа;
- проверить дубли и версии.
Если релевантный фрагмент есть, но ранжируется ниже мусора, база нуждается в редакционной очистке.
Возвращается старая версия документа¶
Это почти всегда проблема управления знаниями.
Действия:
- найдите все версии;
- определите действующую;
- удалите старую из активной коллекции;
- переиндексируйте/обновите знания;
- повторите тестовый вопрос.
В ответе нет цитат¶
Проверьте:
- использовался ли File Search;
- разрешены ли citations для роли;
- найден ли источник;
- не отвечает ли модель из предыдущей истории;
- не был ли файл загружен только как полный текст.
Попросите:
«Повторно выполни поиск по документам и покажи источники до итогового ответа».
Цитата не подтверждает ответ¶
Это уже не проблема индексации — источник найден, но модель неверно интерпретировала его.
Попросите:
«Отдели дословный факт из источника от своей интерпретации. Пересмотри вывод».
Для критичного решения привлеките человека-эксперта.
Модель выдумывает факт, которого нет в документах¶
Используйте более строгую инструкцию:
«Отвечай только на основании найденных документов. Если подтверждающего фрагмента нет, пиши “не найдено в доступных источниках”. Не дополняй корпоративное правило общими знаниями».
Для постоянного помощника добавьте это в его системные инструкции.
Ответ обрезан или теряется конец документа¶
Если файл загружен целиком, вы достигли контекстного ограничения.
Решение:
- новый чат;
- меньший файл;
- File Search;
- меньше старой истории.
После переключения на Yandex AI документ «внезапно стал внешним»¶
Сам индекс может оставаться локальным, но найденные фрагменты теперь передаются облачной модели.
Это не ошибка — это изменение trust boundary.
Если данные не должны покидать инфраструктуру, администратор должен вернуть локальную модель до работы с такими документами.
После переключения модели ответ стал хуже¶
Разные модели по-разному работают с RAG-контекстом.
Проверьте один и тот же набор тестовых вопросов.
Не меняйте сразу chunking и модель одновременно — иначе не поймёте причину.
Ошибка после обновления Студии¶
Зафиксируйте:
- версию до обновления;
- версию после;
- формат файла;
- режим обработки;
- время ошибки;
- пользователя/роль без раскрытия секретов;
- воспроизводится ли на маленьком TXT.
Это позволит отличить проблему интерфейса от RAG API.
Что проверить администратору¶
Пользовательская часть заканчивается на воспроизводимом симптоме. Администратор дополнительно проверяет:
- состояние
rag-api; - состояние
vectordb; - доступность API;
- журналы индексации;
- дисковое пространство;
- настройки fileConfig;
- права пользователя;
- состояние базы данных;
- ошибки extraction/embedding.
Подробности будут в разделе Администратору → Файлы и база знаний.
Минимальный диагностический тест¶
Создайте файл rag-test.txt:
Тест чтения целиком¶
Спросите:
«Какая контрольная фраза указана в файле?»
Ожидается:
СИНИЙ-КЕДР-94721
Тест File Search¶
Проиндексируйте тот же файл и спросите:
«Каков срок тестового хранения? Покажи источник».
Ожидается:
37 дней + источник rag-test.txt.
Если первый тест проходит, а второй нет — parser работает, проблема находится в RAG/indexing/retrieval.
Что приложить в обращение поддержки¶
Не отправляйте секреты.
Полезны:
- версия ИИ Студии;
- имя и тип тестового файла;
- размер;
- режим загрузки;
- точное время;
- текст ошибки;
- скриншот статуса;
- результат
rag-test.txt; - воспроизводится ли проблема у другого пользователя;
- воспроизводится ли на локальной модели.
Как проверить исправление¶
После изменения не проверяйте только старым вопросом.
Выполните:
- тест
rag-test.txt; - реальный документ;
- положительный вопрос;
- отрицательный вопрос;
- проверку цитаты;
- проверку пользователем с обычной ролью.