Перейти к содержанию

Работа с PDF и DOCX

PDF и DOCX — самые частые корпоративные форматы. Именно с ними чаще всего возникает ложное ожидание, что ИИ «видит страницу так же, как человек».

В базовом сценарии ИИ Студия работает прежде всего с извлечённым текстом документа.


PDF: сначала определите тип

Цифровой PDF

Создан программой и содержит текстовый слой.

Примеры:

  • экспорт из Word;
  • отчёт из ERP;
  • документация с сайта;
  • электронный договор.

Такой PDF обычно подходит для чтения целиком и File Search.

Сканированный PDF

Содержит изображения страниц.

Примеры:

  • бумажный договор после сканера;
  • фото документа, собранные в PDF;
  • архив старых приказов.

Для него нужен OCR.


Как отличить скан от цифрового PDF

Откройте документ в обычном просмотрщике.

Попробуйте:

  1. выделить отдельное слово;
  2. скопировать абзац;
  3. выполнить поиск Ctrl+F по видимому слову.

Если ничего не работает, скорее всего текстового слоя нет.


Текущий OCR-профиль Студии

В текущей базовой поставке используется локальный документный parser.

Он хорошо подходит для извлечения существующего текста, но не должен документироваться как полноценное распознавание текста по пикселям.

Поэтому для скана:

  1. выполните OCR в одобренном организацией решении;
  2. сохраните распознанный текстовый слой;
  3. проверьте несколько страниц;
  4. загрузите результат в Студию.

Warning

Не загружайте скан и не делайте вывод «ИИ прочитал документ» только потому, что файл принят сервером. Приём файла и успешное распознавание — разные события.


PDF с несколькими колонками

На странице может визуально быть:

Колонка A          Колонка B
абзац 1            абзац 4
абзац 2            абзац 5
абзац 3            абзац 6

Parser иногда получает порядок:

абзац 1
абзац 4
абзац 2
абзац 5
...

Это может ухудшить смысл.

Если документ критичный:

  • проверьте извлечённый фрагмент;
  • задавайте вопросы по конкретным разделам;
  • используйте цитаты;
  • при необходимости подготовьте упрощённую текстовую версию.

Таблицы в PDF

Таблица визуально содержит строки и столбцы. После извлечения текста границы могут стать менее очевидными.

Для простой таблицы результат может быть достаточным.

Для сложной финансовой таблицы не полагайтесь на модель без проверки.

Лучший вариант:

  1. экспортировать нужную таблицу в CSV;
  2. сохранить заголовки;
  3. загрузить CSV отдельно;
  4. объяснить смысл колонок.

Графики и диаграммы в PDF

Текстовые подписи могут извлечься, но это не означает, что Студия понимает геометрию графика.

В текущем text-only профиле не следует просить:

«По графику определи точное значение синей линии в точке X».

Если информация важна, подготовьте табличные данные или текстовое описание.


Подписи, печати и рукописные пометки

Они являются визуальными объектами.

Базовый текстовый parser не гарантирует их чтение.

Нельзя использовать ИИ Студию как средство экспертизы подписи или печати.


Защищённый PDF

Файл может иметь:

  • пароль на открытие;
  • запрет копирования;
  • нестандартное шифрование;
  • повреждённую структуру.

Если parser не может получить содержимое, подготовьте разрешённую для анализа копию в соответствии с политикой организации.

Не передавайте пароль в общий чат без необходимости.


DOCX: что модель получает на самом деле

DOCX — архив структурированных XML-файлов. Parser извлекает из него содержательное текстовое представление.

Обычно хорошо сохраняются:

  • заголовки;
  • параграфы;
  • списки;
  • большая часть текста таблиц;
  • порядок основных разделов.

Что может потеряться в DOCX

Не рассчитывайте на точную передачу:

  • координат объектов;
  • плавающих изображений;
  • SmartArt;
  • формул как визуальных объектов;
  • колонтитулов во всех parser-профилях;
  • комментариев;
  • истории правок;
  • track changes;
  • цвета как смыслового признака;
  • водяных знаков;
  • номера страницы Word.

Если задача зависит от этого, проверяйте оригинал вручную.


Сравнение двух DOCX

Хороший сценарий:

«Сравни содержательные формулировки двух версий договора. Игнорируй оформление. Покажи: раздел, старая формулировка, новая формулировка, практическое изменение».

Плохой сценарий:

«Определи все изменения форматирования до пикселя».

Для второго нужен специализированный механизм сравнения документов.


Договоры

Для договора полезно задавать структурированный запрос:

«Извлеки: стороны, предмет, срок, стоимость, порядок оплаты, ответственность, гарантии, конфиденциальность, персональные данные, расторжение, применимое право и спорные условия. Каждое утверждение свяжи с источником. Отдельно перечисли пункты, которые требуют юридической проверки человеком».

Note

ИИ-анализ не заменяет юридическую экспертизу. Он помогает быстрее найти и структурировать условия.


Регламенты

Запрос:

«Построй процедуру в хронологическом порядке. Для каждого шага укажи роль, действие, срок и документальное подтверждение. Если порядок неоднозначен, не додумывай — укажи конфликт».


Технические руководства

Для большого PDF лучше File Search.

Запрос:

«Найди разделы, относящиеся к восстановлению после отказа. Сначала покажи источники. Затем составь процедуру, не добавляя команд, которых нет в документации».


Документы с несколькими языками

Текстовый parser обычно сохраняет Unicode-текст, но качество ответа зависит от модели.

Если документ смешивает русский, английский и код:

  • не переводите названия параметров;
  • попросите сохранять команды и идентификаторы без изменений;
  • отдельно укажите язык итогового ответа.

Как проверить PDF после загрузки

Задайте три вопроса.

Проверка начала

«Как называется документ?»

Проверка середины

«Найди раздел <уникальное название> и процитируй первое предложение».

Проверка конца

«Как называется последний содержательный раздел перед приложениями?»

Если конец систематически не виден в режиме чтения целиком — используйте File Search.


Как проверить DOCX после загрузки

Попросите:

«Перечисли заголовки верхнего уровня в порядке следования».

Затем:

«Найди таблицу с колонками X/Y и опиши, как parser передал первые три строки».

Это быстро показывает качество извлечения структуры.


Когда пересохранить документ

Пересохранение помогает, если:

  • старый DOC плохо читается;
  • PDF содержит повреждённые шрифты;
  • документ собран сканером;
  • сложная таблица нужна как данные;
  • презентация нужна как текст.

Рекомендуемые преобразования:

DOC → DOCX
скан PDF → PDF с OCR
сложная таблица → CSV
HTML-страница → чистый Markdown/TXT

Конфиденциальные документы

Перед загрузкой:

  • проверьте активную модель;
  • удалите лишние персональные данные;
  • не прикладывайте секретные ключи;
  • убедитесь, что документ разрешён к обработке;
  • не включайте внешние сервисы без необходимости.

Если активен Yandex AI, переданные модели фрагменты документа покидают локальную VM.


Частые ошибки

«PDF загрузился, но ответ пустой»

Вероятно, это скан или parser не получил текст.

«Порядок абзацев неправильный»

Возможна многоколоночная вёрстка.

«Модель не понимает таблицу»

Экспортируйте её в CSV.

«Не видны комментарии Word»

Они могут не входить в извлечённое текстовое представление.

«Модель считает старый договор новым»

Имя/метаданные файла не заменяют управление версиями. Удалите устаревшую копию из базы знаний.


Как проверить результат

Документ пригоден для дальнейшей работы, если:

  • корректно определяется название;
  • основные заголовки читаются в правильном порядке;
  • контрольные фразы находятся;
  • таблицы передаются достаточно понятно для задачи;
  • File Search возвращает ожидаемые фрагменты;
  • пользователь может проверить цитаты.

Что дальше