Перейти к содержанию

Поддерживаемые форматы файлов

ИИ Студия работает с документами через извлечение текста и поиск по документам. Поэтому вопрос «поддерживается ли расширение?» недостаточен. Важнее понять, есть ли внутри файла текст, который можно надёжно извлечь, и подходит ли формат под вашу задачу.

На этой странице форматы разделены не по маркетинговому принципу «можно загрузить всё», а по практической пригодности.


Короткая рекомендация

Для максимально предсказуемой работы используйте:

  • TXT;
  • Markdown;
  • PDF с текстовым слоем;
  • DOCX;
  • CSV умеренного размера;
  • JSON;
  • XML;
  • YAML;
  • INI/TOML;
  • исходный код в текстовых форматах;
  • обычные текстовые журналы.

Сканированные изображения и документы без текстового слоя требуют отдельного OCR и не относятся к гарантированно распознаваемым базовым форматам текущей поставки.


Почему расширение файла не гарантирует результат

Файл document.pdf может быть:

  1. нормальным PDF с текстом;
  2. сканом из 200 фотографий;
  3. PDF со сломанными шрифтами;
  4. контейнером со сложной разметкой и графикой;
  5. повреждённым файлом.

Все они имеют одно расширение, но качество извлечения будет разным.

То же относится к DOCX, XLSX и другим контейнерным форматам.


Текстовые форматы

TXT

Самый предсказуемый формат.

Подходит для:

  • инструкций;
  • логов;
  • выгрузок;
  • фрагментов документов;
  • подготовленных данных.

Проверьте кодировку. UTF-8 является предпочтительным вариантом.


Markdown — .md

Очень удобен для технической документации.

Хорошо сохраняет:

  • заголовки;
  • списки;
  • блоки кода;
  • таблицы;
  • ссылки;
  • логическую структуру.

Для базы знаний Markdown часто удобнее тяжёлого PDF, если у организации есть исходная документация в Git.


CSV

Подходит для небольших и средних табличных фрагментов.

Хорошие сценарии:

  • объяснить колонки;
  • найти текстовые категории;
  • проверить несколько строк;
  • классифицировать значения;
  • преобразовать небольшую таблицу.

Ограничения:

  • огромный CSV не следует передавать целиком;
  • модель не является гарантированным вычислительным движком;
  • произвольное выполнение кода в базовой поставке отключено;
  • точная статистика по миллионам строк должна выполняться специализированным инструментом.

JSON

Подходит для:

  • конфигураций;
  • ответов API;
  • небольших экспортов;
  • структурированных примеров.

Большие JSON с десятками тысяч однотипных объектов лучше заранее сократить.

Tip

Если вопрос относится к одному объекту, не загружайте дамп всей базы.


XML

Подходит для конфигураций и структурированных документов.

Сложные XML могут содержать много служебной разметки, которая расходует контекст. При возможности удалите неотносящиеся узлы.


YAML

Хорошо подходит для:

  • Kubernetes manifests;
  • Docker Compose;
  • CI/CD;
  • конфигураций приложений;
  • инфраструктурных деклараций.

Перед загрузкой удалите секреты.


INI / TOML / ENV-подобные файлы

INI и TOML являются обычными текстовыми конфигурациями и обычно удобны для анализа.

С .env будьте особенно осторожны: он часто содержит секреты.

Danger

Не загружайте .env целиком, если в нём есть реальные пароли, API keys или токены. Сделайте обезличенную копию.


Исходный код

Текстовые языки программирования хорошо подходят для режима чтения целиком.

Например:

  • Python;
  • JavaScript;
  • TypeScript;
  • Java;
  • C/C++;
  • C#;
  • Go;
  • Rust;
  • PHP;
  • Ruby;
  • Perl;
  • Lua;
  • Kotlin;
  • Swift;
  • Scala;
  • Shell;
  • SQL.

Не требуется переименовывать исходник в .txt, если его MIME-разрешение поддерживается текущей политикой.

Подробнее: Код и журналы.


PDF

PDF подходит хорошо, если содержит текстовый слой.

Хорошо

  • экспорт из Word;
  • документация из браузера;
  • отчёт из информационной системы;
  • техническое руководство с нормальным текстом.

Требует осторожности

  • скан;
  • сложная многоколоночная вёрстка;
  • документы с большим числом схем;
  • PDF, где важен точный визуальный макет;
  • документы со встроенными рукописными отметками.

Подробнее: PDF и DOCX.


DOCX

Подходит для обычных текстовых документов Word.

Обычно хорошо извлекаются:

  • абзацы;
  • заголовки;
  • списки;
  • текст таблиц.

Не следует ожидать полной визуальной копии документа.

Сложные:

  • плавающие фигуры;
  • SmartArt;
  • колонтитулы;
  • сложные комментарии;
  • рецензирование;
  • точное форматирование;
  • диаграммы.

Старый DOC

Поддержка старых бинарных форматов может зависеть от parser-а текущей версии.

Если DOC читается плохо, пересохраните его в DOCX или PDF с текстовым слоем.


XLSX / XLS

Базовые parser-ы могут извлекать текстовое содержимое таблиц, но электронная таблица — это не просто текстовый документ.

В книге могут быть:

  • несколько листов;
  • формулы;
  • скрытые строки;
  • объединённые ячейки;
  • диаграммы;
  • условное форматирование;
  • сводные таблицы;
  • макросы.

Текстовый анализ не гарантирует сохранение всей этой семантики.

Если нужна надёжная работа с данными:

  1. выберите нужный лист;
  2. экспортируйте его в CSV;
  3. оставьте нужные колонки;
  4. уменьшите количество строк;
  5. объясните смысл колонок в запросе.

PPTX / PPT

Презентация может быть извлечена как последовательность текстовых блоков, но визуальный смысл слайда может потеряться.

Например, модель увидит:

Рост
2024 15%
2025 21%
Рынок

но не обязательно поймёт, какой текст относится к какой стрелке на диаграмме.

Если важен смысл графики, подготовьте текстовую версию или описание.


HTML

HTML можно анализировать как текст, но исходник может содержать много:

  • навигации;
  • JavaScript;
  • CSS;
  • служебных блоков;
  • скрытых элементов.

Если нужна статья со страницы, лучше использовать интернет-поиск/веб-извлечение Студии или заранее сохранить чистый текст.


Изображения

Текущая базовая поставка не позиционируется как режим анализа изображений.

Изображения с текстом требуют OCR.

Локальный document_parser не следует считать полноценным механизмом распознавания пикселей.

Поэтому JPEG/PNG со сканом документа лучше сначала обработать доверенным OCR-сервисом и загрузить результат как PDF/TXT/DOCX.


Аудио и видео

Аудио/видео не входят в текущий пользовательский профиль Студии.

Не рассчитывайте, что загрузка MP3/MP4 автоматически приведёт к транскрибации или анализу.


Архивы

ZIP/TAR/GZ — транспортный формат, а не документ.

Распакуйте архив и выберите полезные материалы.

Не загружайте архив с:

  • зависимостями;
  • бинарниками;
  • временными файлами;
  • .git;
  • кэшем;
  • секретами.

Бинарные файлы

Не предназначены для обычного текстового анализа:

  • EXE;
  • DLL;
  • ELF;
  • RPM/DEB;
  • ISO;
  • базы SQLite целиком;
  • дампы памяти;
  • бинарные protobuf без схемы.

Для них сначала подготовьте текстовые метаданные или вывод специализированного инструмента.


Логи

Рекомендуемые форматы:

  • .log;
  • .txt;
  • JSON Lines;
  • небольшие journald exports в текстовом виде.

Лучше сохранять:

  • timestamp;
  • severity;
  • service/component;
  • request/trace ID;
  • исходный порядок строк.

Как проверить пригодность файла до загрузки

PDF

Попробуйте выделить и скопировать абзац.

DOCX

Откройте документ и убедитесь, что содержимое не состоит почти полностью из изображений.

CSV

Проверьте размер и кодировку.

Код

Удалите секреты и generated/vendor каталоги.

Логи

Обрежьте временной диапазон.


MIME и расширение

Сервер может использовать MIME-type для принятия решения.

Поэтому файл может быть отклонён, если:

  • расширение не соответствует содержимому;
  • браузер сообщил необычный MIME;
  • администратор ограничил типы;
  • parser не поддерживает формат.

Переименование расширения не является способом исправления.


Лимиты форматов

Лимиты задаются политикой текущей установки:

  • размер одного файла;
  • число файлов;
  • суммарный размер партии;
  • размер извлечённого текста;
  • права конкретного адреса сервиса или роли.

Документация не фиксирует эти значения как вечный контракт, потому что администратор может изменить их в зависимости от ресурсов и политики безопасности.


Практическая таблица

Формат Рекомендация Основной риск
TXT отлично кодировка
MD отлично почти нет
PDF с текстом хорошо сложная вёрстка
PDF-скан сначала OCR нет текстового слоя
DOCX хорошо потеря визуальной структуры
CSV хорошо для умеренных объёмов большие таблицы
JSON хорошо огромные дампы
YAML отлично секреты
исходный код отлично слишком большой проект
LOG отлично после отбора секреты и объём
XLSX ограниченно формулы/листы/структура
PPTX ограниченно визуальный смысл
изображение не базовый сценарий требуется OCR
аудио/видео вне текущего профиля требуется отдельный pipeline
ZIP/TAR распаковать лишние/опасные файлы

Что дальше