Поддерживаемые форматы файлов¶
ИИ Студия работает с документами через извлечение текста и поиск по документам. Поэтому вопрос «поддерживается ли расширение?» недостаточен. Важнее понять, есть ли внутри файла текст, который можно надёжно извлечь, и подходит ли формат под вашу задачу.
На этой странице форматы разделены не по маркетинговому принципу «можно загрузить всё», а по практической пригодности.
Короткая рекомендация¶
Для максимально предсказуемой работы используйте:
- TXT;
- Markdown;
- PDF с текстовым слоем;
- DOCX;
- CSV умеренного размера;
- JSON;
- XML;
- YAML;
- INI/TOML;
- исходный код в текстовых форматах;
- обычные текстовые журналы.
Сканированные изображения и документы без текстового слоя требуют отдельного OCR и не относятся к гарантированно распознаваемым базовым форматам текущей поставки.
Почему расширение файла не гарантирует результат¶
Файл document.pdf может быть:
- нормальным PDF с текстом;
- сканом из 200 фотографий;
- PDF со сломанными шрифтами;
- контейнером со сложной разметкой и графикой;
- повреждённым файлом.
Все они имеют одно расширение, но качество извлечения будет разным.
То же относится к DOCX, XLSX и другим контейнерным форматам.
Текстовые форматы¶
TXT¶
Самый предсказуемый формат.
Подходит для:
- инструкций;
- логов;
- выгрузок;
- фрагментов документов;
- подготовленных данных.
Проверьте кодировку. UTF-8 является предпочтительным вариантом.
Markdown — .md¶
Очень удобен для технической документации.
Хорошо сохраняет:
- заголовки;
- списки;
- блоки кода;
- таблицы;
- ссылки;
- логическую структуру.
Для базы знаний Markdown часто удобнее тяжёлого PDF, если у организации есть исходная документация в Git.
CSV¶
Подходит для небольших и средних табличных фрагментов.
Хорошие сценарии:
- объяснить колонки;
- найти текстовые категории;
- проверить несколько строк;
- классифицировать значения;
- преобразовать небольшую таблицу.
Ограничения:
- огромный CSV не следует передавать целиком;
- модель не является гарантированным вычислительным движком;
- произвольное выполнение кода в базовой поставке отключено;
- точная статистика по миллионам строк должна выполняться специализированным инструментом.
JSON¶
Подходит для:
- конфигураций;
- ответов API;
- небольших экспортов;
- структурированных примеров.
Большие JSON с десятками тысяч однотипных объектов лучше заранее сократить.
Tip
Если вопрос относится к одному объекту, не загружайте дамп всей базы.
XML¶
Подходит для конфигураций и структурированных документов.
Сложные XML могут содержать много служебной разметки, которая расходует контекст. При возможности удалите неотносящиеся узлы.
YAML¶
Хорошо подходит для:
- Kubernetes manifests;
- Docker Compose;
- CI/CD;
- конфигураций приложений;
- инфраструктурных деклараций.
Перед загрузкой удалите секреты.
INI / TOML / ENV-подобные файлы¶
INI и TOML являются обычными текстовыми конфигурациями и обычно удобны для анализа.
С .env будьте особенно осторожны: он часто содержит секреты.
Danger
Не загружайте .env целиком, если в нём есть реальные пароли, API keys или токены. Сделайте обезличенную копию.
Исходный код¶
Текстовые языки программирования хорошо подходят для режима чтения целиком.
Например:
- Python;
- JavaScript;
- TypeScript;
- Java;
- C/C++;
- C#;
- Go;
- Rust;
- PHP;
- Ruby;
- Perl;
- Lua;
- Kotlin;
- Swift;
- Scala;
- Shell;
- SQL.
Не требуется переименовывать исходник в .txt, если его MIME-разрешение поддерживается текущей политикой.
Подробнее: Код и журналы.
PDF¶
PDF подходит хорошо, если содержит текстовый слой.
Хорошо¶
- экспорт из Word;
- документация из браузера;
- отчёт из информационной системы;
- техническое руководство с нормальным текстом.
Требует осторожности¶
- скан;
- сложная многоколоночная вёрстка;
- документы с большим числом схем;
- PDF, где важен точный визуальный макет;
- документы со встроенными рукописными отметками.
Подробнее: PDF и DOCX.
DOCX¶
Подходит для обычных текстовых документов Word.
Обычно хорошо извлекаются:
- абзацы;
- заголовки;
- списки;
- текст таблиц.
Не следует ожидать полной визуальной копии документа.
Сложные:
- плавающие фигуры;
- SmartArt;
- колонтитулы;
- сложные комментарии;
- рецензирование;
- точное форматирование;
- диаграммы.
Старый DOC¶
Поддержка старых бинарных форматов может зависеть от parser-а текущей версии.
Если DOC читается плохо, пересохраните его в DOCX или PDF с текстовым слоем.
XLSX / XLS¶
Базовые parser-ы могут извлекать текстовое содержимое таблиц, но электронная таблица — это не просто текстовый документ.
В книге могут быть:
- несколько листов;
- формулы;
- скрытые строки;
- объединённые ячейки;
- диаграммы;
- условное форматирование;
- сводные таблицы;
- макросы.
Текстовый анализ не гарантирует сохранение всей этой семантики.
Если нужна надёжная работа с данными:
- выберите нужный лист;
- экспортируйте его в CSV;
- оставьте нужные колонки;
- уменьшите количество строк;
- объясните смысл колонок в запросе.
PPTX / PPT¶
Презентация может быть извлечена как последовательность текстовых блоков, но визуальный смысл слайда может потеряться.
Например, модель увидит:
но не обязательно поймёт, какой текст относится к какой стрелке на диаграмме.
Если важен смысл графики, подготовьте текстовую версию или описание.
HTML¶
HTML можно анализировать как текст, но исходник может содержать много:
- навигации;
- JavaScript;
- CSS;
- служебных блоков;
- скрытых элементов.
Если нужна статья со страницы, лучше использовать интернет-поиск/веб-извлечение Студии или заранее сохранить чистый текст.
Изображения¶
Текущая базовая поставка не позиционируется как режим анализа изображений.
Изображения с текстом требуют OCR.
Локальный document_parser не следует считать полноценным механизмом распознавания пикселей.
Поэтому JPEG/PNG со сканом документа лучше сначала обработать доверенным OCR-сервисом и загрузить результат как PDF/TXT/DOCX.
Аудио и видео¶
Аудио/видео не входят в текущий пользовательский профиль Студии.
Не рассчитывайте, что загрузка MP3/MP4 автоматически приведёт к транскрибации или анализу.
Архивы¶
ZIP/TAR/GZ — транспортный формат, а не документ.
Распакуйте архив и выберите полезные материалы.
Не загружайте архив с:
- зависимостями;
- бинарниками;
- временными файлами;
.git;- кэшем;
- секретами.
Бинарные файлы¶
Не предназначены для обычного текстового анализа:
- EXE;
- DLL;
- ELF;
- RPM/DEB;
- ISO;
- базы SQLite целиком;
- дампы памяти;
- бинарные protobuf без схемы.
Для них сначала подготовьте текстовые метаданные или вывод специализированного инструмента.
Логи¶
Рекомендуемые форматы:
.log;.txt;- JSON Lines;
- небольшие journald exports в текстовом виде.
Лучше сохранять:
- timestamp;
- severity;
- service/component;
- request/trace ID;
- исходный порядок строк.
Как проверить пригодность файла до загрузки¶
PDF¶
Попробуйте выделить и скопировать абзац.
DOCX¶
Откройте документ и убедитесь, что содержимое не состоит почти полностью из изображений.
CSV¶
Проверьте размер и кодировку.
Код¶
Удалите секреты и generated/vendor каталоги.
Логи¶
Обрежьте временной диапазон.
MIME и расширение¶
Сервер может использовать MIME-type для принятия решения.
Поэтому файл может быть отклонён, если:
- расширение не соответствует содержимому;
- браузер сообщил необычный MIME;
- администратор ограничил типы;
- parser не поддерживает формат.
Переименование расширения не является способом исправления.
Лимиты форматов¶
Лимиты задаются политикой текущей установки:
- размер одного файла;
- число файлов;
- суммарный размер партии;
- размер извлечённого текста;
- права конкретного адреса сервиса или роли.
Документация не фиксирует эти значения как вечный контракт, потому что администратор может изменить их в зависимости от ресурсов и политики безопасности.
Практическая таблица¶
| Формат | Рекомендация | Основной риск |
|---|---|---|
| TXT | отлично | кодировка |
| MD | отлично | почти нет |
| PDF с текстом | хорошо | сложная вёрстка |
| PDF-скан | сначала OCR | нет текстового слоя |
| DOCX | хорошо | потеря визуальной структуры |
| CSV | хорошо для умеренных объёмов | большие таблицы |
| JSON | хорошо | огромные дампы |
| YAML | отлично | секреты |
| исходный код | отлично | слишком большой проект |
| LOG | отлично после отбора | секреты и объём |
| XLSX | ограниченно | формулы/листы/структура |
| PPTX | ограниченно | визуальный смысл |
| изображение | не базовый сценарий | требуется OCR |
| аудио/видео | вне текущего профиля | требуется отдельный pipeline |
| ZIP/TAR | распаковать | лишние/опасные файлы |