PDF для нейросети - это не документ, а каша разметки

Когда вы загружаете PDF в чат, модель не видит аккуратно свёрстанную страницу - она видит поток символов вперемешку с координатами элементов, служебными тегами и визуальным форматированием, которое для человека невидимо, а для токенайзера всё равно текст. Одна страница обычного PDF может занимать от полутора до трёх тысяч токенов в сыром виде - и это ещё до того, как вы задали хоть один вопрос по содержанию. Договор на двадцать страниц съедает солидную часть лимита только на то, чтобы модель вообще «увидела» файл.

Что делает MarkItDown

Разные форматы на входе
PDF, Word, Excel, презентации PowerPoint и даже ссылка на видео - на выходе везде чистый структурированный текст.
Структура остаётся
Заголовки, таблицы и списки сохраняются в виде Markdown-разметки - той же, на которой в основном обучены языковые модели.
Работает локально
Открытый исходный код, запускается на своём компьютере - файлы не уходят на сторонний сервер для конвертации.

Установка и запуск

Проще всего поставить через Claude Code, который сам выполнит команды в терминале - не нужно вручную разбираться с окружением Python.

Установи в этой папке инструмент MarkItDown от Microsoft (pip install
"markitdown[all]") в отдельном виртуальном окружении Python и проверь,
что команда запускается

Для конвертации отдельного файла достаточно назвать его имя - Claude Code сам подберёт нужную команду и покажет результат.

До и после конвертации

Таблица прокручивается вбок на телефоне →

ПараметрСырой PDF в чатеПосле MarkItDown
Что видит модельРазметку, координаты, служебные тегиЧистый структурированный текст
Расход токенов на страницуВыше - визуальный мусор занимает местоЗаметно ниже - тот же смысл, меньше «шума»
Таблицы и заголовкиИногда теряют структуру при чтенииСохраняются как читаемый Markdown
Где хранится файлОбычно уходит на сервер сервисаКонвертация происходит локально

Когда это особенно оправдано

Экономия заметнее всего на объёмных документах, которые вы прогоняете через нейросеть регулярно - многостраничные договоры, отчёты, презентации с большим количеством текста на слайдах. Для короткой одностраничной справки разница почти не ощущается, и конвертация ради экономии нескольких сотен токенов не стоит потраченного времени. Правило простое: чем больше документ и чем чаще вы с ним работаете, тем сильнее окупается лишний шаг конвертации.

Чек-лист перед загрузкой объёмного документа

Сохраните себе
  1. Для документов больше нескольких страниц конвертируйте в Markdown перед загрузкой, а не отправляйте сырой файл.
  2. Проверьте, что таблицы и заголовки сохранились после конвертации - иногда сложная вёрстка ломается.
  3. Для одностраничных коротких файлов конвертация обычно не оправдана - разница в токенах небольшая.
  4. Держите чувствительные документы в локальной конвертации, если не хотите отправлять их на сторонний сервер.
  5. Проверяйте версию инструмента перед регулярным использованием - открытые проекты обновляются со временем.
Нужны ли навыки программирования для использования MarkItDown?
Нет, при установке через Claude Code достаточно попросить его словами - агент сам выполнит нужные команды.
Для каких документов конвертация в Markdown даёт наибольшую экономию токенов?
Для объёмных многостраничных файлов - договоров, отчётов, презентаций. На короткой справке разница почти не ощущается.
Уходят ли файлы на сторонний сервер при конвертации через MarkItDown?
Нет, инструмент с открытым кодом работает локально на компьютере пользователя.
Источники
← Все статьи блога