PDF в Markdown — бесплатно, прямо в браузере | nopa

Текст и данные

PDF в Markdown

Бросьте PDF и получите Markdown с заголовками, абзацами и списками — а не по строке на каждую печатную строку. Можно сразу несколько файлов и забрать ZIP. Файл не покидает браузер.

Попробуйте сразу — без аккаунта

Сохранить и продолжить на рабочем столе

Скачайте или скопируйте результат прямо здесь. В рабочем столе он сохранится в Файлы, а инструмент откроется в полной версии.

  • Простые заметки с жирным и списками — всё локально
  • Сохраните в Файлы, когда продолжите на рабочем столе
  • Все инструменты рядом — без новых вкладок
Открыть бесплатный рабочий стол

После скачивания — продолжите на рабочем столе: Файлы или полная версия.

Что умеет PDF в Markdown

Абзацы, а не печатные строки

В PDF нет абзацев. В нём есть глифы с координатами, и всё, что читатель видит как структуру, выводится из того, где они стоят и какого размера. Скопируйте текст из просмотрщика — вы получите ровно это: жёсткий перенос там, где строка случайно кончилась, дефис посреди каждого слова, разорванного на полях, и номер страницы посреди предложения. В документе таким пользоваться нельзя, в промпте — тем более. Здесь строки собираются обратно в абзацы, разорванные слова склеиваются, а колонтитулы — тот самый заголовок, повторённый сорок раз, — выбрасываются.

Заголовки берутся из кегля

Ничто в PDF не говорит «это заголовок». Он говорит, что одна строка набрана 18 кеглем среди текста в 10, — поэтому она становится H1, тринадцатые становятся H3, а длинная строка чуть покрупнее остаётся абзацем: это и есть предохранитель, из-за которого целое вступление не превращается в заголовок. Это вывод по косвенным признакам, и он оказывается верным гораздо чаще, чем нет, — но стоит понимать, что это именно вывод, а не структура, которую нёс сам файл.

Чего инструмент не будет изображать

Текст и заголовки, но не раскладка: статьи в две колонки читаются как текст, иллюстрации, графики и врезки не восстанавливаются. Если PDF — скан, его страницы это картинки букв, и брать оттуда нечего: инструмент так и скажет, а не выдаст пустой файл. Чтобы прочитать скан, нужен OCR — это модель на 40 МБ и совсем другое обещание.

Похожие приложения

Вопросы

Мой PDF куда-то загружается?

Нет. Он разбирается в вашем браузере, на этом устройстве. Файл не уходит на сервер, и мы его не видим.

Можно сразу несколько файлов?

Да. Добавляйте сколько нужно — каждый станет своим `.md`, а одной кнопкой всё забирается одним ZIP.

Почему из скана ничего не получилось?

Потому что в нём нет текстового слоя: страницы — это изображения, символов там просто нет. Инструмент говорит об этом прямо, а не возвращает пустой файл. Вытащить текст из скана можно только через OCR, а его здесь нет.

Таблицы переносятся?

Из PDF — нет. Таблица в PDF это линии и текст по координатам, и ничто не помечает её как таблицу, поэтому ячейки приходят текстом. Таблицы из `.docx` переносятся — настоящими таблицами Markdown.

Работает офлайн?

Да, если страница уже открывалась. Конвертация — это код в вашем браузере, тянуться никуда не нужно.