Перейти к содержимому
БЕРЕСТА ИНТЕЛЛЕКТУАЛЬНЫЙ PDF-РЕДАКТОР

Распознавание текста в PDF и сканах

Береста распознаёт текст в отсканированных PDF и PDF-картинках на русском и английском и добавляет невидимый текстовый слой. После этого по скану работает поиск, текст можно выделить и скопировать, а сам документ выглядит как раньше. Распознавание идёт на компьютере, без интернета.

Распознавание сканов в Бересте

Как распознать скан в Бересте

  1. 1

    Откройте скан или PDF без текста в Бересте.

  2. 2

    Распознавание начнётся само в фоне — прогресс видно по страницам.

  3. 3

    Выделите и скопируйте текст или найдите слово через поиск.

  4. 4

    Сохраните PDF — невидимый текстовый слой останется в файле.

Зачем скану текстовый слой

Скан — это картинка: в нём нельзя найти слово, скопировать реквизиты или процитировать пункт. Береста распознаёт текст и кладёт его невидимым слоем под изображение. Страница выглядит так же, но становится доступной для поиска и копирования. Такой PDF часто называют «PDF с текстовым слоем» или «искомым PDF».

Как это работает

Как только вы открываете скан, Береста начинает распознавание сама — в фоне, страница за страницей, и показывает прогресс. Страницы, положенные боком или вверх ногами, распознаются правильно: программа пробует разные повороты. Если в документе уже есть текстовый слой, повторно страницы не распознаются, а при новом открытии слой собирается целиком.

Распознавание выполняется на компьютере с помощью моделей PP-OCRv5. Документ не отправляется в облако, поэтому сканы договоров, кадровых документов и писем можно распознавать без риска утечки.

Поиск по скану

После распознавания поиск в боковой панели находит слово или словосочетание на любой странице и подсвечивает его. Регистр и знаки препинания не мешают, «ё» и «е» считаются одной буквой. Это удобно при работе с архивом, подписанными договорами и входящими письмами.

Смешанные документы

Бывает, что скан вставлен картинкой в обычный цифровой PDF — например, приложение к договору. Береста распознаёт такие картинки так же, как целые сканы.

Как улучшить результат распознавания

Чем чище скан, тем точнее текст. Если скан перекошен или серый, сначала улучшите его — распознанный текст будет точнее. Для новых сканов выбирайте разрешение 300 dpi.

Что ещё можно сделать со сканом

Распознанный скан можно улучшить — выпрямить и сделать чётче, исправить на нём слово, сравнить с исходным документом, сохранить в Markdown или задать по нему вопрос ИИ-ассистенту.

Вопросы и ответы

Какие языки распознаёт Береста?

Русский и английский. Распознавание работает на моделях PP-OCRv5 прямо на компьютере, ничего не скачивается из интернета.

Изменится ли внешний вид скана после распознавания?

Нет. Текстовый слой невидимый: страница выглядит как раньше, но в ней работает поиск и выделение текста.

Нужен ли интернет для распознавания?

Нет. Распознавание выполняется на компьютере, скан никуда не отправляется.

Будет ли работать поиск по скану в других программах?

Да. Текстовый слой сохраняется в PDF, и по нему ищут другие программы просмотра — например, браузеры и Acrobat.

Найдёт ли поиск слово с буквой «ё», если я ввёл «е»?

Да. При поиске «ё» и «е» считаются одной буквой, регистр и знаки препинания не мешают.

Сколько времени занимает распознавание?

Обычно от одной до трёх секунд на страницу на современном компьютере. Страницы распознаются по очереди в фоне, работать с документом можно сразу.

Где хранится распознанный текст?

В самом PDF — невидимым слоем под изображением страницы. Отдельный файл не нужен: достаточно сохранить документ.

Попробуйте Бересту — интеллектуальный PDF‑редактор с ИИ

Правка PDF и сканов, сравнение версий, распознавание и ИИ-ассистент в одной программе. Версия 0.7.0 для Windows, macOS, Astra Linux, Альт и РЕД ОС, документы остаются на вашем компьютере.