Распознавание текста в PDF и сканах
Береста распознаёт текст в отсканированных PDF и PDF-картинках на русском и английском и добавляет невидимый текстовый слой. После этого по скану работает поиск, текст можно выделить и скопировать, а сам документ выглядит как раньше. Распознавание идёт на компьютере, без интернета.
Как распознать скан в Бересте
- 1
Откройте скан или PDF без текста в Бересте.
- 2
Распознавание начнётся само в фоне — прогресс видно по страницам.
- 3
Выделите и скопируйте текст или найдите слово через поиск.
- 4
Сохраните PDF — невидимый текстовый слой останется в файле.
Зачем скану текстовый слой
Скан — это картинка: в нём нельзя найти слово, скопировать реквизиты или процитировать пункт. Береста распознаёт текст и кладёт его невидимым слоем под изображение. Страница выглядит так же, но становится доступной для поиска и копирования. Такой PDF часто называют «PDF с текстовым слоем» или «искомым PDF».
Как это работает
Как только вы открываете скан, Береста начинает распознавание сама — в фоне, страница за страницей, и показывает прогресс. Страницы, положенные боком или вверх ногами, распознаются правильно: программа пробует разные повороты. Если в документе уже есть текстовый слой, повторно страницы не распознаются, а при новом открытии слой собирается целиком.
Распознавание выполняется на компьютере с помощью моделей PP-OCRv5. Документ не отправляется в облако, поэтому сканы договоров, кадровых документов и писем можно распознавать без риска утечки.
Поиск по скану
После распознавания поиск в боковой панели находит слово или словосочетание на любой странице и подсвечивает его. Регистр и знаки препинания не мешают, «ё» и «е» считаются одной буквой. Это удобно при работе с архивом, подписанными договорами и входящими письмами.
Смешанные документы
Бывает, что скан вставлен картинкой в обычный цифровой PDF — например, приложение к договору. Береста распознаёт такие картинки так же, как целые сканы.
Как улучшить результат распознавания
Чем чище скан, тем точнее текст. Если скан перекошен или серый, сначала улучшите его — распознанный текст будет точнее. Для новых сканов выбирайте разрешение 300 dpi.
Что ещё можно сделать со сканом
Распознанный скан можно улучшить — выпрямить и сделать чётче, исправить на нём слово, сравнить с исходным документом, сохранить в Markdown или задать по нему вопрос ИИ-ассистенту.
Вопросы и ответы
Какие языки распознаёт Береста?
Русский и английский. Распознавание работает на моделях PP-OCRv5 прямо на компьютере, ничего не скачивается из интернета.
Изменится ли внешний вид скана после распознавания?
Нет. Текстовый слой невидимый: страница выглядит как раньше, но в ней работает поиск и выделение текста.
Нужен ли интернет для распознавания?
Нет. Распознавание выполняется на компьютере, скан никуда не отправляется.
Будет ли работать поиск по скану в других программах?
Да. Текстовый слой сохраняется в PDF, и по нему ищут другие программы просмотра — например, браузеры и Acrobat.
Найдёт ли поиск слово с буквой «ё», если я ввёл «е»?
Да. При поиске «ё» и «е» считаются одной буквой, регистр и знаки препинания не мешают.
Сколько времени занимает распознавание?
Обычно от одной до трёх секунд на страницу на современном компьютере. Страницы распознаются по очереди в фоне, работать с документом можно сразу.
Где хранится распознанный текст?
В самом PDF — невидимым слоем под изображением страницы. Отдельный файл не нужен: достаточно сохранить документ.
Попробуйте Бересту — интеллектуальный PDF‑редактор с ИИ
Правка PDF и сканов, сравнение версий, распознавание и ИИ-ассистент в одной программе. Версия 0.7.0 для Windows, macOS, Astra Linux, Альт и РЕД ОС, документы остаются на вашем компьютере.