Инструменты150

Полезные изменения в несколько шагов.

PDF OCR.

Сделайте сканированные слова доступными для поиска и редактирования.

Advertisements
Ваше рабочее пространство PDF
Обработка на сервере
или перетащите файлы сюда
Предпросмотр остается локальным. Обработка временно загружает ваш PDF. PDF
Advertisements

Как использовать PDF OCR

  1. 01

    Выберите PDF

    Откройте PDF или попробуйте образец. Предпросмотр не загружает ваш документ.

  2. 02

    Выберите движок и язык

    Откройте нужную страницу. Выберите «Классический» или «Будущий», язык распознавания и доступный формат вывода.

  3. 03

    Обработать и скачать

    Распознайте эту страницу, проверьте результат и скачайте его. Другие страницы требуют отдельных нажатий.

БлогКак извлечь текст из отсканированного PDF с помощью OCRЧитать руководство

Извлеките текст из PDF, проверьте и улучшите его с помощью Smart edit

PDF OCR (оптическое распознавание символов) считывает текст внутри отсканированных изображений PDF, чтобы вы могли его скопировать и отредактировать. Распознавайте по одной странице или выбранной области за раз, скачивайте TXT или редактируемый текст Word и проверяйте результат рядом со сканом. Smart edit помогает улучшить формулировки и форматирование. Версия «Классическая» также предлагает PDF с возможностью поиска; версия «Будущее» предлагает PDF только с текстом в новой верстке.

Превратите выбранный скан в редактируемый текст, затем проверьте и улучшите результат.
КРАТКИЙ ВИДЕОУРОК Как извлечь текст из отсканированного PDF с помощью OCR Извлеките слова, а затем отредактируйте их. Английская озвучка Смотреть видео

Как извлечь текст из отсканированного PDF с помощью OCR

Превратите отсканированные страницы в полезный текст

Студенты и исследователи

Отсканированный PDF в текст

Извлекайте фрагменты из отсканированных книг, статей и конспектов лекций для цитирования, изучения или перевода. Сравните распознанный текст с исходником перед повторным использованием.

Офисная и административная работа

Отсканированный PDF в Word

Превратите отсканированное письмо или страницу отчета в редактируемый текст Word. Проверяйте и исправляйте формулировки без необходимости перепечатывать все заново; файл Word использует новую верстку.

Записи и архивы

Сделайте отсканированный PDF доступным для поиска

Используйте «Классическую» версию, чтобы добавить текст с возможностью поиска на выбранную страницу или область, сохранив при этом исходное изображение. Каждое действие создает результат для конкретной страницы, а не для всего документа.

Вы уже можете выделить и скопировать текст? Извлеките его напрямую без OCR:

PDF в текст

Функции и элементы управления

Извлечение текста из одной страницы или области PDF

Перейдите на страницу, выберите язык распознавания и распознайте всю страницу или нарисованный прямоугольник. Каждый запрос обрабатывает по одной странице за раз.

Выберите область и подготовьте скан

Нарисуйте, переместите или измените размер прямоугольника распознавания в предварительном просмотре страницы, чтобы исключить посторонние столбцы или поля, затем выберите «Распознать выделенное». Чтобы обработать другую страницу, вернитесь в рабочую область, выберите эту страницу и снова запустите распознавание; это не пакетное OCR для всего документа.

Установите язык распознавания, соответствующий тексту. Четкие, прямые сканы распознаются легче, чем размытые или перекошенные изображения. Распознавание использует фиксированные 200 DPI; оно не может восстановить детали, отсутствующие в оригинале.

Выберите Future или Classic OCR и подходящий формат

Classic хорошо работает для большинства печатных документов. Future использует продвинутое распознавание на базе ИИ, оптимизированное для сложных сканов, некоторых рукописных документов и сложного многоязычного текста.

Какой движок и выходной формат выбрать?

Classic — хороший выбор для большинства печатных документов, поддерживает одноколоночные или многоколоночные макеты. Его «Поисковый PDF» сохраняет выбранную область изображения и добавляет текстовый слой, выровненный по распознанным словам, для поиска и выделения.

Future — это выбор по умолчанию для поддерживаемых языков. Его продвинутое распознавание на базе ИИ оптимизировано для сложных сканов, некоторых рукописных документов и сложного многоязычного текста. Результаты распознавания рукописного текста зависят от разборчивости и качества сканирования, поэтому сравнивайте распознанный текст с исходным изображением. Его «Простой PDF» содержит выделяемый текст в новом макете вместо сохранения исходного изображения. Языки, не поддерживаемые Future, используют Classic.

Оба движка поддерживают TXT и полноценные документы Word (.docx) с чистым редактируемым текстом и, при необходимости, форматированием справа налево. Выберите язык распознавания, соответствующий вашему документу.

Основная кнопка «Скачать» сохраняет формат, выбранный в настройках. Ссылки на PDF, TXT и Word под ней позволяют получить другие форматы после того же сеанса распознавания. Выберите TXT или Word (DOCX) в настройках, чтобы открыть панели исходного изображения и редактируемого текста, включая «Умное редактирование». Выбор PDF открывает предварительный просмотр и загрузку PDF.

Сравнение исходного изображения с редактируемым текстом OCR

Для результатов в формате TXT и DOCX сверяйте распознанный текст с исходным изображением. Исправляйте его напрямую или откройте «Умное редактирование» рядом с кнопкой «Копировать».

Масштабирование изображения, исправления и копирование

На панели источника отображается вся страница. При распознавании выбранной области остальная часть страницы затемняется, а выделение обозначается синим контуром. Увеличьте масштаб, чтобы рассмотреть мелкие символы, и используйте «По размеру», чтобы снова увидеть всю страницу. Сверяйте имена, цифры, пунктуацию и порядок чтения с изображением.

Исправления в редактируемом результате обновляют основной файл TXT или DOCX для скачивания. Кнопка «Копировать» рядом с текстом копирует текущий результат с кратким эффектом затухания. «Умное редактирование» открывает увеличенное окно для работы с ИИ и форматирования. Изменения текста не влияют на исходное изображение и не исправляют ранее созданный слой PDF с возможностью поиска.

Создание краткого содержания, перефразирование, исправление грамматики или предложение заголовка

В «Умном редактировании» выберите действие ИИ и нажмите «Применить». Выделите фрагмент для работы с ним или оставьте поле пустым, чтобы применить действие ко всему тексту в редакторе.

Действия ИИ, выделение и ограничения запросов

«Краткое содержание» сокращает текст, «Перефразировать» переписывает его, а «Исправить грамматику» предлагает языковые правки. Эти действия заменяют выделенный фрагмент или, если ничего не выделено, всё содержимое редактора. «Предложить заголовок» добавляет заголовок над документом; выделенный фрагмент может помочь в создании заголовка, не удаляя основной текст.

Каждый запрос к ИИ принимает до 600 слов и 12 000 символов при ограничении запроса в 64 КБ в кодировке UTF-8. Выберите более короткий фрагмент, если длинный результат превышает эти лимиты. Действия ИИ отправляют текст на наши серверы только после нажатия кнопки «Применить» при запросе вывода на том же языке.

Проверяйте предложенные изменения перед их сохранением. ИИ может опускать детали, искажать смысл или допускать ошибки, особенно если исходный текст содержит ошибки распознавания. «Отменить» возвращает к предыдущей версии. Основной результат обновляется только после нажатия «Применить изменения»; простое выполнение действия ИИ не заменяет его.

Форматирование текста в расширенном или простом редакторе

Добавляйте заголовки, списки, выделение и направление текста в расширенном редакторе или используйте простой редактор для внесения правок в обычный текст.

Типографика, макет и изменения форматирования

Расширенный редактор поддерживает абзацы, три уровня заголовков, шрифты с засечками, без засечек и моноширинные шрифты, размер шрифта, полужирное, курсивное и подчеркнутое начертание. Устанавливайте цвет текста или выделение, используйте маркированные или нумерованные списки, настраивайте выравнивание и выбирайте направление текста (автоматическое, справа налево или слева направо). «Очистить форматирование» удаляет стили для получения более простого результата.

Форматирование происходит в вашем браузере. Переключение на простой редактор само по себе не удаляет расширенный документ; редактирование его обычного текста убирает форматирование. Замены, выполненные ИИ, вставляют неформатированный текст в затронутую область, поэтому применяйте финальное оформление после проверки формулировок.

Используйте «Форматированное копирование», чтобы сохранить это оформление в HTML-файле. «Копировать» и «Применить изменения» переносят обычный текст. Форматирование результата не меняет шрифты, макет страницы или текстовый слой исходного PDF.

Очистка символов и восстановление предыдущих формулировок

Удаляйте акценты и огласовки, нормализуйте начертание цифр или используйте «Отменить», «Повторить» и «Восстановить» для возврата к предыдущим правкам.

Локальная очистка, история и восстановление результата

«Удалить акценты и огласовки» убирает латинские диакритические знаки и арабские огласовки из выбранного фрагмента или всего текста. «Нормализовать числа» приводит начертание западных, арабских или персидских цифр к стандарту в соответствии со скриптом текста; это не меняет их числовые значения. Эти действия по очистке выполняются локально в вашем браузере.

«Отменить» и «Повторить» позволяют просматривать шаги редактирования, включая изменения ИИ. «Восстановить текст OCR» или «Восстановить перевод» возвращает редактор к исходному результату обработки. Вы также можете отменить это восстановление. «Отмена» закрывает окно без применения текущих изменений к основному результату.

«Умное редактирование» — это рабочий инструмент, а не сохраненный проект. Скачайте нужный текст или форматированную копию перед перезагрузкой страницы или началом работы заново.

Сохранение исправленного текста OCR или форматированной копии

«Применить изменения» обновляет результат в формате TXT или Word (DOCX). «Форматированная копия» сохраняет стили «Умного редактирования» как отдельный HTML-файл.

Что содержит каждый файл для скачивания

TXT содержит текущий обычный текст. Документ Word (.docx) — это полноценный редактируемый файл Word, созданный с чистым текстом и форматированием абзацев и текста справа налево для соответствующих языков. После исправления текста или изменений в «Умном редактировании» кнопка «Скачать» отправляет текущий текст на наш сервер для повторной генерации файла Word без повторного OCR. Файл Word не воссоздает макет скана и не сохраняет богатое оформление «Умного редактирования».

Для заголовков, цветов, списков и другого форматирования «Умного редактирования» выберите «Форматированная копия» внутри редактора. Она загружает HTML-файл, который можно открыть в браузере и распечатать с помощью стандартных средств печати браузера. Это дополнительный текстовый документ, а не PDF с возможностью поиска или отредактированный скан источника.

«Умное редактирование» поддерживает до 100 000 символов в редакторе; для отдельных действий ИИ действуют меньшие ограничения, описанные выше. Если вы выбрали вывод в PDF в настройках OCR, используйте отдельный предварительный просмотр и загрузку PDF. Выбирайте результат распознавания TXT или DOCX, если вам нужны исправления текста с помощью «Умного редактирования».

Поддерживаемые файлы и обработка

Входные данные
PDF
Выходные данные
TXT, DOCX, PDF, HTML

Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.

Исходный файл может содержать до 750 страниц, но каждый запрос обрабатывает только одну страницу.

Обработка выполняется на наших серверах. Исходные файлы, временные файлы и результаты удаляются с наших серверов в течение 30 минут после завершения обработки. Мы не передаем содержимое документов третьим лицам и не используем их для обучения ИИ-моделей.

Advertisements
FAQ

Полезно знать.

Несколько ответов перед началом работы.

Обработка на сервере
Как извлечь текст из отсканированного PDF?

Откройте PDF, выберите страницу и язык распознавания, при необходимости настройте прямоугольник, если нужна только часть страницы. Запустите OCR, затем выберите TXT или Word, чтобы скопировать, проверить и отредактировать распознанный текст. OCR считывает слова внутри отсканированного изображения; каждый запрос обрабатывает одну страницу или выбранную область.

Можно ли преобразовать отсканированный PDF в редактируемый документ Word?

Да. И Future, и Classic предоставляют документ Word (.docx) с редактируемым текстом из выбранной страницы или области, включая поддержку форматирования справа налево (RTL) для соответствующих языков. Проверьте распознанные слова и исправьте ошибки перед скачиванием. Файл Word использует новую верстку текста; он не воссоздает исходные таблицы, изображения или дизайн страницы.

Нужно ли мне OCR, если мой PDF уже содержит выделяемый текст?

Обычно нет. Если вы можете правильно выделить и скопировать слова, используйте «PDF в текст» для извлечения существующего текста без распознавания. OCR полезен для сканов, состоящих только из изображений, или страниц, где текст копируется некорректно. Сначала проверьте скопированные слова, чтобы выбрать подходящий инструмент.

Обрабатывает ли PDF OCR весь документ сразу?

Нет. Каждое выполнение распознает одну выбранную страницу PDF или один прямоугольник на этой странице с разрешением 200 DPI. Выберите другую страницу и запустите OCR снова, чтобы продолжить. Исходный PDF может содержать до 750 страниц, но это лимит загрузки, а не пакетная обработка всего документа.

В чем разница между OCR «Будущее» и «Классический»?

«Классический» хорошо работает для большинства печатных документов. «Будущее» использует продвинутое распознавание на базе ИИ, оптимизированное для сложных сканов, некоторых рукописных документов и сложного многоязычного текста; это профиль по умолчанию для поддерживаемых языков. Результаты распознавания рукописного текста зависят от разборчивости и качества скана. Оба движка предлагают форматы TXT и Word (.docx) с поддержкой форматирования справа налево там, где это уместно. «Классический» также создает «PDF с возможностью поиска», который сохраняет исходное изображение и выровненный текстовый слой; «Будущее» создает «Простой PDF» только с текстом и новой версткой.

Можно ли исправить распознанный текст рядом с исходным изображением?

Да. Для результатов в TXT и Word панель источника показывает полную страницу рядом с редактируемым текстом. Синий контур отмечает распознанную область, а остальная часть страницы затемнена. Увеличьте масштаб, чтобы проверить имена, цифры и пунктуацию, или используйте «По размеру», чтобы снова увидеть всю страницу.

Что «Умное редактирование» может сделать с моим текстом?

Инструмент позволяет создавать краткое содержание, перефразировать текст, исправлять грамматику, предлагать заголовки, а также поддерживает форматирование, очистку, отмену и повтор действий. Выделите фрагмент или используйте весь текст целиком. ИИ-функции запускаются при нажатии кнопки «Применить» и обрабатывают до 600 слов и 12 000 символов за запрос. Проверьте результат и выберите «Применить изменения» для обновления основного текста. «Форматированное копирование» загружает HTML, а «Копировать» и «Применить изменения» переносят обычный текст.

Какой формат загрузки после OCR сохраняет мои исправления и форматирование?

При загрузке в TXT и DOCX используется исправленный обычный текст, включая изменения после «Умного редактирования». DOCX создает чистый редактируемый текст Word с поддержкой RTL-абзацев для соответствующих языков. После редактирования кнопка «Скачать» повторно генерирует файл Word на нашем сервере без необходимости повторного распознавания. Используйте «Форматированное копирование» в «Умном редактировании» для сохранения заголовков, списков и цветов в формате HTML. Исправление текста не меняет существующий слой поиска в PDF.

Каковы ограничения на файлы и страницы?

Откройте один PDF размером до 50 МБ и до 750 исходных страниц. Защищенные файлы требуют разблокированной копии, если инструмент явно не предлагает ввод пароля. Большие или сложные страницы могут потребовать больше памяти или достичь лимитов обработки, даже если файл находится в пределах этих ограничений.

Где обрабатывается мой документ?

Этот инструмент использует наши серверы для обработки. Ваш исходный файл не перезаписывается; результат — это отдельный файл для скачивания. Просмотрите и проверьте результат, где это доступно, и скачайте нужную копию перед началом работы заново.

Продолжить

Что вы хотите сделать дальше?

Выберите инструмент. Ваш готовый PDF останется с вами.

PDF

Advertisements

Язык распознавания38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina