Отсканированный PDF в текст
Извлекайте фрагменты из отсканированных книг, статей и конспектов лекций для цитирования, изучения или перевода. Сравните распознанный текст с исходником перед повторным использованием.
Сделайте сканированные слова доступными для поиска и редактирования.
Перетащите курсор по странице, чтобы выбрать область. Перемещайте или изменяйте размер рамки; клавиши со стрелками перемещают её, а Shift + стрелки — изменяют размер.
Выберите всю страницу или выделите, переместите и измените размер рамки вокруг нужного текста. Каждый клик обрабатывает только это выделение.
Ваш результат готов. Скачайте копию или вернитесь, чтобы изменить настройки.
Откройте PDF или попробуйте образец. Предпросмотр не загружает ваш документ.
Откройте нужную страницу. Выберите «Классический» или «Будущий», язык распознавания и доступный формат вывода.
Распознайте эту страницу, проверьте результат и скачайте его. Другие страницы требуют отдельных нажатий.
PDF OCR (оптическое распознавание символов) считывает текст внутри отсканированных изображений PDF, чтобы вы могли его скопировать и отредактировать. Распознавайте по одной странице или выбранной области за раз, скачивайте TXT или редактируемый текст Word и проверяйте результат рядом со сканом. Smart edit помогает улучшить формулировки и форматирование. Версия «Классическая» также предлагает PDF с возможностью поиска; версия «Будущее» предлагает PDF только с текстом в новой верстке.
Извлекайте фрагменты из отсканированных книг, статей и конспектов лекций для цитирования, изучения или перевода. Сравните распознанный текст с исходником перед повторным использованием.
Превратите отсканированное письмо или страницу отчета в редактируемый текст Word. Проверяйте и исправляйте формулировки без необходимости перепечатывать все заново; файл Word использует новую верстку.
Используйте «Классическую» версию, чтобы добавить текст с возможностью поиска на выбранную страницу или область, сохранив при этом исходное изображение. Каждое действие создает результат для конкретной страницы, а не для всего документа.
Вы уже можете выделить и скопировать текст? Извлеките его напрямую без OCR:
PDF в текстПерейдите на страницу, выберите язык распознавания и распознайте всю страницу или нарисованный прямоугольник. Каждый запрос обрабатывает по одной странице за раз.
Нарисуйте, переместите или измените размер прямоугольника распознавания в предварительном просмотре страницы, чтобы исключить посторонние столбцы или поля, затем выберите «Распознать выделенное». Чтобы обработать другую страницу, вернитесь в рабочую область, выберите эту страницу и снова запустите распознавание; это не пакетное OCR для всего документа.
Установите язык распознавания, соответствующий тексту. Четкие, прямые сканы распознаются легче, чем размытые или перекошенные изображения. Распознавание использует фиксированные 200 DPI; оно не может восстановить детали, отсутствующие в оригинале.
Classic хорошо работает для большинства печатных документов. Future использует продвинутое распознавание на базе ИИ, оптимизированное для сложных сканов, некоторых рукописных документов и сложного многоязычного текста.
Classic — хороший выбор для большинства печатных документов, поддерживает одноколоночные или многоколоночные макеты. Его «Поисковый PDF» сохраняет выбранную область изображения и добавляет текстовый слой, выровненный по распознанным словам, для поиска и выделения.
Future — это выбор по умолчанию для поддерживаемых языков. Его продвинутое распознавание на базе ИИ оптимизировано для сложных сканов, некоторых рукописных документов и сложного многоязычного текста. Результаты распознавания рукописного текста зависят от разборчивости и качества сканирования, поэтому сравнивайте распознанный текст с исходным изображением. Его «Простой PDF» содержит выделяемый текст в новом макете вместо сохранения исходного изображения. Языки, не поддерживаемые Future, используют Classic.
Оба движка поддерживают TXT и полноценные документы Word (.docx) с чистым редактируемым текстом и, при необходимости, форматированием справа налево. Выберите язык распознавания, соответствующий вашему документу.
Основная кнопка «Скачать» сохраняет формат, выбранный в настройках. Ссылки на PDF, TXT и Word под ней позволяют получить другие форматы после того же сеанса распознавания. Выберите TXT или Word (DOCX) в настройках, чтобы открыть панели исходного изображения и редактируемого текста, включая «Умное редактирование». Выбор PDF открывает предварительный просмотр и загрузку PDF.
Для результатов в формате TXT и DOCX сверяйте распознанный текст с исходным изображением. Исправляйте его напрямую или откройте «Умное редактирование» рядом с кнопкой «Копировать».
На панели источника отображается вся страница. При распознавании выбранной области остальная часть страницы затемняется, а выделение обозначается синим контуром. Увеличьте масштаб, чтобы рассмотреть мелкие символы, и используйте «По размеру», чтобы снова увидеть всю страницу. Сверяйте имена, цифры, пунктуацию и порядок чтения с изображением.
Исправления в редактируемом результате обновляют основной файл TXT или DOCX для скачивания. Кнопка «Копировать» рядом с текстом копирует текущий результат с кратким эффектом затухания. «Умное редактирование» открывает увеличенное окно для работы с ИИ и форматирования. Изменения текста не влияют на исходное изображение и не исправляют ранее созданный слой PDF с возможностью поиска.
В «Умном редактировании» выберите действие ИИ и нажмите «Применить». Выделите фрагмент для работы с ним или оставьте поле пустым, чтобы применить действие ко всему тексту в редакторе.
«Краткое содержание» сокращает текст, «Перефразировать» переписывает его, а «Исправить грамматику» предлагает языковые правки. Эти действия заменяют выделенный фрагмент или, если ничего не выделено, всё содержимое редактора. «Предложить заголовок» добавляет заголовок над документом; выделенный фрагмент может помочь в создании заголовка, не удаляя основной текст.
Каждый запрос к ИИ принимает до 600 слов и 12 000 символов при ограничении запроса в 64 КБ в кодировке UTF-8. Выберите более короткий фрагмент, если длинный результат превышает эти лимиты. Действия ИИ отправляют текст на наши серверы только после нажатия кнопки «Применить» при запросе вывода на том же языке.
Проверяйте предложенные изменения перед их сохранением. ИИ может опускать детали, искажать смысл или допускать ошибки, особенно если исходный текст содержит ошибки распознавания. «Отменить» возвращает к предыдущей версии. Основной результат обновляется только после нажатия «Применить изменения»; простое выполнение действия ИИ не заменяет его.
Добавляйте заголовки, списки, выделение и направление текста в расширенном редакторе или используйте простой редактор для внесения правок в обычный текст.
Расширенный редактор поддерживает абзацы, три уровня заголовков, шрифты с засечками, без засечек и моноширинные шрифты, размер шрифта, полужирное, курсивное и подчеркнутое начертание. Устанавливайте цвет текста или выделение, используйте маркированные или нумерованные списки, настраивайте выравнивание и выбирайте направление текста (автоматическое, справа налево или слева направо). «Очистить форматирование» удаляет стили для получения более простого результата.
Форматирование происходит в вашем браузере. Переключение на простой редактор само по себе не удаляет расширенный документ; редактирование его обычного текста убирает форматирование. Замены, выполненные ИИ, вставляют неформатированный текст в затронутую область, поэтому применяйте финальное оформление после проверки формулировок.
Используйте «Форматированное копирование», чтобы сохранить это оформление в HTML-файле. «Копировать» и «Применить изменения» переносят обычный текст. Форматирование результата не меняет шрифты, макет страницы или текстовый слой исходного PDF.
Удаляйте акценты и огласовки, нормализуйте начертание цифр или используйте «Отменить», «Повторить» и «Восстановить» для возврата к предыдущим правкам.
«Удалить акценты и огласовки» убирает латинские диакритические знаки и арабские огласовки из выбранного фрагмента или всего текста. «Нормализовать числа» приводит начертание западных, арабских или персидских цифр к стандарту в соответствии со скриптом текста; это не меняет их числовые значения. Эти действия по очистке выполняются локально в вашем браузере.
«Отменить» и «Повторить» позволяют просматривать шаги редактирования, включая изменения ИИ. «Восстановить текст OCR» или «Восстановить перевод» возвращает редактор к исходному результату обработки. Вы также можете отменить это восстановление. «Отмена» закрывает окно без применения текущих изменений к основному результату.
«Умное редактирование» — это рабочий инструмент, а не сохраненный проект. Скачайте нужный текст или форматированную копию перед перезагрузкой страницы или началом работы заново.
«Применить изменения» обновляет результат в формате TXT или Word (DOCX). «Форматированная копия» сохраняет стили «Умного редактирования» как отдельный HTML-файл.
TXT содержит текущий обычный текст. Документ Word (.docx) — это полноценный редактируемый файл Word, созданный с чистым текстом и форматированием абзацев и текста справа налево для соответствующих языков. После исправления текста или изменений в «Умном редактировании» кнопка «Скачать» отправляет текущий текст на наш сервер для повторной генерации файла Word без повторного OCR. Файл Word не воссоздает макет скана и не сохраняет богатое оформление «Умного редактирования».
Для заголовков, цветов, списков и другого форматирования «Умного редактирования» выберите «Форматированная копия» внутри редактора. Она загружает HTML-файл, который можно открыть в браузере и распечатать с помощью стандартных средств печати браузера. Это дополнительный текстовый документ, а не PDF с возможностью поиска или отредактированный скан источника.
«Умное редактирование» поддерживает до 100 000 символов в редакторе; для отдельных действий ИИ действуют меньшие ограничения, описанные выше. Если вы выбрали вывод в PDF в настройках OCR, используйте отдельный предварительный просмотр и загрузку PDF. Выбирайте результат распознавания TXT или DOCX, если вам нужны исправления текста с помощью «Умного редактирования».
Откройте один PDF-файл размером до 50 МБ и объемом до 750 страниц. Для сложных документов могут применяться дополнительные ограничения по объему выходного файла, памяти и обработке.
Исходный файл может содержать до 750 страниц, но каждый запрос обрабатывает только одну страницу.
Обработка выполняется на наших серверах. Исходные файлы, временные файлы и результаты удаляются с наших серверов в течение 30 минут после завершения обработки. Мы не передаем содержимое документов третьим лицам и не используем их для обучения ИИ-моделей.
Несколько ответов перед началом работы.
Обработка на сервереОткройте PDF, выберите страницу и язык распознавания, при необходимости настройте прямоугольник, если нужна только часть страницы. Запустите OCR, затем выберите TXT или Word, чтобы скопировать, проверить и отредактировать распознанный текст. OCR считывает слова внутри отсканированного изображения; каждый запрос обрабатывает одну страницу или выбранную область.
Да. И Future, и Classic предоставляют документ Word (.docx) с редактируемым текстом из выбранной страницы или области, включая поддержку форматирования справа налево (RTL) для соответствующих языков. Проверьте распознанные слова и исправьте ошибки перед скачиванием. Файл Word использует новую верстку текста; он не воссоздает исходные таблицы, изображения или дизайн страницы.
Обычно нет. Если вы можете правильно выделить и скопировать слова, используйте «PDF в текст» для извлечения существующего текста без распознавания. OCR полезен для сканов, состоящих только из изображений, или страниц, где текст копируется некорректно. Сначала проверьте скопированные слова, чтобы выбрать подходящий инструмент.
Нет. Каждое выполнение распознает одну выбранную страницу PDF или один прямоугольник на этой странице с разрешением 200 DPI. Выберите другую страницу и запустите OCR снова, чтобы продолжить. Исходный PDF может содержать до 750 страниц, но это лимит загрузки, а не пакетная обработка всего документа.
«Классический» хорошо работает для большинства печатных документов. «Будущее» использует продвинутое распознавание на базе ИИ, оптимизированное для сложных сканов, некоторых рукописных документов и сложного многоязычного текста; это профиль по умолчанию для поддерживаемых языков. Результаты распознавания рукописного текста зависят от разборчивости и качества скана. Оба движка предлагают форматы TXT и Word (.docx) с поддержкой форматирования справа налево там, где это уместно. «Классический» также создает «PDF с возможностью поиска», который сохраняет исходное изображение и выровненный текстовый слой; «Будущее» создает «Простой PDF» только с текстом и новой версткой.
Да. Для результатов в TXT и Word панель источника показывает полную страницу рядом с редактируемым текстом. Синий контур отмечает распознанную область, а остальная часть страницы затемнена. Увеличьте масштаб, чтобы проверить имена, цифры и пунктуацию, или используйте «По размеру», чтобы снова увидеть всю страницу.
Инструмент позволяет создавать краткое содержание, перефразировать текст, исправлять грамматику, предлагать заголовки, а также поддерживает форматирование, очистку, отмену и повтор действий. Выделите фрагмент или используйте весь текст целиком. ИИ-функции запускаются при нажатии кнопки «Применить» и обрабатывают до 600 слов и 12 000 символов за запрос. Проверьте результат и выберите «Применить изменения» для обновления основного текста. «Форматированное копирование» загружает HTML, а «Копировать» и «Применить изменения» переносят обычный текст.
При загрузке в TXT и DOCX используется исправленный обычный текст, включая изменения после «Умного редактирования». DOCX создает чистый редактируемый текст Word с поддержкой RTL-абзацев для соответствующих языков. После редактирования кнопка «Скачать» повторно генерирует файл Word на нашем сервере без необходимости повторного распознавания. Используйте «Форматированное копирование» в «Умном редактировании» для сохранения заголовков, списков и цветов в формате HTML. Исправление текста не меняет существующий слой поиска в PDF.
Откройте один PDF размером до 50 МБ и до 750 исходных страниц. Защищенные файлы требуют разблокированной копии, если инструмент явно не предлагает ввод пароля. Большие или сложные страницы могут потребовать больше памяти или достичь лимитов обработки, даже если файл находится в пределах этих ограничений.
Этот инструмент использует наши серверы для обработки. Ваш исходный файл не перезаписывается; результат — это отдельный файл для скачивания. Просмотрите и проверьте результат, где это доступно, и скачайте нужную копию перед началом работы заново.
КРАТКИЙ ВИДЕОУРОК
Как извлечь текст из отсканированного PDF с помощью OCR
Извлеките слова, а затем отредактируйте их.
Английская озвучка
Смотреть видео