Orodja150

Koristna sprememba v nekaj korakih.

PDF OCR.

Skenirane besede naredite iskalne in ureljive.

Advertisements
Vaš PDF delovni prostor
Obdelava na strežniku
ali spustite datoteke sem
Predogled ostane lokalno. Obdelava začasno naloži vaš PDF. PDF
Advertisements

Kako uporabiti PDF OCR

  1. 01

    Izberite PDF

    Odprite PDF ali poskusite vzorec. Predogled ne naloži vašega dokumenta.

  2. 02

    Izberite pogon in jezik

    Prikažite stran, ki jo potrebujete. Izberite Klasično ali Prihodnost, jezik prepoznavanja in razpoložljiv izhodni format.

  3. 03

    Obdelajte in prenesite

    Prepoznajte to stran, preglejte rezultat in ga prenesite. Druge strani potrebujejo ločene klike.

BlogKako iz skeniranega PDF-ja izvleči besedilo s pomočjo OCRPreberi vodič

Izvlecite besedilo iz PDF, ga preglejte in izboljšajte s pametnim urejanjem

PDF OCR (optična prepoznava znakov) bere besedilo znotraj skeniranih slik PDF, tako da ga lahko kopirate in urejate. Prepoznajte eno stran ali izbrano območje naenkrat, prenesite TXT ali urejevalno besedilo Word in preglejte rezultat ob skenirani sliki. Pametno urejanje pomaga izboljšati besedilo in oblikovanje. Klasična različica ponuja tudi iskalni PDF; prihodnja različica ponuja PDF samo z besedilom v novi postavitvi.

Skenirano stran spremenite v urejevalno besedilo, nato preglejte in izboljšajte rezultat.
HITRA VIDEO VADNICA Kako iz skeniranega PDF-ja izvleči besedilo s pomočjo OCR Izvlecite besede in jih nato izboljšajte. Angleška pripoved Oglejte si video

Kako iz skeniranega PDF-ja izvleči besedilo s pomočjo OCR

Skenirane strani spremenite v uporabno besedilo

Študenti in raziskovalci

Skeniran PDF v besedilo

Izvlecite odlomke iz skeniranih knjig, člankov in zapiskov predavanj za citiranje, študij ali prevajanje. Pred ponovno uporabo primerjajte prepoznano besedilo z virom.

Pisarniško in administrativno delo

Skeniran PDF v Word

Skenirano pismo ali stran poročila spremenite v urejevalno besedilo Word. Preglejte in popravite besedilo, ne da bi vse ponovno tipkali; datoteka Word uporablja novo postavitev.

Zapisi in arhivi

Naredite skeniran PDF iskalen

Uporabite klasično različico za dodajanje iskalnega besedila na izbrano stran ali območje, pri čemer ohranite skenirano sliko. Vsak zagon ustvari rezultat za to stran, ne za celoten dokument.

Ali lahko besedilo že izberete in kopirate? Izvlecite ga neposredno brez OCR:

PDF v besedilo

Funkcije in kontrole

Izvlecite besedilo iz ene strani PDF ali območja

Pomaknite se na stran, izberite njen jezik prepoznavanja in prepoznajte celotno stran ali narisan pravokotnik. Vsaka zahteva obdela eno stran naenkrat.

Izberite območje in pripravite sken

Narišite, premaknite ali spremenite velikost pravokotnika za prepoznavanje v predogledu strani, da izključite nepovezane stolpce ali robove, nato izberite Prepoznaj izbiro. Za obdelavo druge strani se vrnite v delovni prostor, izberite to stran in ponovno zaženite prepoznavanje; to ni paketni OCR celotnega dokumenta.

Nastavite jezik prepoznavanja na dejansko besedilo. Jasne, pokončne skene je lažje prepoznati kot zamegljene ali poševne slike. Prepoznavanje uporablja fiksno ločljivost 200 DPI; ne more obnoviti podrobnosti, ki manjkajo v izvirniku.

Izberite Future ali Classic OCR in ustrezno obliko

Classic dobro deluje za večino tiskanih dokumentov. Future uporablja napredno prepoznavanje z umetno inteligenco, optimizirano za zahtevne skene, nekatere rokopisne dokumente in kompleksna večjezična besedila.

Kateri pogon in izhodno obliko naj izberem?

Classic je dobra izbira za večino tiskanih dokumentov in ponuja postavitve z enim ali več stolpci. Njegov Iskalni PDF ohrani izbrano slikovno območje in doda besedilno plast, poravnano s prepoznanimi besedami za iskanje in izbiro.

Future je privzeta izbira za podprte jezike. Njegovo napredno prepoznavanje z umetno inteligenco je optimizirano za zahtevne skene, nekatere rokopisne dokumente in kompleksna večjezična besedila. Rezultati rokopisa so odvisni od čitljivosti in kakovosti skena, zato primerjajte prepoznano besedilo z izvirno sliko. Njegov Preprost PDF vsebuje besedilo, ki ga je mogoče izbrati, v novi postavitvi, namesto da bi ohranil izvirno sliko. Jeziki, ki jih Future ne podpira, uporabljajo Classic.

Oba pogona ponujata TXT in pravi Wordov dokument (.docx) s čistim, urejevalnim besedilom in oblikovanjem od desne proti levi, kjer je to primerno. Izberite jezik prepoznavanja, ki ustreza vašemu dokumentu.

Glavni gumb Prenos shrani obliko, izbrano v Nastavitvah. Povezave PDF, TXT in Word pod njim ponujajo druge oblike iz istega postopka prepoznavanja. V Nastavitvah izberite TXT ali Word (DOCX), da odprete plošči z izvirno sliko in urejevalnim besedilom, vključno s Pametnim urejanjem. Izbira PDF odpre predogled in prenos PDF.

Primerjajte izvirno sliko z urejevalnim OCR besedilom

Za rezultate TXT in DOCX preglejte prepoznano besedilo poleg izvirne slike. Popravite ga neposredno ali odprite Pametno urejanje poleg Kopiraj.

Povečava slike, popravki in kopiranje

Plošča z virom prikazuje celotno stran. Ko prepoznate izbrano območje, je preostanek strani zbledel, modra obroba pa označuje izbiro. Povečajte, da pregledate majhne znake, in uporabite Prilagodi, da ponovno vidite celotno stran. Primerjajte imena, številke, ločila in vrstni red branja s sliko.

Popravki v urejevalnem rezultatu posodobijo glavni prenos TXT ali DOCX. Kopiraj poleg besedila kopira trenutni rezultat s kratkim učinkom bledenja. Pametno urejanje odpre večje okno za dejanja umetne inteligence in oblikovanje. Spremembe besedila ne spremenijo izvirne slike in ne popravijo predhodno ustvarjene plasti iskalnega PDF.

Povzemite, parafrazirajte, popravite slovnico ali predlagajte naslov

V Pametnem urejanju izberite dejanje umetne inteligence in izberite Uporabi. Označite odlomek, na katerem želite delati, ali pustite vse neizbrano, da uporabite celoten urejevalnik.

Dejanja umetne inteligence, izbira in omejitve zahtev

Povzemi besedilo zgosti odlomek, Parafraziraj besedilo ga prepiše, Popravi slovnico pa zahteva jezikovne popravke. Ta dejanja zamenjajo izbrani odlomek ali, če ni nič izbrano, celotno vsebino urejevalnika. Predlagaj naslov doda naslov nad dokumentom; izbrani odlomek lahko usmeri naslov, ne da bi odstranil telo besedila.

Vsaka zahteva za umetno inteligenco sprejme do 600 besed in 12.000 znakov, z omejitvijo zahteve 64 KB UTF-8. Izberite krajši odlomek, če dolg rezultat presega te omejitve. Dejanja umetne inteligence pošljejo to besedilo na naše strežnike le, ko izberete Uporabi in zahtevate izhod v istem jeziku.

Preden jih obdržite, preglejte predlagane spremembe. Umetna inteligenca lahko izpusti podrobnosti, spremeni pomen ali vnese napake, zlasti če vnos vsebuje napake pri prepoznavanju. Razveljavi vrne na prejšnjo različico. Glavni rezultat se posodobi šele po Uporabi sprememb; samo zagon dejanja umetne inteligence ga ne zamenja.

Oblikujte besedilo v naprednem ali preprostem urejevalniku

Dodajte naslove, sezname, poudarke in smer besedila v Naprednem urejevalniku ali uporabite Preprost urejevalnik za spremembe navadnega besedila.

Spremembe tipografije, postavitve in oblikovanja

Napredni urejevalnik ponuja odstavke in tri ravni naslovov, pisave brez serifov, s serifi in s fiksno širino, velikost pisave, krepko, ležeče in podčrtano. Nastavite barvo besedila ali označevanje, uporabite označene ali oštevilčene sezname, prilagodite poravnavo in izberite samodejno smer, od desne proti levi ali od leve proti desni. Počisti oblikovanje odstrani sloge za preprostejši rezultat.

Oblikovanje poteka v vašem brskalniku. Preklop na Preprost urejevalnik sam po sebi ne zavrže naprednega dokumenta; urejanje njegovega navadnega besedila odstrani oblikovanje. Zamenjave z umetno inteligenco vstavijo neoblikovano besedilo na prizadeto območje, zato končno oblikovanje uporabite po pregledu besedila.

Uporabite oblikovano kopijo (Formatted copy), da ohranite to oblikovanje pri prenosu v formatu HTML. Kopiranje in uveljavitev sprememb preneseta golo besedilo. Oblikovanje rezultata ne spremeni pisav, postavitve strani ali besedilne plasti izvirnega PDF-ja.

Očistite znake in obnovite prejšnje besedilo

Odstranite naglase in samoglasniške znake, normalizirajte oblike števk ali uporabite Razveljavi, Ponovi in Obnovi za pregled svojih popravkov.

Lokalno čiščenje, zgodovina in obnavljanje rezultata

Odstranjevanje naglasov in samoglasniških znakov odstrani latinične naglase in pogoste arabske samoglasniške znake iz izbranega odlomka ali celotnega urejevalnika. Normalizacija številk standardizira oblike zahodnih, arabskih ali perzijskih števk glede na pisavo besedila; to ne spremeni njihovih številskih vrednosti. Ta dejanja čiščenja se izvajajo lokalno v vašem brskalniku.

Razveljavi in Ponovi vam omogočata pregled korakov urejanja, vključno s spremembami umetne inteligence. Obnovi OCR besedilo ali Obnovi prevod vrne urejevalnik na prvotni rezultat obdelave. To obnovitev lahko tudi razveljavite. Prekliči zapre okno, ne da bi uveljavil trenutne spremembe v glavnem rezultatu.

Pametno urejanje (Smart edit) je delovni urejevalnik in ne shranjen projekt. Prenesite poljubno besedilo ali oblikovano kopijo, ki jo potrebujete, preden ponovno naložite stran ali začnete znova.

Shranite popravljeno OCR besedilo ali oblikovano kopijo

Uveljavi spremembe posodobi rezultat v formatu TXT ali Word (DOCX). Oblikovana kopija shrani vaše oblikovanje iz Pametnega urejanja kot ločeno datoteko HTML.

Kaj vsebuje posamezen prenos

TXT vsebuje trenutno golo besedilo. Wordov dokument (.docx) je pristna datoteka Word, ki jo je mogoče urejati, ustvarjena s čistim besedilom ter oblikovanjem odstavkov in besedila od desne proti levi za jezike RTL. Po popravkih besedila ali spremembah v Pametnem urejanju, Prenos pošlje trenutno besedilo na naš strežnik, da ponovno ustvari datoteko Word brez ponavljanja OCR. Datoteka Word ne poustvari postavitve skeniranja in ne ohrani bogatega oblikovanja Pametnega urejanja.

Za naslove, barve, sezname in drugo oblikovanje Pametnega urejanja izberite Oblikovano kopijo znotraj urejevalnika. Prenese se HTML, ki ga lahko odprete v brskalniku in natisnete s kontrolniki za tiskanje brskalnika. To je dodaten besedilni dokument, ne iskalni PDF ali urejen izvirni sken.

Pametno urejanje sprejme do 100.000 znakov v urejevalniku; posamezna dejanja umetne inteligence imajo manjše omejitve, opisane zgoraj. Če ste v nastavitvah OCR izbrali izhod PDF, uporabite ta ločen predogled PDF in prenos. Izberite rezultat prepoznavanja TXT ali DOCX, ko želite popravke besedila s Pametnim urejanjem.

Podprte datoteke in obdelava

Vhod
PDF
Izhod
TXT, DOCX, PDF, HTML

Odprite en PDF do 50 MB in 750 strani. Za kompleksne dokumente lahko veljajo dodatne omejitve izhoda, pomnilnika in obdelave.

Vir lahko vsebuje do 750 strani, vendar vsaka zahteva obdela le eno stran.

Obdelava uporablja naše strežnike. Izvorne datoteke, začasne datoteke in rezultati se izbrišejo z naših strežnikov v 30 minutah po končani obdelavi. Vsebine dokumentov ne delimo s tretjimi osebami in jih ne uporabljamo za usposabljanje modelov umetne inteligence.

Advertisements
Pogosta vprašanja

Pogosta vprašanja

Obrežite strani PDF in odstranite bele robove.

Obdelava na strežniku
Kako lahko izvlečem besedilo iz skeniranega PDF-ja?

Odprite svoj PDF, izberite stran in jezik prepoznavanja ter prilagodite pravokotnik, če potrebujete le del strani. Zaženite OCR, nato izberite TXT ali Word, da kopirate, pregledate in uredite prepoznano besedilo. OCR bere besede znotraj skenirane slike; vsaka zahteva obdela eno stran ali izbrano območje.

Ali lahko skeniran PDF pretvorim v ureljiv Wordov dokument?

Da. Future in Classic zagotavljata Wordov dokument (.docx) z ureljivim besedilom iz izbrane strani ali območja, vključno z oblikovanjem od desne proti levi za jezike RTL. Pred prenosom preglejte prepoznane besede in popravite morebitne napake. Wordova datoteka uporablja novo postavitev besedila; ne poustvari izvirnih tabel, slik ali zasnove strani.

Ali potrebujem OCR, če moj PDF že vsebuje izbirno besedilo?

Običajno ne. Če lahko besede pravilno izberete in kopirate, uporabite PDF to Text za izvleček obstoječega besedila brez prepoznavanja. OCR je koristen za skenirane slike ali strani, katerih obstoječe besedilo se kopira nepravilno. Najprej preverite kopirane besede, da izberete pravo orodje.

Ali PDF OCR obdela celoten dokument naenkrat?

Ne. Vsak zagon prepozna eno izbrano stran PDF ali en pravokotnik na tej strani pri 200 DPI. Izberite drugo stran in ponovno zaženite OCR za nadaljevanje. Izvorni PDF lahko vsebuje do 750 strani, vendar je to omejitev nalaganja, ne paket OCR za celoten dokument.

Kakšna je razlika med Future in Classic OCR?

Classic dobro deluje za večino natisnjenih dokumentov. Future uporablja napredno prepoznavanje z umetno inteligenco, optimizirano za zahtevna skeniranja, nekatere rokopise in kompleksna večjezična besedila, in je privzeta izbira za podprte jezike. Rezultati rokopisa so odvisni od čitljivosti in kakovosti skeniranja. Oba pogona ponujata TXT in Word (.docx), z oblikovanjem od desne proti levi, kjer je to primerno. Classic ustvari tudi iskalni PDF, ki ohrani izvorno sliko in poravnano besedilno plast; Future ustvari preprost PDF samo z besedilom z novo postavitvijo.

Ali lahko popravim prepoznano besedilo poleg izvorne slike?

Da. Pri rezultatih TXT in Word izvorna plošča prikazuje celotno stran poleg besedila, ki ga je mogoče urejati. Modra obroba označuje prepoznano območje, preostanek strani pa je zatemnjen. Povečajte, da preverite imena, številke in ločila, ali uporabite funkcijo Prilagodi za ponovni ogled celotne strani.

Kaj lahko Smart edit naredi z mojim besedilom?

Lahko povzema, parafrazira, popravlja slovnico ali predlaga naslov ter ponuja oblikovanje, čiščenje, razveljavitev in ponovitev. Izberite odlomek ali uporabite celotno besedilo. Dejanja umetne inteligence se izvedejo, ko kliknete Uporabi, in sprejmejo do 600 besed ter 12.000 znakov na zahtevo. Preglejte rezultat in nato izberite Uporabi spremembe za posodobitev glavnega besedila. Oblikovana kopija prenese HTML; Kopiraj in Uporabi spremembe preneseta golo besedilo.

Kateri prenos OCR ohrani moje popravke in oblikovanje?

Prenosi TXT in DOCX uporabljajo popravljeno golo besedilo, vključno z Uporabi spremembe v Smart edit. DOCX ustvari čisto, urejevalno Wordovo besedilo z odstavki RTL za jezike RTL. Po urejanju Prenos ponovno ustvari Wordovo datoteko na našem strežniku brez ponavljanja prepoznavanja. Uporabite Oblikovano kopijo v Smart edit za naslove, sezname in barve kot HTML. Popravki besedila ne spremenijo obstoječe iskalne plasti PDF.

Kakšne so omejitve datotek in strani?

Odprite en PDF do 50 MB in 750 izvornih strani. Zaščitene datoteke potrebujejo odklenjeno kopijo, razen če to orodje izrecno ponuja vnos gesla. Velike ali zapletene strani lahko zahtevajo več pomnilnika ali dosežejo omejitve obdelave, tudi če je datoteka znotraj teh omejitev.

Kje se moj dokument obdeluje?

To orodje za obdelavo uporablja naše strežnike. Vaša izvirna datoteka ni prepisana; rezultat je ločen prenos. Predogled in pregled rezultatov sta na voljo, kjer je to mogoče, kopijo pa prenesite, preden začnete znova.

Nadaljuj

Kaj želite storiti naslednje?

Izberite orodje. Vaš končani PDF gre z vami.

PDF

Advertisements

Jezik prepoznave38

English العربية Français Italiano Deutsch Español Português Nederlands Русский Türkçe 日本語 中文 हिन्दी Bahasa Indonesia Bahasa Melayu 한국어 Tiếng Việt ไทย Polski Svenska Українська Norsk বাংলা Ελληνικά فارسی اردو Čeština Dansk Magyar Română Suomi Български Filipino ქართული Slovenčina Azərbaycanca עברית Slovenščina