1Nahrajte naskenovaný PDF documents; čistý 300 DPI šedý sken dává rozpoznávači nejvíce pracovat.
2Řekni mu, který jazyk očekávat? jméno jazyk beats nechat ho hádat o široké rozpětí.
3Spusťte rozpoznávací pas; slova jsou napsána zpět jako neviditelná vrstva, která sedí nad originálním obrazem stránky.
4Stáhněte si vyhledávací soubor PDF? vypadá stejně, ale nyní můžete hledat a vyberte text v něm.
OCR PDF Často kladené otázky
Ovlivňuje zdrojový formát rozpoznávání?
+
To ano. PDF opraví stránku: písma, vektory, rastrové obrázky a textové souřadnice jsou zmraženy, takže každý čtenář vidí stejné rozložení. Jak je stránka uložena, rozhoduje o tom, s jakým rozlišením a barevnými informacemi musí rozpoznávač pracovat.
Něco konkrétního pro PDF tady?
+
Ano, PDF je graf objektu, ne obrázek stránky, takže text zůstane volitelný a vektory zůstanou ostré bez ohledu na to, co se stane s rastrovým obsahem uvnitř. To ovlivňuje to, co rozpoznávač může vidět.
Jak se OCR PDF změní skenování na text?
+
Konkrétně každá stránka je překreslena, prochází textem rozpoznávacím průchodem Teseract ve více než 100 jazycích a uznávaná slova jsou napsána zpět jako neviditelná textová vrstva umístěná nad původním obrazem?? takže stránka vypadá nezměněná, ale je vyhledávatelná a volitelná. Stránka stále vypadá přesně tak, jak to udělal? uznávaný text sedí neviditelně za obrazem, takže hledání a výběr práce bez změny vzhledu.
Které jazyky může rozpoznat?
+
Více než 100, včetně latinsky, cyrilice, řečtina, arabsky, hebrejsky, čínština, japonština, korejština a indičtí skripty. Řekněte mu, který jazyk má očekávat, že podstatně zlepší přesnost nad tím, aby to hádal.
Přežívají záložky, odkazy a tvarová pole?
+
Výjimkou jsou mimořádky, interní odkazy a anotace. Digitální podpisy: každá změna souboru nutně zneplatňuje podpis, protože právě k tomu je podpis.
Co mohu nahrát do OCR PDF?
+
Jakýkoli standardní PDF, včetně těch, které jsou vyrobeny skenerem, textovým procesorem nebo tiskovým ovladačem. Soubory s heslem majitele, které omezují pouze editaci, jsou řešeny; soubory, které potřebují uživatelské heslo k otevření, nejsou, a my se nepokoušíme rozbít šifrování.
Existuje limit velikosti souboru na OCR PDF?
+
Ano: volné účty zpracovávají dokumenty až do 5 MB každý, který pokrývá většinu zpráv a smluv, ale ne dlouho skenované dokument na 600 DPI; Ghostscript a qpdf dělat práci. Skenované PDF jsou obvyklá věc, která ji přesahuje, a stlačování dokumentu první je obvykle dost na to, aby ho zpět pod.
Sníží OCR PDF kvalitu mé PDF documents?
+
Text a vektorové umění jsou spíše objekty než pixely, takže zůstávají perfektně ostré v každém zoomu bez ohledu na to, co se stane. Pouze vložené rastrové obrázky mohou degradovat, a pouze pokud operace, kterou jste si vybrali, je znovu ochutná.
Proč by se moderní format stránky běžet OCR PDF?
+
WEBP.to je postaven kolem moderní náhrady za oba staré výchozí hodnoty: jeden formát, který dělá ztrátové, bez ztrát, alfanimace, a spolehlivě země menší než JPEG nebo PNG to pochází. Lidé sem přicházejí, když se rozhodli, že staré selhání je stojí šířku pásma, a toto rozhodnutí okamžitě zvyšuje zbytek: jaká velikost, jaká kvalita, co se stane s transparentností. OCR PDF je na stejném nahrávání a na stejném účtu, takže tyto otázky dostane odpovědi na jednom místě.
Jakmile OCR PDF uteče, co stojí za to dělat dál?
+
Převodník na těchto stránkách přesune obrázky do a z WebP, PNG, JPG a AVIF, kde se rozhodnete, zda menší soubor stojí za ztrátu starších prohlížečů. Udělat to v tomto pořadí záleží: nejprve vyberte pixely a poté kontejner, protože kontejner je levné rozhodnutí a pixely jsou drahé.
Provádějí tyhle stránky něco jiného?
+
Motory jsou stejné knihovny, stejné dělníky, stejné čepice. Co je odlišné je názor připojen, a názor zde spočívá na majetku formátu, který je pojmenován po: stejné.webp rozšíření může držet ztrátový VP8 rámec, bezztrátový jeden, nebo animace, takže rozumná cesta zpracování je rozhodnuto pro soubor, spíše než pro prodloužení.
Co se stane s mou složkou a je nutné mít účet?
+
Žádný účet, a nic není zachováno: nahrávky jsou vymazány z pracovníků krátce po dokončení práce, a nic není zkontrolováno, uvedeno nebo indexováno. Účty existují pouze pro historii a velikost šarže.