1Wyślij skanowany PDF documents; czysty skan od szarego kąta 300 DPI daje rozpoznawcy najwięcej do pracy.
2Powiedz, który język można oczekiwać — nazwa języka to lepsze niż to, by zgadnąć o szerokim stopniu.
3Uruchom przepustkę rozpoznawania; słowa są zapisane jako niewidzialna warstwa siedząca nad oryginalnym obrazem strony.
4Pobierz plik wyszukiwalny PDF — wygląda identyczny, ale teraz możesz wyszukać i wybrać tekst w nim.
OCR PDF Często zadawane pytania
Czy format źródła wpływa na rozpoznanie?
+
Tak jest. PDF poprawia stronę: czcionki, wektory, rastrowe obrazy i współrzędne tekstu są zamrożone, tak aby każdy czytelnik widział identyczny układ. Jak przechowywana jest strona decyduje, z jakiej rozdzielczością i kolorem musi pracować rozpoznawca.
Coś konkretnego do PDF?
+
Tak – a PDF to wykres obiektu, a nie obraz strony, więc tekst pozostanie do wyboru i wektory pozostają ostre bez względu na to, co się stanie z zawartością rasteru wewnątrz. To wpływa na to, co widzi rozpoznawca.
Jak OCR PDF przekształca skan w tekst?
+
Konkretnie, Każda strona jest wyświetlana, przebiega przez przepustkę Tesseract tekstu rozpoznawania w ponad 100 językach, a uznane słowa są napisane z powrotem jako niewidzialna warstwa tekstu umieszczona nad oryginalnym obrazem – więc strona wygląda niezmieniona, ale jest wyszukiwana i wybierana. Strona wciąż wygląda dokładnie tak, jak to zrobiła – rozpoznany tekst siedzi niewidzialnie za obrazem, więc wyszukiwanie i selekcja pracy bez zmiany wyglądu.
Jakie języki można rozpoznać?
+
Ponad 100, w tym latyno, cyrylika, grecki, arabski, hebrajski, chiński, japoński, koreańskindyjski skrypt. Mówiąc, który język, aby oczekiwać materialnie poprawia dokładność nad dając jej zgadnąć.
Czy zakładki, linki i formy przetrwają?
+
Określenia, wewnętrzne linki i anotacje są zachowane wszędzie, gdzie to pozwala na operację. Podpisy cyfrowe są wyjątkiem: każda zmiana pliku musi koniecznie unieważnić podpis, ponieważ właśnie to jest podpis.
Co mogę przesłać do OCR PDF?
+
Każdy standardowy PDF, w tym skanerowy, przetwarzacz słowny lub sterownik druku. Obsługuje się pliki z hasłem właściciela, które ograniczają edycję; pliki, które potrzebują hasła użytkownika do otwarcia nie są, i nie próbujemy złamać szyfrowania.
Czy jest limit wielkości pliku na OCR PDF?
+
Tak: bezpłatne konta przetwarzają dokumenty do 5 MB każde, które obejmują większość raportów i kontraktów, ale nie długi dokument skanowany w 600 DPI; Ghostscript i qpdf wykonywają pracę. Skanowane PDF są zwykłą rzeczą, która przewyższa go, a ścisnięcie dokumentu najpierw jest zwykle wystarczające, aby go ponownie podnieść.
Czy OCR PDF obniżyć jakość mojego PDF documents?
+
Tekst i wektorowe grafiki to obiekty, a nie piksele, więc pozostają one doskonale ostre w każdym powiększeniu, nieważne co się stanie. Tylko wbudowane obrazy rasterowe mogą zniższyć, i tylko jeśli operacja wybrała ich przeprodukuje.
WEBP.to jest zbudowane wokół nowoczesnej zamiany obu starych domyślnych: jeden format, który powoduje straty, bez strat, alfa i animację, i niezawodnie ziemi mniej niż JPEG lub PNG pochodzi. Ludzie przybywają tutaj po postanowieniu, że stare domyślne są kosztami ich pasma, a ta decyzja natychmiast podnosi resztę: jaka jaka jakość, co się dzieje z przejrzystością. OCR PDF jest na tym samym koncie i na tym samym koncie, więc te pytania otrzymują odpowiedź w jednym miejscu.
Po ucieczce OCR PDF, co warto zrobić dalej?
+
Konwerter na tej stronie przenosi obrazy do i z WebP, PNG, JPG i AVIF, gdzie zdecyduje się, czy mniejszy plik jest warty stracić starsze przeglądarki. Robienie tego w tym porządku ma znaczenie: wybierz piksele najpierw i pojemnik później, ponieważ pojemnik jest tanią decyzją, a piksele są drogie.
Czy strony rodzeństwa mają coś innego?
+
Silniki są identyczne – te same biblioteki, te same pracownicy, te same czapki. Co innego to opinia, a opinia tutaj leży na własności formatu, po którym ta strona jest nazwana: ten sam.webp rozszerzenie może posiadać traciony ramka VP8, bez straty jeden, lub animację, więc rozsądny ścieżka przetwarzania jest decydowana w pliku zamiast w rozszerzeniu.
Co się dzieje z moim plikiem i czy wymagane jest konto?
+
Nie ma konta, a nic nie jest zatrzymane: przesyłki są usuwane z pracowników wkrótce po zakończeniu pracy, a nic nie jest kontrolowane, wykazywane lub indeksowane. Rachunki istnieją tylko dla historii i rozmiaru partii.