1Lataa skannattu PDF documents; puhtaan 300 DPI-harmaaskaalaskannauksen avulla tunnistaja voi työskennellä eniten.
2Kerro, mitä kieltä voit odottaa: kielen nimeäminen voittaa sen arvaamisen suurella erolla.
3Suorita tunnustuskortti; sanat kirjoitetaan takaisin alkuperäisen sivun kuvan päälle istuvana näkymättömänä kerroksena.
4Lataa hakukelpoinen PDF tiedosto – se näyttää samalta, mutta voit nyt etsiä ja valita sen tekstin.
OCR-PDF Usein kysytyt kysymykset
Vaikuttaako lähdemuoto tunnistamiseen?
+
Se tekee. PDF korjaa sivun: fontit, vektorit, rasterikuvat ja tekstikoordinaatit ovat jäässä, joten jokainen lukija näkee samanlaisen asettelun. Miten sivu tallennetaan, päättää, minkä resoluution ja väritietojen kanssa tunnistajalla on tehtävä töitä.
Mitään erityistä PDF tässä?
+
Kyllä – PDF on objektigraafi, ei sivukuva, joten teksti pysyy valittavissa ja vektorit pysyvät terävinä riippumatta siitä, mitä sen sisällä olevalle rasterisisällölle tapahtuu. Se vaikuttaa siihen, mitä tunnistaja näkee.
Miten OCR PDF muuttaa skannauksen tekstiksi?
+
Käytännössä Jokainen sivu käännetään, käydään läpi Tesseractin tekstitunnistuskortti yli sadalla kielellä, ja tunnetut sanat kirjoitetaan takaisin alkuperäisen kuvan päälle sijoitettuna näkymättömänä tekstikerroksena – joten sivu näyttää muuttumattomalta, mutta on hakukelpoinen ja valittavissa. Sivu näyttää edelleen aivan samalta kuin se teki – tunnustettu teksti istuu kuvan takana näkymättömänä, joten etsi ja valitse työ ilman, että ulkonäkö muuttuu.
Mitä kieliä se voi tunnistaa?
+
Yli sata, mukaan lukien latina, kyrilli, kreikka, arabia, heprea, kiina, japani, korea ja indic-kirjoitukset. Kertomalla, mitä kieltä odottaa, se parantaa aineellisesti tarkkuutta sen sijaan, että antaisi arvauksen.
Selviävätkö kirjanmerkit, linkit ja muotokentät?
+
Esiviivat, sisäiset linkit ja merkinnät säilytetään aina, kun se on toiminnan mahdollista. Digitaaliset allekirjoitukset ovat poikkeus: kaikki muutokset tiedostoon mitätöivät allekirjoituksen, koska se on juuri sitä varten.
Mitä voin ladata OCR PDF-palveluun?
+
Kaikki vakiomuotoiset PDF-tiedostot, mukaan lukien skannerin, sanaprosessorin tai tulostusajurin tuottamat. Tiedostot, joissa on omistajan salasana, joka vain rajoittaa muokkausta, käsitellään; tiedostot, jotka tarvitsevat käyttäjän salasanan avataksemme, eivät ole, emmekä yritä murtaa salausta.
Onko tiedostokokoraja OCR PDF?
+
Kyllä: Ilmaistilit käsittelevät asiakirjoja aina 5 MB asti, mikä kattaa useimmat raportit ja sopimukset, mutta ei pitkää skannattua asiakirjaa 600 DPI:ssä; Ghostscript ja qpdf tekevät työn. Skannatut PDF-muodossa olevat ovat tavallista suurempi asia, ja asiakirjan pakkaaminen ensin riittää yleensä palauttamaan sen alle.
Alentaako OCR PDF minun PDF documents laatuani?
+
Teksti- ja vektoritaide ovat kohteita pikseleiden sijaan, joten ne pysyvät täysin terävinä missä tahansa zoomissa, tapahtui mitä tahansa. Vain upotetut rasterikuvat voivat hajota, ja vain jos valitsemasi operaatio ottaa niistä uudelleen näytteen.
Miksi modernin muotoisen sivuston käyttö OCR PDF?
+
WEBP.to rakentuu modernin korvaajan ympärille molemmille vanhoille olettamuksille: yksi formaatti, joka tekee häviöllisiä, häviöttömiä, alfa- ja animaatioita ja laskeutuu luotettavasti pienemmälle tasolle kuin JPEG tai PNG, josta se tuli. Ihmiset saapuvat tänne päätettyään, että vanhat oletukset maksavat heille kaistanleveyden, ja tämä päätös nostaa välittömästi loput: mikä koko, mikä laatu, mitä avoimuudelle tapahtuu. OCR PDF on samalla ladattavalla ja samalla tilillä, joten kysymyksiin vastataan yhdessä paikassa.
Kun OCR PDF on karannut, mitä kannattaa tehdä seuraavaksi?
+
Tällä sivustolla oleva muunnin siirtää kuvia WebP:hen, PNG:hen, JPG:hen ja AVIF:ään, jolloin päätät, kannattaako pienempi tiedosto menettää vanhemmilla selaimilla. Kun teet sen siinä järjestyksessä, on tärkeää: valitse pikselit ensin ja kontti jälkeenpäin, koska kontti on edullinen päätös ja pikselit ovat kalliita.
Pyörittävätkö sisarussivustot jotain erilaista?
+
Moottorit ovat identtiset – samat kirjastot, samat työntekijät, samat korkit. Erilainen on liitteenä oleva mielipide, ja mielipide on tässä kentässä, jonka mukaan sivusto on nimetty: Samassa verkkopäätepäätteessä voi olla häviöllinen VP8-kehys, häviötön tai animaatio, joten järkevän käsittelyn polku päätetään mieluummin per tiedosto kuin per laajennus.
Mitä tiedostolleni tapahtuu ja vaaditaanko tili?
+
Ei tiliä, eikä mitään säilytetä: lataukset poistetaan työn päätyttyä, eikä mitään tarkisteta, listata tai indeksoida. Vain historialle ja erän koolle on olemassa tilit.