Digitizarea explicată

OCR explicat: cum devine un PDF căutabil?

OCR înseamnă Optical Character Recognition, adică recunoașterea optică a caracterelor. Procesul produce text prelucrabil automat din imaginile paginilor tipărite. Ghidul explică diferența dintre scanare și stratul de text și factorii care influențează recunoașterea.

Care este diferența dintre o scanare și textul OCR?

Scanarea înregistrează aspectul unei pagini. OCR-ul încearcă să recunoască semnele vizibile în imagine. Un PDF căutabil poate combina imaginea paginii cu un strat suplimentar de text. Un export separat de text poate susține alte etape de prelucrare.

Stratul OCR reprezintă o versiune recunoscută automat și poate diferi de original. Pasajele folosite pentru citare exactă sau provenite din surse dificile ar trebui verificate prin comparație cu imaginea paginii.

Ce influențează calitatea recunoașterii?

Paginile înclinate, imaginile neclare, tiparul vizibil de pe verso și fundalurile neuniforme pot îngreuna recunoașterea. Fonturile, limbile, coloanele, tabelele și notele de subsol pot crea cerințe diferite. Publicațiile istorice trebuie de aceea evaluate pe baza unor pagini reprezentative.

Stabilim nivelul de verificare în funcție de utilizare. Căutarea inițială în text poate necesita alt nivel de prelucrare decât un corpus destinat procesării ulterioare. Nu promitem recunoaștere fără erori pentru orice material.

  • Evaluarea originalelor și a paginilor cu dificultăți reprezentative
  • Definirea textelor și fișierelor necesare la livrare
  • Stabilirea tratării ordinii de lectură și a situațiilor speciale
  • Convenirea verificării și a eventualelor corecturi

Ce format este potrivit pentru proiect?

Un PDF căutabil permite cercetarea în cadrul unei lucrări. Dacă textul trebuie introdus în alte sisteme, convenim un export separat și legătura cu documentul-sursă. Metadatele și limitele articolelor completează textul integral atunci când publicațiile individuale trebuie să poată fi găsite.

Pentru o solicitare, trimiteți câteva pagini tipice, informații despre limbă și o descriere a utilizării dorite. Astfel putem defini mai precis volumul de prelucrare.

Întrebări frecvente

Puteți prelucra PDF-uri existente?

Da. Verificăm mai întâi dacă fișierele conțin imagini ale paginilor, text existent sau o combinație și evaluăm calitatea materialului-sursă.

OCR-ul traduce corect textul?

OCR-ul recunoaște caractere. Traducerea este o etapă separată, pentru care limba țintă, domeniul și nivelul de verificare se stabilesc distinct.

Tabelele devin automat date structurate după OCR?

Nu neapărat. Textul recunoscut nu păstrează automat corect rândurile, coloanele și relațiile. O structură fiabilă a tabelului poate necesita prelucrare și verificare suplimentară.

Surse tehnice suplimentare

Să discutăm proiectul

Trimiteți-ne informații despre material, volum și rezultatul dorit. Pe această bază stabilim serviciile și pregătim oferta.

info@donauconnect.com