Wissen zur Digitalisierung

Scan, OCR und Metadaten: Was ist der Unterschied?

Ein Scan zeigt die Seite, OCR macht die Zeichen maschinenlesbar und Metadaten beschreiben das Dokument. Die Artikelaufteilung gliedert eine größere Publikation in einzelne Beiträge. Diese Ergebnisse ergänzen sich, erfüllen aber unterschiedliche Aufgaben.

Vier Schritte, vier unterschiedliche Ergebnisse

Eine PDF-Datei verrät durch ihre Endung noch nicht, welche dieser Ergebnisse enthalten sind. Sie kann reine Seitenbilder, zusätzlich erkannten Text oder direkt digital erzeugten Text enthalten. Ebenso ist ein Ordner mit Scans noch kein strukturierter Katalog.

SchrittErgebnisBeispiel einer Nutzung
ScannenDigitales Bild der gedruckten SeiteEine historische Abbildung betrachten
OCRAutomatisch erkannter TextNach einem Begriff im Werk suchen
MetadatenBeschreibende Angaben zum DokumentNach Autor oder Erscheinungsjahr filtern
ArtikelaufteilungAbgegrenzte Beiträge mit ZuordnungEinen Aufsatz aus einem Sammelband einzeln verwenden

Beispiel: Ein Zeitschriftenband soll recherchierbar werden

Angenommen, ein Band enthält mehrere Aufsätze. Ein vollständiger Scan macht zunächst alle Seiten digital lesbar. OCR ergänzt die Möglichkeit, im erkannten Volltext zu suchen. Erfasste Artikelgrenzen ermöglichen anschließend die Zuordnung der einzelnen Beiträge.

Zu jedem Beitrag können Titel, Autor und Seitenbereich in einer Tabelle hinterlegt werden. Eine eindeutige Kennung verbindet den Tabelleneintrag mit der passenden Datei. Das ist ein vereinfachtes Beispiel für einen Arbeitsablauf, keine Beschreibung eines bestimmten Kundenprojekts.

Wie lässt sich die Qualität sinnvoll prüfen?

Die Prüfung sollte sich auf das jeweilige Ergebnis beziehen. Beim Scan sind unter anderem Vollständigkeit, Reihenfolge und Lesbarkeit zu prüfen. Beim OCR-Text kommt der Abgleich mit dem Original hinzu. Für Metadaten geht es etwa um richtige Feldzuordnung und eine nachvollziehbare Behandlung fehlender Angaben.

Ein pauschales Etikett wie „digitalisiert“ beantwortet diese Fragen nicht. Vor Projektbeginn sollten deshalb die gewünschten Ausgaben, die Prüfkriterien und der Umgang mit schwierigen Stellen beschrieben werden.

  • Sind alle vereinbarten Seiten vorhanden und richtig zugeordnet?
  • Ist der Text für den geplanten Zweck ausreichend erfasst?
  • Sind fehlende oder unsichere Angaben erkennbar?
  • Passen Feldnamen, Dateinamen und Kennungen zusammen?
  • Lässt sich eine Musterlieferung im Zielsystem verwenden?

Welche Rolle spielen Standards und Dateiformate?

Dublin Core beschreibt unter anderem Metadatenbegriffe wie Titel, Urheber, Sprache und Identifikator. ALTO ist ein XML-Format zur Beschreibung von erkanntem Text und Seitenlayout. Solche Spezifikationen helfen, Anforderungen präzise zu benennen.

Ein bestimmter Standard oder ein spezielles Exportformat ist jedoch nicht automatisch Bestandteil eines Digitalisierungsauftrags. Entscheidend bleibt die konkret vereinbarte Lieferung. Donauconnect klärt benötigte Felder und Ausgabeformate vor der Bearbeitung.

Weiterführende Fachquellen

Ihr Projekt besprechen

Senden Sie uns Angaben zu Material, Umfang und gewünschtem Ergebnis. Daraus stimmen wir den Leistungsumfang und ein Angebot ab.

info@donauconnect.com