Was unterscheidet einen Scan von OCR-Text?
Ein Scan speichert das Aussehen einer Seite. OCR versucht, die sichtbaren Zeichen darin zu erkennen. Ein durchsuchbares PDF kann das Seitenbild mit einer zusätzlichen Textebene verbinden. Ein separater Textexport eignet sich wiederum für andere Verarbeitungsschritte.
Die OCR-Textebene ist eine erkannte Fassung des Inhalts und kann vom Original abweichen. Für zitierkritische Passagen oder schwierige Vorlagen sollte der erkannte Text mit dem Seitenbild abgeglichen werden.
Wovon hängt die Erkennungsqualität ab?
Schiefe Seiten, Unschärfe, durchscheinender Druck und ungleichmäßige Hintergründe erschweren die Erkennung. Auch Schrift, Sprache, Spalten, Tabellen und Fußnoten können unterschiedliche Anforderungen stellen. Historische Drucke sollten deshalb anhand repräsentativer Seiten beurteilt werden.
Wir stimmen den Prüfungsumfang auf den Verwendungszweck ab. Für eine erste Volltextsuche kann eine andere Bearbeitung genügen als für einen weiterzuverarbeitenden Textbestand. Eine pauschale fehlerfreie Erkennung versprechen wir nicht.
- Vorlagen und repräsentative Problemseiten sichten
- Gewünschte Text- und Dateiausgabe festlegen
- Umgang mit Lesereihenfolge und Sonderfällen abstimmen
- Prüfung und mögliche Nachkorrektur vereinbaren
Welche Ausgabe ist sinnvoll?
Für die Recherche in einzelnen Werken bietet sich ein durchsuchbares PDF an. Soll Text in andere Systeme übernommen werden, klären wir eine passende separate Ausgabe und die Zuordnung zum Ursprungsdokument. Metadaten oder Artikelgrenzen ergänzen den Volltext, wenn einzelne Publikationen gezielt auffindbar sein sollen.
Bitte senden Sie für eine Anfrage einige typische Seiten, Informationen zur Sprache und eine Beschreibung der geplanten Nutzung. Damit lässt sich der Bearbeitungsumfang gezielter festlegen.
Häufige Fragen
Können bereits vorhandene PDF-Dateien verarbeitet werden?
Ja. Wir prüfen zuerst, ob die Dateien Seitenbilder, bestehenden Text oder eine Mischung enthalten und welche Qualität das Ausgangsmaterial mitbringt.
Kann OCR einen Text zuverlässig übersetzen?
OCR erkennt Zeichen. Eine Übersetzung ist ein zusätzlicher Verarbeitungsschritt und wird hinsichtlich Zielsprache, Fachgebiet und Prüfungsumfang gesondert abgestimmt.
Sind Tabellen nach OCR automatisch strukturierte Daten?
Nicht unbedingt. Erkannter Text bildet nicht automatisch korrekte Zeilen, Spalten und Beziehungen ab. Eine verlässliche Tabellenstruktur kann zusätzliche Aufbereitung und Prüfung erfordern.