Aus Seitenbildern wird nutzbarer Volltext
Ein reines Seitenbild enthält zunächst keine maschinenlesbaren Zeichen. OCR erzeugt daraus eine erkannte Textfassung. In einem durchsuchbaren PDF bleibt das Seitenbild sichtbar, während eine zusätzliche Textebene die Suche unterstützt.
Wenn Sie Text unabhängig vom PDF benötigen, stimmen wir einen passenden Export und die Verbindung zum Ursprungsdokument ab. Eine Übersetzung oder die Erfassung bibliografischer Metadaten sind zusätzliche Leistungen.
Erkennung und Prüfung passend zum Material
- Beispieldateien, Sprache, Schrift und typische Seitenlayouts sichten
- Benötigte Textebene beziehungsweise separaten Export festlegen
- OCR durchführen und vereinbarte Sonderfälle berücksichtigen
- Ergebnisse im festgelegten Umfang prüfen und gegebenenfalls nachkorrigieren
Qualität und Grenzen der Ausgabe
OCR kann Erkennungsfehler enthalten. Spalten, Fußnoten, historische Schriften und schwache Scanqualität können zusätzliche Bearbeitung erfordern. Wir vereinbaren deshalb den Prüfungsumfang und den Umgang mit problematischen Stellen.
Für eine grobe Volltextsuche gelten andere Anforderungen als für Texte, die weiterverarbeitet oder genau zitiert werden sollen. Die Kriterien werden für Ihr Nutzungsziel festgelegt; eine pauschale fehlerfreie Erkennung wird nicht zugesagt.
So bereiten Sie Ihre Anfrage vor
Senden Sie einige typische und einige schwierige Seiten. Hilfreich sind Seitenmenge, Sprache, vorhandenes Dateiformat und die geplante Nutzung. Teilen Sie mit, ob Sie ein durchsuchbares PDF, separat nutzbaren Text oder beides benötigen.
Häufige Fragen
Können Sie meine bestehenden Scans verwenden?
Ja. Zunächst prüfen wir die Dateistruktur und die Qualität des Ausgangsmaterials, um einen passenden Bearbeitungsumfang festzulegen.
Sind erkannte Tabellen automatisch korrekt strukturiert?
Nein. Eine verlässliche Zuordnung von Zeilen, Spalten und Werten kann zusätzliche Aufbereitung und Prüfung erfordern.