
Das Umwandeln eines langen Screenshots in ein PDF löst die Paginierung und das Teilen, aber die Seiten bleiben normalerweise Bilder. Sie können sie vergrößern und ausdrucken, können jedoch möglicherweise nicht nach einem Namen suchen, ein Zitat auswählen oder das Dokument mit unterstützender Technologie effektiv nutzen. Die optische Zeichenerkennung (OCR) fügt eine maschinell generierte Textebene hinzu, die die Datei durchsuchbar und auswählbar machen kann.
OCR ist ein abgeleiteter Prozess und keine Garantie für die Richtigkeit. Es kann dazu führen, dass 0 mit O verwechselt wird, Tabellenspalten zusammengeführt werden, blasser Text weggelassen wird und die falsche Sprache erraten wird. Ein guter Workflow bewahrt die visuelle Quelle, bereitet sie für die Erkennung vor, wendet geeignete Spracheinstellungen an und validiert die wichtigen Informationen.
Verwenden Sie OCR, wenn Leser Phrasen in einem langen Datensatz finden, begrenzten Text kopieren, Dokumente indizieren oder einen Ausgangspunkt für eine barrierefreie Korrektur schaffen müssen. Verwenden Sie OCR nicht als Beweis dafür, dass der erkannte Text mit der Quelle identisch ist. Für Rechnungen, medizinische Anweisungen, rechtliche Angebote und numerische Berichte muss ein Mensch kritische Felder vergleichen.
Wenn die ursprüngliche Webseite eine barrierefreie HTML-Ansicht, einen Datenexport oder ein digitalisiertes PDF bietet, bevorzugen Sie diese Quelle, wenn Sie autorisiert sind. Nativer Text behält in der Regel die Lesereihenfolge und Tabellen besser bei als die Erkennung anhand von Pixeln. Machen Sie einen Screenshot, wenn das visuelle Erscheinungsbild oder der Seitenstatus wichtig ist, aber vermeiden Sie es, höherwertige Quelldaten durch einen Nur-Bild-Workflow zu ersetzen.
Die Erkennungsqualität beginnt bereits vor dem OCR-Tool. Erfassen Sie in einem Maßstab, in dem Kleinbuchstaben, Satzzeichen und Fußnoten klar unterscheidbar sind. Vermeiden Sie die Komprimierung durch Messaging-Apps und wiederholte JPEG-Speicherungen. Bei PNG bleiben Oberflächentext und dünne Linien oft besser erhalten, während ein hochwertiges JPEG für gemischte Fotoinhalte ausreichend sein kann.
Entfernen Sie unnötige Seitenleisten, animierte Overlays und wiederholte Sticky-Header, wenn dadurch die Bedeutung nicht geändert wird. Verwenden Sie einen einheitlichen Hintergrund und ausreichend Kontrast. Wenn ein dunkles Design kontrastarmen grauen Text erzeugt, kann ein helles Design möglicherweise besser erkannt werden, aber dokumentieren Sie die Änderung, wenn das Erscheinungsbild relevant ist. Verbessern Sie niemals die Lesbarkeit, indem Sie inhaltliche Werte ändern.
OCR-Engines funktionieren besser, wenn Zeichen genügend Pixel belegen. Eine sehr breite Webseite, die auf A4-Seiten im Hochformat gezwungen wird, sieht als Miniaturansicht vielleicht ordentlich aus, hinterlässt aber winzigen Text. Wählen Sie Querformat für breite Dashboards oder erfassen Sie fokussierte Spalten separat. Verwenden Sie Ränder, die den Druck schützen, ohne den größten Teil der Seitenbreite zu beeinträchtigen.
Überprüfen Sie das generierte PDF zu 100 Prozent. Wenn es einer Person schwerfällt, Zeichensetzung auf dieser Skala zu unterscheiden, dürfte auch OCR Probleme haben. Kehren Sie zur Quellaufnahme zurück und passen Sie die Breite oder den Zoom an, anstatt sich auf Schärfungsfilter zu verlassen, um Details zu erfinden, die nie aufgezeichnet wurden.
Teilen Sie dem OCR-Tool mit, welche Sprachen tatsächlich angezeigt werden. Erkennungsmodelle verwenden Sprachwörterbücher und Zeichensätze, um mehrdeutige Formen aufzulösen. Die Auswahl aller verfügbaren Sprachen kann zu mehr falschen Übereinstimmungen führen. Wenn Sie nur Englisch auswählen, schlägt dies bei japanischem, chinesischem oder akzentuiertem europäischem Text fehl. Bei gemischtsprachigen Dokumenten sind möglicherweise zwei oder drei absichtliche Auswahlen erforderlich.
Bestätigen Sie vor der Erkennung die Seitendrehung. Eine Seite, die seitlich gespeichert ist, aber durch Metadaten aufrecht angezeigt wird, kann einige Tools verwirren. Schräg fotografierte Seiten, obwohl normale Webseiten-Screenshots bereits gerade sein sollten. Verarbeiten Sie zunächst eine repräsentative Seite und überprüfen Sie das Ergebnis, bevor Sie ein großes Dokument übergeben.
Durchsuchbare Screenshot-PDFs behalten normalerweise das Bild als sichtbare Seite und platzieren erkannten Text unsichtbar dahinter. Dies bewahrt die visuelle Wiedergabetreue und ermöglicht gleichzeitig die Suche und Auswahl. Die Textebene passt möglicherweise nicht perfekt zu jedem Glyphen und kopierte Absätze können unerwartete Zeilenumbrüche oder Lesereihenfolgen aufweisen.
Testen Sie die Auswahl über Überschriften, Absätze, Listen und Tabellen hinweg. Suchen Sie nach mehreren bekannten Phrasen, darunter einer mit Satzzeichen und einer auf der letzten Seite. Kopieren Sie ein Beispiel in einen Nur-Text-Editor, um versteckte Sortierprobleme aufzudecken. Eine Datei, die eine erfolgreiche Suche zurückgibt, wurde nicht unbedingt vollständig erkannt.

Probieren Sie für ein gewöhnliches Lesearchiv die erste, mittlere und letzte Seite sowie jede Seite mit kleinem oder farbigem Text aus. Definieren Sie für einen Folgedatensatz kritische Felder wie Namen, Daten, Summen, Referenznummern, Einheiten und negative Vorzeichen und vergleichen Sie dann jedes kritische Feld mit der visuellen Quelle. Zeichnen Sie Korrekturen separat auf, anstatt den Screenshot so zu ändern, dass er mit der OCR-Vermutung übereinstimmt.
Tische verdienen besondere Aufmerksamkeit. OCR liest möglicherweise die erste und dann die zweite Spalte aus, löst Währungssymbole oder ordnet einen Wert der falschen Bezeichnung zu. Wenn eine strukturierte Analyse erforderlich ist, verwenden Sie eine offizielle CSV-Datei oder eine manuell überprüfte Transkription. Ein durchsuchbares PDF ist in erster Linie eine Suchhilfe und nicht automatisch ein zuverlässiger Datensatz.
Wenden Sie nach Möglichkeit vor der Erkennung eine sichere Schwärzung an. Andernfalls bleibt der Text auf der OCR-Ebene möglicherweise durch ein sichtbares Rechteck verborgen. Suchen Sie nach der Schwärzung nach dem sensiblen Begriff, versuchen Sie, ihn in der Nähe des abgedeckten Bereichs auszuwählen, und überprüfen Sie die Datei in einem anderen Viewer. Es reicht nicht aus, das Erscheinungsbild zu reduzieren, ohne erkannten Text zu entfernen.
Die Durchsuchbarkeit verändert auch die Präsenz. Betriebssysteme und Cloud-Laufwerke können den neuen Text indizieren und in einer Vorschau anzeigen. Speichern Sie das OCR-Derivat mit den für seinen Inhalt geeigneten Berechtigungen. Wenn für das Dokument keine organisationsweite Suche erforderlich ist, platzieren Sie es nicht in einem breit indizierten Ordner, nur weil das Abrufen bequemer ist.
Wenn bei der Erkennung viele Wörter fehlen, überprüfen Sie Auflösung, Kontrast, Komprimierung, Sprachauswahl, Drehung und Quellbreite in dieser Reihenfolge. Führen Sie nach jeder Änderung eine einzelne repräsentative Seite erneut aus. Übermäßige Schärfung, Kontrast oder Schwellenwertfilter können Satzzeichen und helle Schriftarten löschen. Vergleichen Sie daher verarbeitete und Originalbilder nebeneinander.
Teilen Sie die Seite bei komplexen Layouts in einfachere Bereiche auf. Ein zweispaltiger Artikel wird möglicherweise in der falschen Reihenfolge angezeigt. Trennen Sie Spalten oder verwenden Sie ein OCR-System mit Layouterkennung. Code, mathematische Notation, Handschrift und Diagramme erfordern eine spezielle Erkennung oder manuelle Transkription. Geben Sie die Einschränkung an, anstatt eine verrauschte Ausgabe als korrekten Text darzustellen.
OCR allein macht ein PDF nicht vollständig barrierefrei. Ein Screenreader benötigt außerdem eine aussagekräftige Lesereihenfolge, Überschriften, Sprachmetadaten, alternativen Text für informative Bilder, eine Tabellenstruktur und geeignete Tags. Die automatisierte Erkennung liefert möglicherweise rohe Wörter, während die Navigation im Dokument verwirrend ist.
Wenn Barrierefreiheit erforderlich ist, verwenden Sie OCR als Zwischenschritt und korrigieren Sie das Dokument in einem barrierefreien Editor. Führen Sie automatisierte Prüfungen durch und testen Sie dann die Tastaturnavigation und einen repräsentativen Screenreader-Workflow. Stellen Sie nach Möglichkeit auch die ursprüngliche barrierefreie Webseite oder eine strukturierte Textalternative bereit.
Behalten Sie das ursprüngliche visuelle PDF bei und benennen Sie die erkannte Kopie als OCR-Derivat. Fügen Sie das Verarbeitungsdatum und die Spracheinstellungen in eine Begleitnotiz ein, wenn das Archiv wichtig ist. Vermeiden Sie es, das einzige Original zu überschreiben. Hashes oder kontrollierte Speicherung können einer Organisation dabei helfen, Versionen zu verfolgen, sie bestätigen jedoch nicht die Richtigkeit des Seiteninhalts.
Wenn Sie OCR-Text manuell korrigieren, unterscheiden Sie das korrigierte Transkript von der unberührten visuellen Quelle. Leser sollten wissen, ob sie eine maschinelle Ausgabe, eine von Menschen überprüfte Ebene oder ein separat verfasstes Transkript suchen.
Der zuverlässigste OCR-Workflow ist konservativ: Beginnen Sie mit einer klaren Quelle, erkennen Sie nur das, was Sie benötigen, validieren Sie entsprechend dem Risiko und bewahren Sie die visuelle Aufzeichnung auf. Durch durchsuchbaren Text kann ein langer Screenshot weitaus nützlicher sein, solange die Leser nicht dazu verleitet werden, die maschinelle Erkennung mit einer exakten Transkription zu verwechseln.