
長いスクリーンショットを PDF に変換すると、ページネーションと共有が解決されますが、通常、ページは画像のままです。文書を拡大したり印刷したりすることはできますが、名前の検索、引用の選択、支援技術を使用した文書の効果的な使用はできない場合があります。光学式文字認識 (OCR) は、ファイルの検索と選択を可能にする機械生成のテキスト レイヤーを追加します。
OCR は派生プロセスであり、精度を保証するものではありません。 0 と O を混同したり、テーブルの列を結合したり、薄いテキストを省略したり、間違った言語を推測したりする可能性があります。優れたワークフローでは、ビジュアル ソースを保存し、認識できるように準備し、適切な言語設定を適用して、重要な情報を検証します。
読者が長いレコードからフレーズを検索したり、限られたテキストをコピーしたり、文書にインデックスを付けたり、アクセス可能な修復の開始点を作成したりする必要がある場合は、OCR を使用します。認識されたテキストがソースと同一であることを証明するために OCR を使用しないでください。請求書、医療指示書、法的見積書、数値レポートでは、人間が重要なフィールドを比較する必要があります。
元の Web ページがアクセス可能な HTML ビュー、データ エクスポート、またはボーンデジタル PDF を提供している場合は、承認されている場合はそのソースを優先します。通常、ネイティブ テキストは、ピクセルからの認識よりも読み上げ順序と表を保持します。見た目やページの状態が重要な場合はスクリーンショットを保存しますが、高品質のソース データを画像のみのワークフローに置き換えることは避けてください。
認識品質は OCR ツールの前から始まります。小文字、句読点、脚注が明確に区別できるスケールでキャプチャします。メッセージング アプリの圧縮や JPEG 保存の繰り返しは避けてください。多くの場合、PNG はインターフェイスのテキストや細い線をよりよく保存しますが、混合された写真コンテンツには高品質の JPEG が適切な場合があります。
意味が変わらない場合は、不要なサイドバー、アニメーション化されたオーバーレイ、繰り返し表示されるヘッダーを削除します。一貫した背景と十分なコントラストを使用してください。暗いテーマで低コントラストの灰色のテキストが生成される場合、明るいテーマの方が認識しやすい可能性がありますが、外観が重要な場合は変更を文書化します。実質的な値を変更して可読性を向上させないでください。
OCR エンジンは、文字が十分なピクセルを占める場合に、より適切に機能します。縦長の A4 ページに押し込まれた非常に幅の広い Web ページは、サムネイルとしてはきれいに見えますが、小さなテキストが残ることがあります。広いダッシュボードの場合は横向きを選択するか、焦点を当てた列を個別にキャプチャします。ページ幅の大部分を犠牲にすることなく印刷を保護する余白を使用してください。
生成された PDF を 100% 検査します。このスケールで句読点を区別するのに苦労している場合、OCR も苦労する可能性があります。記録されなかった細部を作り出すためにシャープ化フィルタに依存するのではなく、ソース キャプチャに戻って幅やズームを調整します。
実際に表示される言語を OCR ツールに伝えます。認識モデルは、言語辞書と文字セットを使用して、あいまいな形状を解決します。利用可能な言語をすべて選択すると、誤一致が増加する可能性があります。英語のみを選択すると、日本語、中国語、またはアクセントのあるヨーロッパのテキストでは失敗します。言語が混在する文書では、2 つまたは 3 つの意図的な選択が必要になる場合があります。
認識前にページの回転を確認してください。ページが横向きに保存されているが、メタデータによって縦向きに表示されると、一部のツールが混乱する可能性があります。通常の Web ページのスクリーンショットはすでに真っ直ぐになっているはずですが、写真のページの傾きを補正します。大きなドキュメントをコミットする前に、最初に代表的なページを処理し、結果を確認します。
検索可能なスクリーンショット PDF は通常、画像を表示ページとして保持し、認識されたテキストをその背後に非表示に配置します。これにより、検索と選択が可能になりながら、視覚的な忠実度が維持されます。テキストレイヤーはすべてのグリフと完全に一致しない可能性があり、コピーされた段落には予期しない改行や読み上げ順序が含まれる可能性があります。
見出し、段落、リスト、表全体で選択をテストします。句読点のあるフレーズや最終ページ近くのフレーズなど、いくつかの既知のフレーズを検索します。サンプルをプレーンテキストエディタにコピーして、隠れた順序付けの問題を明らかにします。 1 回の検索成功を返したファイルは、必ずしも完全に認識されているとは限りません。

通常の読書アーカイブの場合は、最初、中間、最後のページと、小さなテキストまたは色付きのテキストが含まれるページをサンプリングします。結果として得られるレコードの場合、名前、日付、合計、参照番号、単位、負号などの重要なフィールドを定義し、すべての重要なフィールドをビジュアル ソースと比較します。 OCR の推測に合わせてスクリーンショットを変更するのではなく、修正を個別に記録します。
テーブルには特に注意が必要です。 OCR は、最初の列を読み取ってから 2 番目の列を読み取ったり、通貨記号を切り離したり、値を間違ったラベルに関連付けたりする場合があります。構造化分析が必要な場合は、公式の CSV または手動で検証された転写を使用します。検索可能な PDF は主に発見を支援するものであり、自動的に信頼できるデータセットになるわけではありません。
可能な場合は、認識前に安全な編集を適用します。そうしないと、OCR レイヤーが表示される四角形によって隠されたテキストを保持する可能性があります。編集後、機密用語を検索し、カバーされた領域の近くを選択して、別のビューアでファイルを調べます。認識されたテキストを削除せずに外観を平坦化するだけでは十分ではありません。
検索可能性も露出を変えます。オペレーティング システムとクラウド ドライブは、新しいテキストにインデックスを付けてプレビューに表示する場合があります。 OCR 派生物をそのコンテンツに適切な権限で保存します。文書を組織全体で検索する必要がない場合は、検索が便利だからという理由だけで、広範囲にインデックスが付けられたフォルダーに文書を配置しないでください。
認識で多くの単語が欠落する場合は、解像度、コントラスト、圧縮、言語の選択、回転、ソースの幅をこの順序で確認します。変更のたびに 1 つの代表的なページを再実行します。過度のシャープネス、コントラスト、またはしきい値フィルターを使用すると、句読点や明るいフォントが消去される可能性があるため、処理された画像と元の画像を並べて比較してください。
複雑なレイアウトの場合は、ページをより単純な領域に分割します。 2 段組の記事では、間違った順序で認識される可能性があります。列を分けるか、レイアウト検出機能を備えた OCR システムを使用します。コード、数学的表記、手書き、およびチャートには、特殊な認識または手動での転写が必要です。ノイズの多い出力を正確なテキストとして表示するのではなく、制限事項を説明します。
OCR だけでは PDF を完全にアクセシブルにすることはできません。スクリーン リーダーには、意味のある読み上げ順序、見出し、言語メタデータ、情報画像の代替テキスト、テーブル構造、および適切なタグも必要です。自動認識では、生の単語が提供される一方で、ドキュメントの操作がわかりにくくなる場合があります。
アクセシビリティが要件である場合は、中間ステップとして OCR を使用し、アクセシビリティ対応エディタでドキュメントを修正します。自動チェックを実行し、キーボード ナビゲーションと代表的なスクリーン リーダー ワークフローをテストします。可能であれば、元のアクセス可能な Web ページまたは構造化テキストの代替ページも提供してください。
元のビジュアル PDF を保持し、認識されたコピーに OCR 派生物として名前を付けます。アーカイブが重要な場合は、処理日と言語設定を付随メモに含めます。唯一のオリジナルを上書きすることは避けてください。ハッシュや管理されたストレージは、組織がバージョンを追跡するのに役立ちますが、ページのコンテンツの真実性を検証するものではありません。
OCR テキストを手動で修正する場合は、修正されたトランスクリプトと未加工のビジュアル ソースを区別します。読者は、機械の出力を検索しているのか、人間がレビューしたレイヤーを検索しているのか、あるいは個別に作成されたトランスクリプトを検索しているのかを知っておく必要があります。
最も信頼できる OCR ワークフローは保守的です。明確なソースから開始し、必要なものだけを認識し、リスクに応じて検証し、視覚的な記録を保存します。検索可能なテキストは、読者が機械認識を正確な文字起こしと誤解しない限り、長いスクリーンショットをはるかに便利にすることができます。