
1 つの縦長の画像を A4 PDF に変換することは、ページの高さを計算し、固定ピクセル数ごとにカットするという単純な計算のように思えます。この方法では、テキスト行を分割したり、ラベルから合計を切り離したり、グラフの凡例をグラフから分割したりできます。したがって、スクリーンショット PDF は、A4 の数学的な境界を提案として扱い、近くにある視覚的に静かなカットを検索します。
この記事では、現在のバージョンの 0.0.13 アルゴリズムについて説明します。ピクセル分析で何が検出できるのか、何が理解できないのか、そしてピクセルが文書のセマンティクスを明らかにすると主張することなく出力をレビューする方法について説明します。
A4 縦長の場合、高さと幅の比率は約 1.4142 です。入力キャンバスの幅が 1,000 ピクセルの場合、A4 型のページ領域全体の高さは約 1,414 ピクセルになります。エディターはソースの Canvas 幅を使用して、ページネーションでキャプチャされた画像の水平解像度を維持します。
画像が 1 ページに収まる場合は、1 つの画像のままです。非分割モードでは、自動ページネーションもバイパスされます。それ以外の場合、エディターは現在の開始位置から A4 高さ 1 つ下の境界を提案します。
ページでは、色付きの背景、テーブル ルール、カード、ダーク テーマ、写真、グラデーションが使用されます。有用な境界は、白ではなく淡い青かもしれません。逆に、白い行には、切り取るべきではない薄いテキストが含まれている可能性があります。スクリーンショット PDF は、明るさのみをテストするのではなく、各候補行にわたる水平方向の色の変化を測定します。
アルゴリズムは、水平方向のピクセルを 1 つおきに、RGB 値を 2 つ離れたピクセルと比較します。閾値を超える差は、行の遷移エネルギーに寄与します。高密度のテキストと詳細な画像では、トランジションが多くなる傾向があります。オープンマージンや単純な水平バンドでは生成されるものが少なくなる傾向があります。

異常に静かな 1 つの行は、アンチエイリアス処理されたエッジまたはレンダリング アーティファクトである可能性があります。エディターは各行をそのすぐ隣の行と合計し、3 行の垂直スムージング ウィンドウを作成します。現在のページ サイズの検索領域で最小の平滑化エネルギーを見つけて、その最小値の小さな許容誤差内の行を受け入れます。
検索は、提案された A4 境界から後方に移動します。この設定では、視覚的に静かな行を選択しながら、可能な限りページを使用します。最小チャンク高さが A4 ページの 15% であると、検索で上部近くの小さなストリップが返されなくなります。
一部の画像には、写真、地図、スプレッドシート、コード リスト、完全な背景のダッシュボードなど、上から下まで緻密な詳細が含まれています。最小チャンク高さを超える、適格な低エネルギー行が表示されない場合、アルゴリズムは提案された数学的境界を使用します。
そのフォールバックは意図的なものです。ページを戻さないとさらに悪くなり、任意に上に移動すると、ほとんど空のシートが数十枚も生成される可能性があります。プレビューでは結果が公開されるため、ユーザーは別の方向、トリミング、マージン、ズーム、または部分キャプチャを選択できます。
中間スライスは、A4 型の高さの白いキャンバス上に配置されます。安全な境界が上に移動すると、未使用の下の領域は白のままになります。最終シートは、不必要な完全な空白のテールを強制する代わりに、実際の短い高さを使用できます。
白いパディングは、ソース コンテンツが失われたという証拠ではありません。これは、アルゴリズムが以前の静かな境界を選択したことを示している可能性があります。あるページの最後に表示されている行と、次のページの最初に表示されている行を比較して、連続性を検証します。
これらは視覚的な傾向であり、保証されたカテゴリではありません。複数行のセルが密集した表でも、手動によるレビューが必要になる場合があります。
アルゴリズムは、署名が宣言に属していること、小計が項目行に属していること、またはグラフの凡例がグラフに属していることを認識しません。画像を受け取るため、HTML、読み取り順序、アクセシビリティの役割、または法的意味は解析されません。
次の付近のすべての境界を確認します。
意味上の関係が重要な場合は、完全なユニットを中心に小さなソース キャプチャを作成するか、ボーン デジタル ドキュメントを使用します。
PDF を 100% で開きます。トランジションごとに、最初のページに最後の意味のあるオブジェクトを記録し、次のページに最初のオブジェクトを記録します。テキスト行、数字、アイコン、または機械可読コードが分割されていないことを確認します。スケーリングとアンチエイリアスが異なるため、2 番目の PDF ビューアでチェックを繰り返します。
制御されたテストの場合、段落テキスト、表、およびフルブリード画像の 3 つのソース バンドを作成します。記録されたビューポートでページをキャプチャし、ズームします。期待される結果は、「これまでカットなし」ではなく、文書化された境界の選択と、密なバンドが安全なギャップを提供しない場合の正直なフォールバックです。
ピクセルエネルギーは厄介なカットを減らすことができますが、文書を認証することはできません。自動ページネーションは、視覚情報に基づいて動作する提案エンジンです。プレビューでは、提案が意味を保持しているかどうかをユーザーが判断します。
最も強力なワークフローは、決定的な比率、限定された視覚的検索、透過的なフォールバック動作、およびページごとの検査を組み合わせたものです。これは、自動アルゴリズムがピクセルだけからすべての Web ページを理解できると約束するよりも信頼性が高くなります。