Screenshot PDF
返回博客

A4 智能避切分页原理:像素变化、留白与算法边界

发布于: 2026-08-08审核于: 2026-08-08Screenshot PDF 编辑团队
A4 智能避切分页原理:像素变化、留白与算法边界

将一张高图像转换为 A4 PDF 听起来像是简单的算术:计算页面高度并剪切每个固定数量的像素。该方法可以分割一行文本,将总计与其标签分离,或者将图表图例与图表分开。因此,Screenshot PDF 将数学 A4 边界视为建议,并在附近搜索视觉上更安静的切口。

本文记录了当前版本的 0.0.13 算法。它解释了像素分析可以检测到什么、不能理解什么,以及如何在不声称像素揭示文档语义的情况下检查输出。

计算得到的 A4 候选边界

对于纵向 A4,高宽比约为 1.4142。如果输入画布的宽度为 1,000 像素,则完整的 A4 形状页面区域的高度约为 1,414 像素。编辑器使用源画布宽度,以便分页保留捕获图像的水平分辨率。

如果图像适合一页,则它仍然是一张图像。无分割模式还会绕过自动分页。否则,编辑器会建议在当前起始位置下方一个 A4 高度的边界。

为什么“找到白色像素”还不够

页面使用有色背景、表格规则、卡片、深色主题、照片和渐变。有用的边界可能是淡蓝色而不是白色。相反,白行仍然可以包含不应剪切的细文本。屏幕截图 PDF 测量每个候选行的水平颜色过渡,而不是仅测试亮度。

对于每隔一个水平像素,该算法会将 RGB 值与两个位置外的像素进行比较。高于阈值的差异会影响行的跃迁能量。密集的文本和详细的图像往往会产生更多的过渡;开放式边缘和简单的水平带往往产量较少。

通过密集内容拒绝边界和选定的低细节边界生成干净的 A4 页面。

平滑避免单像素事故

单个异常安静的行可能是抗锯齿边缘或渲染伪影。编辑器将每一行与其直接相邻的行相加,创建一个三行垂直平滑窗口。它找到当前页面大小的搜索区域中的最小平滑能量,然后接受该最小值的小容差范围内的行。

搜索从建议的 A4 边界向后移动。此首选项尽可能多地使用页面,同时仍然选择视觉上更安静的行。 A4 页面的最小块高度为 15%,可防止搜索返回靠近顶部的小条带。

当不存在安全间隙时会发生什么

有些图像从上到下包含密集的细节:照片、地图、电子表格、代码列表或具有全屏背景的仪表板。如果没有合格的低能量行出现在最小块高度上方,则算法使用建议的数学边界。

这种后备是故意的。不返回任何页面会更糟,并且任意向上移动可能会产生数十张几乎是空白的纸张。预览会显示结果,以便用户可以选择不同的方向、裁剪、边距、缩放或截面捕获。

页面留白与最后一页

中间切片放置在 A4 形高度的白色画布上。如果安全边界向上移动,未使用的下部区域将保持白色。最终的纸张可以使用其实际较短的高度,而不是强制使用不必要的完整空白尾部。

白色填充并不是源内容丢失的证据。这可以表明算法选择了较早的安静边界。通过将一页的最后一个可见行与下一页的第一个可见行进行比较来验证连续性。

算法合理处理的情况

  • 段落由可见的垂直间距分隔;
  • 卡片布局,行与行之间有安静的排水沟;
  • 具有水平分隔符且行周围有足够空间的表格;
  • 带有章节页边距的报告;
  • 混合文本块和图像且边界清晰的屏幕截图。

这些是视觉倾向,不保证类别。具有紧密排列的多行单元格的表格仍然需要手动检查。

需要人为判断的情况

该算法无法理解签名属于声明、小计属于项目行或图表图例属于图表。它不会解析 HTML、阅读顺序、辅助功能角色或法律含义,因为它接收图像。

检查附近的每个边界:

  • 表头、总计、脚注和签名;
  • 方程和代码块;
  • 标题及其数字;
  • 多列布局;
  • 地图、图表和照片;
  • QR 码、条形码和机器可读区域。

如果语义关系很重要,请围绕整个单元制作较小的源捕获或使用原生数字文档。

可重复的边界审查

以 100% 打开 PDF。对于每个转换,在第一页上记录最后一个有意义的对象,在下一页上记录第一个对象。确认没有文本行、数字、图标或机器可读代码被分割。由于缩放和抗锯齿不同,因此在第二个 PDF 查看器中重复检查。

对于受控测试,创建三个源带:段落文本、表格和全出血图像。在记录的视口捕获页面并缩放。预期的结果不是“永远不削减”,而是记录在案的边界选择以及当密集带没有提供安全间隙时诚实的后备。

为什么预览仍然很重要

像素能量可以减少尴尬的剪辑,但它不能证明文件。自动分页是一种对视觉信息进行操作的建议引擎。预览是用户决定建议是否保留意义的地方。

最强大的工作流程结合了确定性比率、有界视觉搜索、透明后备行为和逐页检查。这比承诺自动算法可以仅从像素理解每个网页更可靠。