先看结论:自动导出遗漏分页,通常不是导出功能本身出错,而是分页边界、去重规则和抓取节奏三者叠加的结果。检查完整性要分两步走——样本量小时逐页核对,样本量大时改用“总数对账+抽样验证”。直接照搬小样本的逐页核对,规模化后一定会漏。
两种条件对应两种完全不同的检查方法,选错方法比不检查更危险。
判断依据不是你的耐心,而是导出工具能否给出一个独立于分页的“总数”字段。有总数,走条件二;没有总数,只能退回条件一,并接受覆盖不完整的事实。
假设某次查询导出了 12 页、每页 20 条,去重后得到 231 条。这个数字不等于 240,说明有 9 条在分页间重复或被去重规则合并。
这个动作的结果决定下一步:若抽样页完全一致,差额可判定为重复;若某页整页缺失,说明分页参数在跳转时被重置,此时应停止扩大导出范围,先固定分页参数再重跑。
当结果集上千条,逐页核对不再成立。此时完整性只能靠两个独立信号交叉验证。
需要明确边界:总数本身也可能是估算值,平台对深分页的计数常不精确。因此总数对账只能作为参考,不能当作完整性的唯一证据。
假设导出文件去重后 1180 条,界面显示约 1250 条,差额 70 条。可能的解释至少三种:深分页截断、跨页重复被去重、以及排序不稳定导致同一条目在不同页出现又消失。这三种原因的区分方法是:把导出按时间或ID排序,看缺失条目是否集中在末尾——集中在末尾偏向截断,分散则偏向排序抖动。
若确认集中在末尾,下一步不是加大导出量,而是缩小查询条件、分段导出后再合并。这个动作直接改变后续流程:从“一次全量导出”转为“按条件切片导出”,完整性检查也随之变成各切片条数之和与总数的对账。
如果查询结果本身依赖实时排序或个性化推荐,同一条件两次导出的条目集合可能不同,此时任何“总数对账”都失去基准,完整性无法用条数证明。这类场景只能记录导出时间与条件,把完整性定义为“在某一时刻的快照”,而不是绝对全集。另外,若工具不提供总数也不提供稳定分页,逐页核对和总数对账都不可行,只能接受覆盖不完整,并在后续分析中标注这一限制。