SCAPP paper-method v2 本地结果生物学正确性审计

审计日期:2026-07-26 审计对象:docs/zh/figures/data/scapp_paper_method_v2_20260724/ 结论等级:可在明确限制条件下使用(share with caveats)

结论摘要

本地结果在文件完整性、评分算术、阈值执行和表间连接方面均通过独立复核; 严格参考匹配组同时显著富集多类质粒结构、复制和转移证据,因此结果具有明确的 生物学合理性。但是,本次验证不能称为论文精确复现,也不能把 145 条参考未匹配 预测直接解释为已证实的生物学假阳性。

可信度分层如下:

  • 计算与证据完整性:

  • 当前样本中结果的生物学合理性:中高

  • 与原论文结果完全一致:未建立

  • 对其他数据集、其他质粒工具或 ABI 全部工作流的普遍正确性:未建立

审计范围与方法

审计使用本地冻结的小型证据包,执行以下检查:

  1. 复核外层 SHA-256 清单覆盖的 49 个文件。

  2. prediction_status.tsvtruth_status.tsv 独立复算 TP、FP、FN、 precision、recall 和 F1。

  3. 检查预测、参考和预测—参考配对表的唯一性、覆盖度范围、严格阈值和连接关系。

  4. 比较严格参考匹配组与参考未匹配组的质粒辅助证据。

  5. 对 11 项探索性比较采用双侧 Fisher 精确检验或 Mann–Whitney U 检验,并执行 Benjamini–Hochberg 多重检验校正。

可重复执行的审计代码保存在 docs/research/scapp_v2_biological_correctness_audit.ipynb

通过的完整性与算术检查

  • 49/49 个归档文件 SHA-256 校验通过。

  • 157 条预测 ID 唯一;88 条 truth reference ID 唯一。

  • 390 个预测—参考配对无重复,覆盖度均位于 [0, 1]

  • 64 个 matched 配对均同时满足预测覆盖度和参考覆盖度严格大于 0.9; 非 matched 配对均未同时通过两个阈值。

  • 12 条预测被判定为严格参考匹配,145 条为无匹配,未出现重复签名罚分。

  • 64/88 个参考 accession 被至少一条预测召回,24 个未召回。

独立复算结果与冻结证据完全一致:

指标

结果

Precision

7.6433%

Reference-accession recall

72.7273%

F1

13.8329%

生物学合理性证据

严格参考匹配组为 12 条,参考未匹配组为 145 条。以下检验均为探索性比较:

特征

严格匹配组

未匹配组

相对富集或中位数比

BH-FDR q

MOB replicon 阳性

9/12

5/145

21.75×

1.75e-8

PlasmidFinder 阳性

6/12

3/145

24.17×

1.36e-5

Mobilizable

8/12

12/145

8.06×

1.66e-5

环状结构

11/12

43/145

3.09×

7.38e-5

MOB relaxase 阳性

6/12

8/145

9.06×

1.77e-4

丰度覆盖度中位数

114.16

10.33

11.05×

1.64e-3

长度中位数(bp)

3047.5

1459

2.09×

7.39e-3

MOB oriT 阳性

3/12

5/145

7.25×

1.71e-2

注释数量、末端重叠长度也在严格匹配组中显著升高。AMR 命中数没有显著组间差异 (q=0.792),因此不能用 AMR 结果支持整体分类正确性。

这些结果说明严格参考匹配组并非随机序列集合,并获得多类质粒生物学特征的共同 支持。辅助特征可能与候选生成或筛选过程并非完全独立,所以显著性只应作为合理性 证据,不能替代独立湿实验。

关键限制与风险

1. 不是 paper-exact 复现(高)

本次使用的官方 PLSDB 归档含 14,739 条记录;论文报告使用 13,469 条去冗余记录, 但精确去冗余清单与代码未公开。本地重建得到 88 条 truth,而论文报告 74 条。 数据库组成差异可以直接改变 truth 集和召回率。

2. Accession-level recall 受到参考冗余影响(高)

12 条严格匹配预测对应 64 个参考 accession。每条匹配预测对应参考数的均值为 5.33、 中位数为 2.5,单条预测最多对应 17 个 accession。因此 64/88 表示参考 accession 层面的覆盖,不能解释为发现了 64 个彼此独立的生物学质粒。

3. “未匹配”不等于生物学假阳性(中高)

145 条未匹配预测中仍有 43 条环状、12 条 mobilizable。未匹配可能由参考库缺失、 序列新颖性、组装片段化或严格覆盖阈值造成。公共报告应使用 strict reference-unmatched,避免单独使用 false positive

4. 验证范围是 ABI 集成的 SCAPP 工作流(中)

当前测试使用 SCAPP 论文相关数据和方法,主要验证移植、运行、结果标准化、评分及 证据追踪是否正确。它不是对全新 ABI 质粒算法的独立验证,也不能代表 ABI 的全部 分析类型。

5. 本地小型包不能从原始 HSP 完整重建 truth(中)

本地包保留了评分及关键连接表,但没有携带体积较大的 truth_contig_reference_pairs.tsvtruth_reference_coverage.tsv、原始 contigs_to_plsdb.tsv 和 truth FASTA。本地能够验证最终评分,却不能脱离完整云端 归档从原始 HSP 独立重建 88 条 truth。

6. 辅助字段与图表语义问题(低至中)

  • reference_hit_present 在 157 行中全部为真,实际表示存在评分记录,不表示存在 参考匹配;应改名为 scoring_row_present,或按 matched_reference_count > 0 重算。

  • 部分图仍使用 true/false-positive 作为分组名,且不同图的 TP/FP 颜色不一致。

  • 图的 provenance 中 abi_versionunknown,应在下一次正式归档时补齐。

建议的下一步

  1. 对 88 条 truth reference 进行近重复序列聚类,同时报告 accession-level 与 cluster-level precision/recall。

  2. 将公开图表分组统一改为 strict reference-matched/unmatched,统一颜色,并在图注 明示 paper-method reconstruction; not paper-exact

  3. 为高证据未匹配候选补充长读长闭环、read-pair 支持、独立数据库或 PCR/培养验证。

  4. 将完整 truth 重建原始表纳入可审计归档,或生成足以本地重建的压缩中间证据。

  5. 选取非 SCAPP 原论文来源的独立数据集,评估 ABI 质粒流程的可迁移性和一般化能力。

最终判定

本地结果的计算正确性已经通过;生物学证据支持结果具有中高程度合理性。 当前最稳妥的对外表述是:

ABI 成功复现了 SCAPP paper-method reconstruction 下的严格参考一致性评估, 且参考匹配预测显著富集多类质粒生物学证据。由于论文专用去冗余参考集未公开、 accession 冗余及参考库覆盖限制,该结果不是 paper-exact 复现,参考未匹配预测 也不应直接解释为已证实的生物学假阳性。