第五章 · 5.3

5.3 常见陷阱与六周学习路线

Pitfalls and a Six-Week Path
错误不随机出现:它们沿数据、训练、评估三段管线聚簇。本节将全书高频陷阱汇成三组清单,逐条给出机理、症状与对策,并链回对应章节;继而以六周路线串起 RDKit、DeepChem 与 TorchDrug 的递进实操;再以三个进阶课题承接全书,附数据来源与卡点提示;收官处收拢三条主线,指向持续学习。

5.3.1 陷阱的分布规律:错误沿管线聚簇

全书五卷走完,回头看决定成败的因素:模型架构很少排第一,排第一的是管线里的细节——数据有没有洗干净、划分有没有泄漏、结论有没有越过证据。高频错误不是随机的个人失误,它们聚在三处:数据进入模型之前、模型拟合的过程之中、指标变成结论的那一刻。本节把这三处分别称为数据侧(data-side)训练侧(training-side)评估侧(evaluation-side),共十三条,每条按同一结构展开:机理(为什么会错)、症状(在哪暴露)、对策(怎么堵住),并链回讲透该机理的小节。这一趟既是排雷,也是全书原理的最后一遍总复习。

组织方式有明确的方法学依据。Tropsha 等(2003)在 QSAR 时代即断言:没有严格外部验证的模型一文不值,验证“是绝对必需”;Fourches 等(2010)用系统实验证明,结构清洗环节的取舍足以颠覆模型排名;Kapoor 与 Narayanan(2023)清点了 17 个领域、294 篇受数据泄漏(data leakage)影响的论文,指出泄漏正是复现危机的主要病灶。三条文献共同指向一个结论:多数失败不在模型,在协议。协议的四个成分,就是任何一个指标数字的全部来源:

指标 = F(模型, 数据与划分, 评估协议, 随机性)
(5.3-1)论文表格里的任何一个数字都是右端四元组的函数,四项中任何一项变动,数字即失去可比性。本节十三条陷阱逐条可归入其中:清洗与去重属“数据与划分”,划分纪律与测试集纪律属“评估协议”,初始化与数据顺序属“随机性”。横比先对齐四元组,下结论先交代协议。

三条侧别之间是单向管线:数据侧的病会带进训练,训练侧的错觉会沉淀为评估侧的错误结论;反过来不成立——训练救不了脏数据,指标挽不回错误的划分。因此排查按图 5.3-1 的次序走:先查数据,再查训练,最后核对评估协议。

三组陷阱按管线位置排布:数据侧四条、训练侧五条、评估侧四条,错误沿箭头向下游单向传递 错误沿管线聚簇:数据侧、训练侧、评估侧的三组陷阱 编号 D/T/E 与 5.3.2–5.3.4 的条目一一对应;三组之间是单向传递的管线 数据侧 · 进入模型之前 D-1 盐与互变异构分裂样本 D-2 重复与近重复跨集泄漏 D-3 解析失败被静默丢弃 D-4 特征漏掉电荷与手性 四条 · 详见 5.3.2 训练侧 · 拟合的过程之中 T-1 默认划分刷高成绩 T-2 不平衡下用准确率自欺 T-3 多任务把缺失当负例 T-4 层数迷信与感受野不足 T-5 小数据单种子下结论 五条 · 详见 5.3.3 评估侧 · 下结论的时刻 E-1 测试集参与调参 E-2 指标选偏、忽视早富集 E-3 生成模型单一指标作弊 E-4 不同协议结果横比 四条 · 详见 5.3.4 每条陷阱按同一结构展开:机理(成因)→ 症状(信号)→ 对策(出路),对策处给出全书对应小节 差错单向向下游传递:数据侧的错误无法靠训练弥补,训练侧的错觉无法靠指标挽回。 三组的相对位置即排查次序:先查数据,再查训练,最后核对评估协议。 四元组(式 5.3-1)是横比与自查的公共坐标系;十三条陷阱皆可归入其中一项。
图 5.3-1 三组高频陷阱按管线位置的分布。数据侧(D-1 至 D-4)在样本进入模型之前发生;训练侧(T-1 至 T-5)在拟合过程中制造错觉;评估侧(E-1 至 E-4)在指标变成结论的时刻失真。箭头方向即错误传递方向:脏数据带着偏差进入训练,训练的错觉沉淀为错误的结论——反方向不通,所以排查永远从数据侧开始。每个陷阱都让指标与真实能力脱钩,这正是三条侧别的共同本质。

5.3.2 数据侧:进入模型之前

  1. D-1|未清洗的盐与互变异构让“同一分子”分裂成两个样本。机理:同一化合物在不同记录里可能写作游离碱、盐形式(salt form)或不同互变异构体(tautomer);规范化之前,字符串不同就意味着分子图不同。症状:活性相近的两条记录分居训练集与测试集,模型只要认出“老朋友”就能答对;统一规范化再去重后,样本量与指标同时缩水。对策:建模前过 2.6 节的清洗工序——去盐保留母核、统一互变异构与电荷状态,然后去重;清洗日志与前后计数一并入库。Fourches 等(2010)的结论:清洗流程本身即是建模的一部分。

  2. D-2|重复与近重复跨集泄漏。机理:随机划分只保证“这一行”不重复出现,不保证“这个分子”只出现一次;骨架相同、侧链微调的近重复(near-duplicate)在 ChEMBL 一类数据库里大量存在,随机划分后它们恰好分居两侧。症状:随机划分成绩漂亮,换成 1.3 节骨架划分(scaffold split)即大幅下滑;两个划分的差值就是泄漏规模的估计。对策:划分前按规范化结构去重,以骨架为单元分组划分;两种划分的对照结果同报,差值过大时只信严格的那一个(另见 2.6 节)。

  3. D-3|解析失败被静默丢弃,造成选择偏差。机理:批量读入 SMILES 时,个别记录语法非法或原子价反常,解析器返回空值;管线若用异常捕获后继续,失败便无声消失。症状:数据集规模悄然变小,报告里的样本数与下载时对不上;被丢的往往是金属配合物、盐与格式古怪的记录——丢得并不随机。对策:失败记录单独落盘、计数、报告失败率;抽查失败样例判断与任务是否相关,相关则修复,不可修则在文中声明。详见 3.2 节的特征化管线。

  4. D-4|特征化漏掉关键属性,封住性能上限。机理:特征是模型能看到的全部化学。默认指纹若不编码电荷与手性,构型不同的两行在该表示之下完全相同——信息在进入模型之前已经丢了,再强的模型也找不回来。症状:含手性中心的任务上模型停在基线水平,换更深网络也不涨。对策:先问任务依赖哪些化学属性,再选能覆盖它们的表示(1.2 节的三种面貌、3.2 节的管线);用“表示能否区分已知有别的分子对”做健全性检查,2.4 节的描述符是现成的补充维度。

定义

选择偏差(selection bias)。样本进入或退出数据集的机制与任务目标相关时,数据集系统性偏离目标总体。静默丢弃解析失败的 SMILES 是最典型的入口:金属盐与不规范价键在特定子库里更常见,丢掉的子集因此并非随机,留下的样本带着方向的偏。判别标准只有一条——丢弃必须留痕、计数、可审计;凡是“悄悄变小”的数据集,都默认带偏。

5.3.3 训练侧:拟合的错觉

  1. T-1|默认划分刷高成绩的错觉。机理:MoleculeNet 一类加载器的默认划分多为随机划分(Wu et al., 2018),而分子数据高度同质,随机划分近似开卷考试——考题的近亲都在练习册里。症状:随机划分 ROC-AUC 冲上 0.9,骨架划分跌回 0.7 上下;真实虚拟筛选更接近后者的条件。对策:结论一律以骨架划分为准,随机划分只作对照并同报差值;这与 1.3 节的口径一致。

  2. T-2|类别不平衡下用准确率自欺。机理:Tox21 类任务的类别不平衡(class imbalance)可以到十比一以上,准确率的分母被负例主导,全预测负例即可拿高分。症状:accuracy 0.92 看似可用,换成 AUC 或平衡准确率就原形毕露——模型只学会了“说负例”。对策:不平衡任务改用对类别先验不敏感的指标(AUC、PR-AUC、平衡准确率),训练侧按 3.7 节加权损失或重采样;指标语义见 3.3 节

  3. T-3|多任务把缺失当负例。机理:多任务标注矩阵稀疏,“未测”不等于“无活性”;把缺失值直接填零,等于向模型注入成片的错误标签。症状:任务越多指标越差;给某任务补充数据,无关任务反而波动。对策:损失计算按掩码跳过缺失项,核对加载器的掩码语义——3.7 节的 Tox21 管线已内置,自行处理数据时别用零填充代替掩码。

  4. T-4|层数迷信与感受野不足。机理:一层消息传递后,节点只看得到相邻的键;要覆盖整个分子,层数须与感受野(receptive field)需求匹配,即分子图直径的量级,继续加深则被过度平滑(over-smoothing)抵消——节点表示趋同,判别力不升反降。症状:盲目加深后曲线平台甚至回落;太浅的网络连取代基与母核的关系都覆盖不到。对策:层数从小往大扫,配 3.5 节的读出函数与残差连接;机理见 3.4 节

  5. T-5|小数据单种子下结论。机理:千级样本上,初始化与数据顺序的随机性足以让指标波动数个百分点,单次运行的方差与待比较的模型差距同量级。症状:换个种子排名反转;文献里 0.02 的提升别人复现不出。对策:至少三到五个种子,报均值与标准差,差距小于标准差量级就不下结论;3.8 节的协议是模板,Kapoor 与 Narayanan(2023)给出的对照组建议同此。

5.3.4 评估侧:结论的成色

  1. E-1|测试集调参。机理:测试集一旦参与任何决策——选超参、选停止轮数、选特征——它就从考卷变成练习册,信息经人这个通道回流进模型。症状:测试指标次次新高,换一批新数据即崩;不同笔记本里的“测试集”其实已被看过几十次。对策:决策只对验证集做,测试集只在最终报告前碰一次;3.8 节的诚实协议即为此设计。Kapoor 与 Narayanan(2023)把它列为泄漏的典型类别。

  2. E-2|指标选择偏差与早富集忽视。机理:虚拟筛选的成本结构决定“排在前面的几百个里有多少真阳性”比全局 AUC 更要紧;同一对模型在不同指标下可以一好一坏,指标选偏即结论选偏。症状:AUC 相近的两个模型,富集能力差出数倍;按 AUC 选模型,湿实验团队却按顶部命中率验收。对策:按下游用法选指标——排序任务补报早富集(early enrichment)与 PR 曲线(3.3 节3.7 节)。

  3. E-3|生成模型的单一指标作弊。机理:目标导向生成的打分函数只是性质的代理,代理必有缝。惩罚化 LogP(penalized LogP)不充分惩罚超长链与反常稠环,优化器就造出高分长链“怪物”——既不可合成也无药理意义。症状:分数逼近理论上限,分子却像聚合物;有效性满分、类药性趋零。对策:多指标面板联合报告(有效性、唯一性、新颖性、QED、SA),顶部分子人工抽检;GuacaMol(Brown et al., 2019)与 MOSES(Polykovskiy et al., 2020)是现成面板,见 4.1 节

  4. E-4|不同划分与数据集的结果横比。机理:式 (5.3-1) 已说明,指标是四元组的函数;文献表格常抹去后三项,只留模型名与数字。症状:拿甲文随机划分的 0.85 去压乙文骨架划分的 0.78,得出颠倒的结论。对策:横比前先对齐四元组——同数据、同划分、同指标定义;对不齐就自己按同一协议复跑,或只比同文内的相对差距。4.7 节的前沿阅读以此为前提。

定义

早富集(early enrichment)。排序任务只取顶部结果衡量命中率:富集因子 EFx 等于顶部 x 条里的命中率除以全集命中率,EF 大于 1 即优于随机排序。它对齐虚拟筛选的真实成本结构——预算只够合成排序前端的几十个分子,全局 AUC 的高低与其无直接换算关系。筛选导向的报告应把 AUC 与早富集并排给出,缺一项,结论就只对了一半。

警示

“我 AUC 0.95 了”——对外说之前的自查五问。①划分方式是什么,随机还是骨架?随机划分的高分先打对折看待(T-1、D-2)。②测试集一共参与过几次决策?只要有一次,它已不是测试集(E-1)。③正例率多少,指标与它匹配吗?严重不平衡下 accuracy 无意义(T-2)。④几个种子?均值与标准差各是多少?单种子的高分不可外推(T-5)。⑤数据清洗过吗,重复与近重复的去除有记录吗?没有记录就当作没做(D-1、D-2)。五问有一问答不上来,这个 0.95 就还不到说出口的时候。

习题 5.3-1

Tox21 某测定的正例率为 5%。(a) 求全预测负例的分类器的 accuracy、balanced accuracy 与 ROC-AUC。(b) 一个模型 accuracy 0.95、召回为 0,说明什么?(c) 该任务除 accuracy 外至少应补报哪两类指标,理由是什么?

参考解答

(a) 负例占 95%,全负分类器把它们全部分对,accuracy = 0.95;真阳性率 TPR = 0,真阴性率 TNR = 1,balanced accuracy = (0+1)/2 = 0.5;全负分类器的得分是常数,任何阈值下都无排序能力,AUC = 0.5。(b) 0.95 全部来自类别先验,模型学到的与化学无关;这正是 T-2 的机理——准确率在不平衡任务里度量的是先验,不是判别力。(c) 至少补两类:一是对类别先验不敏感的判别指标(ROC-AUC 或 PR-AUC,PR-AUC 在极不平衡时更灵敏);二是对齐筛选用法的排序指标(召回率或早富集,见 E-2 的定义框)。两者分别回答“学没学到”与“排在前面的是不是真阳性”。

5.3.5 六周学习路线:从地基到生成

本书的三大框架天然给出一条递进路线:RDKit 打地基,DeepChem 讲预测,TorchDrug 讲生成,各占两周。六周不是魔法数字,是三段“读—跑—测”循环的容器:每段先读对应小节与官方文档,再跑通实操,最后用自测问题验收。每周有一个交付物——能拿给别人看的产物;每周有一道自测——过不了关就不收尾。总览见图 5.3-2 与下方周次表。

六周路线:RDKit 地基(第 1–2 周)、DeepChem 性质预测(第 3–4 周)、TorchDrug 分子生成(第 5–6 周),每周配交付物与自测 六周路线:三段递进,每周一个交付物、一道自测 周 × 主题 × 交付物;自测不过关,本周不收尾——进度服务于掌握 阶段 / 周次 第 1 周 第 2 周 第 3 周 第 4 周 第 5 周 第 6 周 RDKit 地基 第二章 2.1–2.7 表示、清洗与指纹的地基 配官方 Getting Started 实操 对象与 SMILES 清洗·指纹·反应 DeepChem 预测 第三章 3.1–3.8 基线到图卷积与诚实协议 复现 Tox21 · 双划分多种子 特征化与基线 GCN·骨架划分 TorchDrug 生成 第四章 4.1–4.6 跑通 GCPN / GraphAF 沙箱 5.2 · 生成与评估 教程跑通采样 评估作弊面 交付物 批量解析脚本 (含失败清单) 清洗报告 (去重与计数) 基线指标表 (ROC 与 AUC) 双划分×5 种子 对比表 训练曲线 与采样样本 生成质量报告 (含人工抽检) 自测 默画数据流 讲清相似性 讲透 ROC 解释高分来历 画逐原子决策 讲作弊机理 交付物证明“做过”,自测证明“懂得”;两者齐备,一周才算完成。
图 5.3-2 六周学习路线的甘特式总览。三个阶段各占两周:RDKit 地基(第 1–2 周,第二章 2.1–2.7,配官方 Getting Started 实操)、DeepChem 性质预测(第 3–4 周,第三章,复现 Tox21 并执行诚实评估协议)、TorchDrug 分子生成(第 5–6 周,第四章,在 5.2 节的锁定沙箱中跑通 GCPN 与 GraphAF 教程)。每周一横列给出交付物与自测;赭色自测行是验收线——图上看似进度表,实际是一张“是否真的学会”的检查表。
  • 第 1 周 · 分子对象与表示(2.1–2.3)
    Mol 对象、SMILES 读写与规范化、SMARTS 匹配;对照 RDKit Getting Started 相应篇目逐例敲一遍。交付:批量解析脚本——一万行 SMILES 进,规范化分子与失败清单出。自测:合上书画出 SMILES→Mol→规范化→指纹的数据流,并说出每一步丢掉的信息。
  • 第 2 周 · 指纹、描述符与清洗(2.4–2.7)
    摩根指纹与 Tanimoto、描述符、2.6 节清洗工序、反应表示。交付:小数据集清洗报告——去重前后计数、互变异构统一数、解析失败率。自测:向同学讲清 Tanimoto 为何落在 0 与 1 之间、两位指纹碰撞意味着什么。
  • 第 3 周 · 特征化与基线(3.1–3.3)
    DeepChem 三层抽象、特征化管线、随机森林基线与 ROC。交付:Tox21 单任务基线笔记本与指标。自测:讲透阈值、真阳性率与 AUC 三者的关系,并回答“基线不过关为什么不许上神经网络”。
  • 第 4 周 · 图卷积与诚实评估(3.4、3.5、3.7、3.8)
    消息传递与读出函数、多任务掩码、骨架划分与多种子协议。交付:双划分 × 五种子的对比表,附标准差。自测:面对“我的 0.95 是不是假的”,把 5.3.4 的自查五问完整答一遍。
  • 第 5 周 · 生成入门(4.1–4.4)
    在 5.2 节的 torchdrug-arch 沙箱内跑通 GCPN 或 GraphAF 官方教程,固定全部种子。交付:训练曲线与采样分子集。自测:画出逐原子决策流,标出每一步的“策略来自哪里、价值来自哪里”。
  • 第 6 周 · 生成评估(4.5、4.6,面板回到 4.1)
    多指标面板评采样集:有效性、唯一性、新颖性、SA 与 QED,顶部分子人工抽检。交付:一页生成质量报告。自测:讲清 penalized LogP 作弊的机理,并给出两条对策。
方法

每周收尾的自测四问(费曼式验收)。①合上书,能否画出本周内容的流程图或数据流?②能否向同学讲清核心概念,并接住三个追问?③能否从空目录出发,凭锁定环境复现本周交付物?④能否说出本周方法的一个失效场景——什么情况下它不适用?教学上这是费曼技巧(Feynman technique)的变体:能讲清才算学会,能画图才算理顺,能复现才算掌握。四问有一问卡壳,就为该周多留一天;六周是容器,不是死线。

5.3.6 三个进阶课题:承接全书的下一步

课程止于六周,学习不止。下面三个课题各以一条主线为主、兼触另外两条,规模控制在数周之内,数据全部公开可得。总览见表 5.3-1,逐个展开附卡点提示(sticking-point hint)——数据从哪来、哪一步最容易翻车。

表 5.3-1三个进阶课题总览
课题支线章节核心交付最易翻车处
① ChEMBL 单靶点 pIC50 预测1.3 · 2.6 · 3.3 · 3.5 · 3.8清洗→骨架划分→基线→GNN→多种子报告活性单位与关系符号混杂;重复测量未聚合
② 分布学习复现(MOSES 面板)4.1 · 4.5全套指标面板,与官方基线对照未沿用官方划分;解码温度未报告
③ 目标导向生成与作弊面分析4.1 · 4.4 · 4.6换打分函数重训+作弊面分析奖励未归一;只看单一分数收工

课题一:ChEMBL 单靶点 pIC50 预测

从 ChEMBL 网页接口取某一靶点的 IC50 标注,固定 release 版本号并记录哈希。协议完整走一遍诚实流程:2.6 节清洗(去盐、互变异构统一、去重)→ 1.3 节骨架划分 → 描述符加随机森林基线(3.3 节)→ GraphConv 或 AttentiveFP(3.5 节)→ 三到五个种子报均值与标准差(3.8 节);RMSE 与 Spearman 相关系数同报,随机划分与骨架划分同报。

卡点提示。数据侧两处最易翻车:其一,单位与关系符号——nM 与 μM、“<”与“>”的记录混在原始表里,不过滤、不换算就全盘皆输,只取等号记录是最稳的起点;其二,同一化合物多次测量要按统一规则聚合(如取中位数),直接展开等于给常测化合物加权。pIC50 = −log₁₀(IC50[mol/L]),换算失误就是一个数量级的错误,先在两三个已知分子上对账再批量算。

课题二:分布学习复现(MOSES 指标面板)

在 MOSES 语料上训练一个 SMILES 语言模型基线,采样后跑全套面板:有效性、唯一性、新颖性、FCD、片段与骨架相似度(Polykovskiy et al., 2020),并与官方公布的基线对照。分布学习(distribution learning)的评估要义见 4.1 节:模型学到的是训练集的分布,不是某个单一分数。

卡点提示。官方 train/test 划分必须原样沿用,自造划分后 FCD 与新颖性全部失去可比性;解码温度与每个分子的采样数直接改变唯一性与多样性,数值必须写进报告;FCD 依赖预训练模型,按 5.2 节锁定版本。

课题三:目标导向生成与作弊面分析

4.6 节 GraphAF(或 4.4 节 GCPN)的奖励从 penalized LogP 换成 QED,或 QED 与 SA 的加权和;固定预算重训,比较两代生成分布的漂移;然后主动找新打分函数的作弊面——哪类骨架能刷高分而不成药。目标导向生成(goal-directed generation)的打分函数是人给的价值观,换一个函数就换一种作弊方式。

卡点提示。奖励两项先归一到可比尺度,否则策略梯度在两项之间失衡(4.3 节的基线减方差同此理);TorchDrug 只在 5.2 节的 torchdrug-arch 沙箱中运行,绝不与主力环境混装;每个种子的顶部分子留档并人工抽检——面板数字与“分子可用”之间,永远隔着人的眼睛这一道关。

习题 5.3-2

设计题:朋友按你的论文复现课题一,结果对不上——pIC50 的 RMSE 差出 0.4。请写一份不少于八条的复现诊断清单,每条给出核对对象与不一致时的典型症状。

参考解答

①环境:锁定文件与解释器版本(5.2 节),不一致时 import 崩溃或指标在末位漂移;②数据版本:ChEMBL release 号与文件哈希,不一致时样本数先对不上;③清洗参数:去盐口径、互变异构规则、去重键,不一致时分布漂移、近重复复活;④划分:划分器类型、seed、比例,不一致时测试指标系统性偏移(骨架划分更严,数值更低);⑤特征:指纹半径与位长、描述符版本,不一致时基线就对不齐;⑥训练种子与早停轮数:不一致时指标在标准差内抖动却被当成差异;⑦指标定义:阈值、平均方式、对数底,不一致时差零点几纯属口径;⑧流程顺序:笔记本单元依赖、缓存目录,不一致时重跑顺序不同结果不同;⑨测试集使用记录:自己那份被“看”过的次数,症状是朋友跑出的更低——此时偏低的一方更接近真相。诊断次序按 5.3.1 的管线走:从②③查起,最后才怀疑模型本身。

5.3.7 收官:三条主线与持续学习

全书三条主线至此可以收拢。第一条是表示(representation):分子先变成数,化学的保留与丢失在表示里就已决定——1.2 节的三种面貌、第二章的 RDKit 工具、3.2 节的特征化管线层层展开,结论只有一句:表示的上限就是模型的上限。第二条是评估(evaluation):分数是四元组的函数(式 5.3-1),1.3 节的骨架划分、3.3 节的基线与 ROC、3.8 节的诚实协议、4.1 节的生成面板一路铺设,结论的成色取决于协议,不取决于模型新旧。第三条是生成先验(generative prior):第四章把生成模型拆成分布先验加目标引导,先验来自数据,引导来自打分函数,而打分函数必有可钻的缝——防作弊靠多指标面板加人的眼睛。三条主线相互约束:换表示改变评估难度,换打分函数改变生成分布,评估协议决定前两者的结论是否可信。

主页与 5.1 节反复重申的那句话在此作结:框架会老去,原理不会。RDKit 逐年迭代,DeepChem 的稳定版停在 2.8.0,TorchDrug 冻结于 0.2.1 而思想由 5.1 节的 Graphium 等活跃项目承接——工具层五年一换,清洗、划分、基线、多种子、多指标这套原理层的检查清单不随任何版本作废。学工具,读官方文档;学原理,回到各章追问“为什么”的段落。

往后的路是一个循环。读论文:先读方法与评估节,用四元组拆解结果表,再判断数字的成色;复现:从 5.2 节的锁定环境起步,以 5.3.6 的课题练手,让每一个结论都经得起别人重建;参加社区基准:GuacaMol、MOSES 一类公开面板(Brown et al., 2019;Polykovskiy et al., 2020)提供现成的协议约束,让别人的标准管住自己的手。最后回到起点:1.1 节的药物发现漏斗。Scannell 等(2012)诊断出单位研发投入的新药产出数十年间下降了一个数量级以上——更快的模型并不自动等于更多新药。分子机器学习的位置在漏斗之内;诚实的评估,是它留在漏斗之内的资格。全书至此收束,愿这六周与三条主线,成为你继续走下去的地基。

习题 5.3-3

论述题:以课题一(pIC50 预测)或课题三(目标导向生成)为例,论述表示、评估、生成先验三条主线如何在同一课题中同时出现、相互约束。

参考解答

以课题一为例。表示:描述符与分子图两条路线对应两族模型——指纹加随机森林,或图加 GNN;手性是否编码、电荷是否保留,直接决定模型能否区分立体异构的活性差异,这是“表示的上限即模型的上限”。评估:骨架划分划出外推的难度,多种子给出噪声的标尺;表示换档后,上一族模型的指标基准不能直接平移到下一族,评估协议是两条路线公平比较的前提。生成先验看似缺席,实则隐含:训练数据本身构成化学空间上的经验先验,模型在稀疏区域的外推失效即先验失效;若把课题延伸为“按性质生成再预测回填”,先验就以显式形式登场。以课题三为例则更直观:先验是训练分布,奖励是引导,二者拉锯决定生成分布的形状;评估要防打分函数作弊,表示(图与字符串)决定可微性与作弊面大小。论述的关键在给出至少两处“相互约束”的具体例子——例如换表示改变评估难度、换打分函数同时改变生成分布与作弊面——能说清约束的方向,才算贯通三条主线。


关键术语

数据泄漏 (data leakage)
测试信息经任何通道进入训练决策,使指标虚高、结论不可复现。
选择偏差 (selection bias)
样本进入或退出数据集的机制与任务相关,留下的数据带方向的偏。
近重复 (near-duplicate)
骨架相同、侧链微调的分子对;随机划分下跨集泄漏的主要来源。
骨架划分 (scaffold split)
按分子骨架分组划分数据集,测试集含未见骨架,模拟真实筛选条件。
互变异构体 (tautomer)
质子位置不同的同分异构形式;不统一会使同一分子分裂成多个样本。
类别不平衡 (class imbalance)
正负例比例悬殊的状态;此时准确率度量先验而非判别力。
感受野 (receptive field)
消息传递网络中一个节点可见的子图范围,由层数决定。
过度平滑 (over-smoothing)
层数过多后节点表示趋同、判别力下降的现象。
早富集 (early enrichment)
排序顶部命中率的度量(如富集因子),对齐虚拟筛选的成本结构。
惩罚化 LogP (penalized LogP)
LogP 减去合成难度与环惩罚的打分函数;单一优化时的经典作弊面。
分布学习 (distribution learning)
学习训练集分子分布并从中采样的生成范式,以面板而非单分评估。
多种子报告 (multi-seed reporting)
以多个随机种子重复实验并报均值与标准差的报告规范。

参考文献与延伸阅读

  1. Tropsha A, Gramatica P, Gombar VK. 2003. The importance of being earnest: validation is the absolute essential for successful application and interpretation of QSPR models. QSAR & Combinatorial Science 22(1): 69–77.
  2. Fourches D, Muratov E, Tropsha A. 2010. Trust, but verify: on the importance of chemical structure curation in cheminformatics and QSAR modeling research. Journal of Chemical Information and Modeling 50(7): 1189–1204.
  3. Wu Z, Ramsundar B, Feinberg EN, et al. 2018. MoleculeNet: a benchmark for molecular machine learning. Chemical Science 9(2): 513–530.
  4. Brown N, Fiscato M, Segler MHS, Vaucher AC. 2019. GuacaMol: benchmarking models for de novo molecular design. Journal of Chemical Information and Modeling 59(3): 1096–1108.
  5. Polykovskiy D, Zhebrak A, Sanchez-Lengeling B, et al. 2020. Molecular Sets (MOSES): a benchmarking platform for molecular generation models. Frontiers in Pharmacology 11: 565644.
  6. Kapoor S, Narayanan A. 2023. Leakage and the reproducibility crisis in machine-learning-based science. Patterns 4(9): 100804.
  7. Scannell JW, Blanckley A, Boldon H, Warrington B. 2012. Diagnosing the decline in pharmaceutical R&D efficiency. Nature Reviews Drug Discovery 11(3): 191–200.