“这个分子有毒吗?水溶性如何?会不会结合目标蛋白?”性质预测把这类问题转化为统计学习问题。DeepChem 把数据、特征化与模型三层解耦,恰好提供了一副合用的骨架,让这一领域的核心思想可以逐一挂上去讲。
本章的叙事是一条上升的阶梯:从传统机器学习基线,到图卷积,再到注意力聚合。每一级都在回答同一个问题——还能让模型多懂一点化学吗?而梯子的顶端不是最强的模型,是诚实的评估。
3.1
DeepChem 的三层抽象:数据、特征化、模型
Dataset、Featurizer 与 Model 的分工;统一抽象为何能大幅降低试错成本。
3.2
特征化管线:分子如何变成模型输入
从指纹向量到图张量;特征化是把化学先验注入模型的位置。
3.3
先立基线:随机森林与 ROC 曲线
基线为何不可跳过;树集成的原理;AUC 的概率解释与常见误读。
3.4
图卷积的来龙去脉:从谱方法到消息传递
谱图卷积到空间消息传递的演化;图卷积与图像卷积的本质差异。
3.5
消息传递的细节:GraphConv 与读出函数
消息—聚合—更新三步曲;神经指纹与神经消息传递;读出函数的置换不变性。
3.6
AttentiveFP:让网络学会看重点
图注意力机制的原理;由原子到官能团再到整分子的层次聚合。
3.7
多任务与类别不平衡:Tox21 的真实挑战
多任务的正则化效应;类别不平衡的应对之道;指标的选择。
3.8
训练之外:早停、超参与诚实的评估
验证集的角色;早停的原理;评估里常见的作弊手法与防范。