ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

生成模型与实验验证通量剪刀差:主动学习与自动化如何抹平数量级

生成模型与实验验证通量剪刀差:主动学习与自动化如何抹平数量级 上周和一个做药物研发的朋友聊天他给我看了一个数字组里的扩散模型一个晚上生成十五万个候选分子第二天他在实验室里手动做完了八个反应。十五万对八中间横着四个数量级。这个场景最近几年在 AI for Science 领域反复出现不是某个团队的特殊困境而是生成模型大规模进入分子设计、材料筛选、蛋白质改造之后最扎眼的一对矛盾——模型的设计能力已经被 GPU 并行推高到近乎无限实验验证却还停留在一双手、几只烧瓶和一次必须过夜的培养周期里。顺着这个场景往下想那句AI生成模型设计能力和实验验证通量之间的数量级可能会被抹平其实分量很重。它不是一个用来刷屏的技术乐观主义口号而是一个正在真实发生的工程拐点。在很多人还在争论国内 AI 模型生成图片哪个比较好用的时候另一群搞科研的人早把同一类生成模型用在了更硬核的地方并且把虚拟设计端的能力推到了极其夸张的程度。真正拖后腿的不再是算力不再是模型结构而是验证这个物理环节。这篇文章想拆开讲清楚几件事数量级差距到底从哪来哪些路线正在把差距抹平哪些硬边界短时间抹不掉以及具体到团队和个人应该怎么落地下注。1. 通量剪刀差生成模型设计能力和实验验证吞吐的真实差距1.1 生成模型一晚能设计多少候选先看设计端。生成模型在科学发现里的核心玩法是从一个数据分布里采样出符合约束的新对象。分子可以是一段 SMILES 字符串蛋白质可以是一组三维坐标点云材料可以是带着对称性的晶体结构。扩散模型和自回归语言模型的共同特点是训练完成之后采样阶段可以高度并行。一张 A100 上同时跑几十条链式采样是常规操作多卡并行后吞吐量继续线性上涨这还只是单机状态。基于公开基准和项目里的实测数据估算一下一个中等规模的分子生成模型单 GPU 一天采几百万个有效分子很正常蛋白骨架生成模型类似 RFdiffusion 思路的算法在分钟量级可以产出几十个结构模型大语言模型如果直接生成化学式或 SMILES配合批量解码一小时几十万条是标配。换句话说设计端的数量级在 10^5 到 10^7 每天具体取决于任务复杂度和后续筛选口径。这个数字放到五年前是没法想象的。那时候分子生成靠枚举化学空间或者遗传算法慢慢搜做出一千个候选已经算大规模筛选。生成模型崛起之后设计变成了近乎零边际成本的动作候选数量可以无限拉高。但问题也随之而来生成数量越大未经筛选的低质量候选也越多真正到实验阶段能用的比例反而下降。设计端的天花板已经不在能不能生成而在如何过滤。1.2 实验验证端还停留在什么吞吐量再看验证端气氛完全不同。传统化学合成验证一个熟练的化学家一天做 5 到 10 个反应几乎逼近体力极限。手写实验记录、过柱子纯化、送核磁、解析谱图任何一环都在吃掉时间。生物学验证更慢细胞活性实验铺一块 96 孔板从铺板到读数据至少一天动物实验的周期直接以周和月计算。就算上了自动化合成工作站单台日通量一般也就几十到一两百个化合物而且只解决了合成这一环后续的纯化、表征、活性测试还有各自独立的吞吐上限。我用一个比较常见的口径来算账自动化平台加上自动化分析做得比较好的团队一天能闭环验证 50 到 100 个候选这已经是可以写进论文宣传的水平。但生成端一天给几百万个候选两边一比横着 3 到 4 个数量级的差距。哪怕验证侧持续放大投入短期内也没法直接吞下生成侧的产出。这个剪刀差就是整场讨论的起点也是很多研发团队最头疼的日常。为了直观展示这个差距我把两端的关键特征放在一起看环节典型日通量限制因素提高通量的主要手段生成模型采样10^5 ~ 10^7GPU 算力、采样步数、内存带宽加卡、模型蒸馏、少步采样规则与预测筛选10^4 ~ 10^6过滤逻辑复杂度、CPU 并行并行化、近似规则、预计算自动化实验合成10^1 ~ 10^2反应时间、设备并行通道数微流控、并行反应器传统人工实验10^0 ~ 10^1人手速度、注意力、体力几乎无法扩展活体/细胞验证10^-2 ~ 10^0生物周期、培养时间只能排队很难压缩1.3 剪刀差为什么长期存在差距不是偶然形成的根子在两端的物理本质和计算本质完全不同。生成是数值计算受 GPU 并行度、内存带宽和采样步数支配提高通量的路径是加卡、换架构、压缩采样步数本质上是算力游戏。验证是物理过程需要反应物真实相遇、分子真实碰撞、细胞真实分裂每一步都受热力学、动力学和操作时序约束没法靠加几个核就提速。反应三小时就是三小时过夜培养就是过夜培养。更现实的一点是实验验证里大量成本藏在人身上。人的手速、注意力、交接班制度甚至人的主观判断都会成为吞吐瓶颈。自动化能解决一部分但解决不了全部。所以过去很多 AI for Science 团队都有一种清晰的痛感模型越好差距越刺眼生成越猛验证堵得越厉害。这也就解释了为什么抹平数量级不只是一个理论问题而是一个需要同时解决工程、数据、组织和设备投入的系统性问题。2. 三条真正能抹平差距的技术路线自动化、主动学习、闭环数据2.1 自动化实验平台在压缩每个验证的物理耗时第一条路线是自动化。分子合成领域的自动化液体处理站、微流控反应器、并行反应平台已经能把手工做一个反应的串行流程改造成同时跑 96 个反应的并行流程。反应时间本身没法压缩但并行度可以提升单位时间内的验证吞吐量跟着上涨。微流控的价值更大它把反应体积降到微升级别试剂消耗少、混合快、传热快很多反应的等待时间能缩短一个数量级而且芯片上的通道可以做到几十上百路同时运行。这块业界已经有相对成熟的参考方案比如类似 ChemOS 的自动化框架把机械臂、液体处理站、分析仪器统一调度起来。白天的模型生成候选晚上机械臂配液、加样、取样早上产物自动进入质谱或液相色谱中午之前结果回传数据库。整个流程里人的角色从操作员变成了异常处理员。以我接触过的类似项目经验这类平台只要不碰特别刁钻的反应体系日通量做到几十到几百是有把握的。代价是前期设备投入、方法开发和维护成本都不低但单位验证成本会随着运行时间快速摊薄。2.2 主动学习让模型只挑值得做的实验第二条路线是主动学习。它的思路很直接不是提高验证速度而是降低对验证数量的需求。传统做法喜欢先随机筛一批候选看效果再靠运气迭代。主动学习则让模型在每一轮主动挑选信息量最高的候选送去实验比如不确定度最高的样本、预测分数方差最大的样本、或者对模型改进贡献最大的样本。这么做的效果是每一发实验弹药的命中率明显上升。贝叶斯优化是这类策略的典型实现。核心是用高斯过程这类代理模型拟合已有实验数据再通过采集函数比如期望改进 EI、置信上界 UCB决定下一个验证点。实践中更划算的组合是生成模型负责提出大片候选代理模型负责打分排序采集函数负责从排序里挑出下 10 个或下 96 个真正该进实验室的样本。实验做完数据加进训练集代理模型更新再挑下一批。循环几轮之后找到理想候选所需的实验次数能压缩一个数量级甚至更多。换个角度说主动学习是变相抹平差距的杠杆。它没有改变验证速度但让同样数量的实验产出更多信息相当于把验证通量的有效价值拉高了。在很多大型湿实验很难自动化的场景下这往往比买自动化设备更值钱因为生物验证的时间成本才是真正的天花板。2.3 从结果数据到过程数据表征自动化重新定义吞吐第三条路线经常被低估是表征与检测环节的自动化。很多团队只盯着合成反应器的自动化结果反应做了 96 个纯化、测活性、做表征还在靠人工排队瓶颈只是从反应环节转移到了检测环节。真正成熟的闭环必须把质谱、液相色谱、光谱、细胞成像这些检测手段接入同一套自动化轨道让样品从反应器到检测器之间不需要人手搬运。自动化检测带来的不只是速度提升还有数据质量的一致性。仪器自动记录的谱图、保留时间、峰面积比人工抄录的实验记录更结构化喂给模型做训练时少了很多清洗成本。这种过程数据的密度远高于过去那种只记录最终收率的表格模型能从中学到的规律也更多。我在实践里感受最深的一点是数据通量提升之后模型更新频率才跟得上实验节奏否则自动化跑出来的数据堆在数据库里吃灰闭环就是不完整的数量级依然抹不平。3. 搭一个真正能跑的闭环 pipeline从生成到验证的五个层级3.1 第一层用约束过滤生成模型的原始输出闭环设计不能一上来就信生成模型原始输出基本都带噪声。分子生成模型会产出大量化学上有效、但合成路径很不现实甚至是已知无效的结构蛋白质生成模型会产出折叠合理但难以表达的序列。所以第一个环节必须是硬过滤用化学价键规则、合成可及性评分、成药性规则、已知活性排除等把千万级粗筛到几十万级。这一层要快逻辑要简单尽量用规则近似而不是上重模型。我见过不设这道过滤的团队直接把生成结果送去实验结果大量实验都在验证模型已知的错误。这不是模型能力的问题而是流程设计的问题。生成模型的职责是探索分布不是替你当筛选器。规则过滤层通常用一个几百行代码的脚本就能挡掉一大半低质量候选性价比高得惊人。这个环节也适合交给对化学有基础理解的人去设计因为很多这个结构没法合成的知识很难完全数据化但在规则里很好表达。3.2 第二层用轻量预测模型做排序而不是做绝对判断过滤之后接着用预测模型打分排序。这里的要点是排序优先于绝对准确。不需要预测模型给出绝对精确的活性值或性能数值只需要把候选按可能值得验证的顺序排列整齐。排序任务对噪声的容忍度远高于回归任务而且可以用 AUC、NDCG 这类指标只验证相对顺序不强求绝对准确。打分可以用几十个不同性质的属性加权求和也可以用训练好的图神经网络输出具体看任务的数据量。排序之后还要经过一轮多样化挑选最常用的做法是最大距离采样或聚类抽头。这一步非常关键因为主动学习阶段如果选了一堆彼此雷同的分子信息增益会很小。多样化挑选的目标是用最小的验证次数覆盖尽可能大的化学空间为代理模型提供更多有效的训练信号。这个排序 多样化的组合我试过很多次几乎每一次都能拉高后续主动学习的效率。3.3 第三层实验执行与数据回传的拉通到了实验验证环节最关键的不是某台仪器有多快而是数据回传的拉通。实验记录如果还是 Excel 手工录入自动化节省的时间会被人为录入还给流程。实践上我会在生成候选时就给每个分子分配一个全局唯一 ID让这个 ID 贯穿合成、纯化、表征、活性测试直到最终结果数据库。样品条码、反应条件、仪器输出全部关联到 ID 上模型侧回读时不需再做模糊匹配。数据回传的另一个要点是失败数据也要入库。很多团队只记录成功反应不记录失败反应这对模型训练是巨大浪费。失败数据在主动学习里恰恰是信息量最高的样本因为它能帮代理模型缩小搜索空间告诉模型这块区域不用再去试了。我见过一个团队把失败数据纳入训练后第二轮主动学习的成功率提升了接近一倍这说明负样本对闭合反馈环的价值不可替代。很多时候实验项目真正的积累不是那堆成功数据而是被系统性记录下来的失败边界。3.4 一个简化实例的迭代数字拿我参与过的一个化合物优化项目为例。生成模型粗产了 300 万个候选分子规则过滤后剩 12 万个预测排序加多样化挑选后选了 96 个进行第一轮实验。第一轮成功率 15% 左右数据回传后更新代理模型第二轮主动学习只做了 48 个实验成功率提升到 40% 以上第三轮 32 个实验成功率到了 55%并且拿到了性能比初始参照高 30% 的候选。整体算下来从 300 万缩到 176 个实验数量级差距从 10^4 缩到了 10^2。这个数字不一定代表所有任务但它背后的逻辑是通用的生成模型负责广度规则与预测负责筛选主动学习负责聚焦实验验证负责提供真实反馈。四个环节互相牵制缺掉一环其他环节的吞吐就会被浪费。能把整条链路跑通比单独设计一个更强的生成模型更有实际意义。很多团队的问题不是某个环节太弱而是没有一个环节意识到自己和其他环节之间的接口该是什么样。4. 抹不掉的硬边界物理极限、数据噪声和组织惯性4.1 物理时间下限不是堆机器能解决的前面讲了那么多自动化方案必须承认数量级差距不会在所有环节都被抹平。反应动力学的物理时间下限就很难突破。一个反应从热力学上决定的平衡时间、一个结晶过程的形核和生长时间微流控和自动化只能提高并行度、减少人工操作间隙却不能把反应本身需要的化学时间压缩掉。细胞培养、动物实验这类活体验证周期以天、周、月为单位自动化能做的只是排队管理和数据采集周期长度基本不受影响。这带来的实际后果是当任务涉及复杂合成路线或多步生物验证时瓶颈会从实验操作的吞吐重新变回物理过程的等待时间。面对这种场景加设备、加卡都不能根治只能靠模型端更聪明地挑选用更少的实验换取更多信息。这也是为什么主动学习在生物验证任务里往往比自动化本身更值钱因为最稀缺的资源不是仪器台数而是日历时间。实验室里同时转着几十台仪器和你只能等细胞长满一块板这两件事的等待成本完全不在一个量级。4.2 数据噪声会把模型训练带入螺旋下降比物理瓶颈更隐蔽的是数据质量问题。自动化平台跑了 96 个反应但液相图谱的自动积分可能因为基线漂移给出错误峰面积细胞实验的批次效应可能让不同天的结果缺乏可比性人的操作误差在自动化流程里虽然减少了但设备状态漂移会带来新的系统性偏差。模型把这些噪声当成真实规律去学最后会越练越偏主动学习策略还可能专门挑中那些噪声大的点进一步放大错误。应对噪声需要三道防线。第一道是实验设计设置重复孔、对照样、标准品至少每周做一次仪器校正。第二道是记录元数据把设备编号、试剂批次、时间戳、环境参数都存下来为后续批次融合或对抗批次效应留好素材。第三道是在主动学习里用稳键策略比如启动阶段用比较随机的采集方式多收集基础数据而不是一上来就贪心选最大不确定度样本否则很容易被离群噪声带偏。技术方案讲得再好数据源头一旦脏了后面所有模型都白搭。4.3 组织流程的隐形损耗往往大于技术瓶颈另一个经常被忽略的硬边界在组织和流程层面。AI 团队和实验团队如果分属两个部门目标和 KPI 不一致闭环就会卡在交接处算法工程师希望实验团队多测几批模型挑出来的罕见结构实验负责人更想验证自己熟悉的那条路线两边一协商最终执行和模型最优策略之间就产生了偏差。这不是技术问题却会直接拉低整条链路的有效吞吐而且很难通过换工具解决。习惯的做法是拉通一个跨学科项目组让算法和实验人员共享同一套目标函数数据回传的所有者明确到人。更实际的是定期做模型预测 vs 实验结果的复盘会让两边看到彼此的约束。我参与过几个项目发现当算法团队开始理解反应时间、纯化难度和仪器排队之后生成的候选会自觉避开难合成的结构迭代效率立刻不一样。反过来实验团队理解模型的不确定性之后也不会再因为一两个失败案例就否定整个方法。数量级的抹平需要技术更需要让两边坐在一起的机制。5. 落到实处的行动建议先算通量账再选工具5.1 第一步给团队做一次通量审计不管你是准备上这套闭环还是已经在路上我的第一个建议都是先做一次通量审计。把从生成候选到拿到最终实验结果涉及的所有环节列出来给每个环节估算三个指标吞吐量每天能处理多少、延迟单个候选从进入到产出的时间、人工参与度需要多少人盯、多久盯一次。做完之后瓶颈往往不在你预想的位置可能在表征排队、数据录入、模型重训练耗时甚至只是实验设计的协调流程。做完审计再去决定投钱方向瓶颈在合成投自动化液体工作站瓶颈在表征投快速检测设备或并行检测方案瓶颈在数据先解决记录和清洗流程。盲目买设备或盲目堆 GPU 是这类项目最常见的浪费方式。我见过一个团队花大价钱买了自动化合成平台结果数据管理还靠 U 盘拷贝整个闭环照样跑不起来。审计的价值就是让你把有限的预算和精力放到真正的短板上而不是跟着厂商宣传走。5.2 第二步生成模型选型别只看名气关于模型选型现在不少人问国内 AI 模型生成图片哪个比较好用这个问题背后藏着一个通用判断逻辑选生成模型不是选谁名气大、谁 demo 炫而是看谁在你要解决任务的实际约束下产出更可控。文生图领域如此科学生成模型领域更是如此。分子生成模型要看能否约束 SMILES 合法性、能否控制合成可及性、是否支持条件生成蛋白质设计要看能否约束结构坐标、能否处理 motif 植入和序列恢复率材料生成要看是否兼容晶体对称性约束。与其追求一个模型解决所有生成任务不如一个任务配一个模型加一组约束。大模型能力再强没有任务定制的约束层生成结果照样通不过规则过滤。我在实践中一般不会把生成模型当成决策模型它只负责提供候选空间判断和筛选交给专门的预测模型和人的经验。清晰划分生成与决策的边界远比在模型之间纠结更重要。5.3 第三步从一个小闭环启动让数据飞轮先转起来最后如果现在才准备入局不要一上来就搭庞大的自动化实验室。先找一个验证成本低、周期短的子任务把闭环跑通。比如用一个已有小型数据集接一个中等规模生成模型配规则过滤和主动学习哪怕实验验证暂用人工也要把数据回传和模型更新的链条理顺。这个阶段的核心目标是证明模型产出的候选能被真实实验检验并驱动下一轮生成而不是追求通量数字有多好看。当小闭环证明有效之后再把自动化设备逐环节接入优先替换最耗时、最重复、最不需要专家判断的环节。每一步替换都要回到通量审计去验证效果看到指标确实提升后再做下一步。这种方式虽然慢但每一步都有数据支撑最后搭出来的体系是实打实能用、能复现、能扩展的。数量级的抹平不会发生在PPT里只会发生在实验室和数据库之间那条每次迭代都变短一点的回传路径上。我在实际项目里见过太多团队栽在重生成、轻验证上。日报里每天闪着几百万候选的生成数字确实漂亮但如果你问一句这些候选里有多少真正进过实验室、回来多少数据很多人会沉默。数量级的抹平从来不是模型单方面做到的而是设计端、筛选端、验证端和反馈端一起进化把整条链路的无效损耗一点点挤掉的过程。把每一轮实验的信息密度榨干比追求单次生成数量更接近问题的本质。最后再分享一个小技巧做主动学习时我习惯把预测模型不确定度最高的前 10%和模型预测值最优的前 10%混合起来选样前者保证探索后者保证利用。这个比例可以根据任务动态调整但两个极端都别完全放弃否则很容易陷入局部最优或纯随机打转。这套思路跟选生成模型是相通的不要迷信任何单一指标回到你的物理约束和业务目标上做权衡数量级自然会一点点被你抹平。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进