用AI生成数据回训AI会怎样?Nature称模型坍塌,这支团队拿出破解之法
生成式AI正在编织"梦境"——梦见数百万种全新材料。
然而,越来越多的质疑声此起彼伏:这些AI"创造"的材料,许多其实早已存在,甚至就潜藏于模型的训练数据之中。2025年Nature的一篇报道标题直击要害:"AI在梦中缔造数百万种新材料,它们真的可靠吗?"
这一困境的根源在于材料数据的匮乏与偏差。以二维材料为例,已知的稳定化合物数量极为有限,且大多集中于二元和三元体系。生成模型在这样"营养失衡"的数据上训练,其结果只能是反复产出已知结构的变体,而非真正的突破。
东南大学团队在National Science Review上发表的这项研究,给出了一个精巧的破解方案:DuALGen——一种双主动学习驱动的生成框架。它不依赖一次性产出,而是借助两个协同的主动学习循环,使模型在"生成-验证-学习-再生成"的闭环中持续迭代进化,最终发掘出超过10000种稳定的新型二维材料,其中数千种展现出优异的功能特性。
为什么AI生成材料会"失灵"?问题出在三个维度:
其一,训练数据本身存在偏差。已知的二维材料聚焦于少数元素组合与结构类型(例如过渡金属硫化物TMDs)。模型习得的并非"化学的通用规律",而是"数据中的统计倾向"。
其二,生成-再训练会陷入恶性循环。若把AI生成的"看似合理"的材料重新喂给模型,将产生什么后果?2024年Nature上的一项研究揭示了"模型坍塌"现象:当AI模型反复在自身产出数据上训练时,性能将逐步退化,多样性萎缩,错误累积。
其三,预测器本身亦存有偏见。常见的做法是用AI能量预测器评估生成材料的稳定性——但预测器同样是在已知材料上训练的,面对真正"前所未见"的材料时,预测误差将急剧放大。这便构成了一个悖论:你期望发现真正新颖的材料,但用于评估新材料的工具偏偏不擅长评估真正新颖的材料。
DuALGen的设计,正是针对这三大痛点逐一拆解。
DuALGen构建于晶体扩散变分自编码器(CDVAE)之上,包含两个协同运作的主动学习循环:
此循环的目标是:驱动生成模型探索更广阔的化学空间,而非在已知筛选出的热力学可能稳定候选区域的边缘反复徘徊。
它采用三重采样策略,从生成的一批候选材料中遴选出"值得用DFT验证"的那一小部分:
稳定性采样:借由形成焓预测器估算相对形成能ΔErel,筛除热力学上可能稳定的候选
新颖性采样:借助结构匹配器(StructureMatcher)量化结构差异,而非仅判断"是否完全相同"——能够识别出那些"虽有别但高度近似"的新变体
多样性采样:最大化生成材料与已知材料间的Wasserstein距离,保证被选中的材料分布于化学空间的不同方位,避免"蜷缩于同一角落"
被选中的候选材料经DFT验证后,纳入训练集重新训练生成模型——这正是"主动学习"的核心:每一次迭代,模型都在"变得更聪明",因为其训练数据在不断被更高质量、更多元的新材料充实。
随着生成模型探索愈发宽广的化学空间,一个难题浮现:新生成的材料与已知材料的分布差异日益拉大(分布漂移,data drift),致使稳定性预测器愈发失准——它从未见过这种"栖身于化学空间边缘"的材料,自然无法准确判断。
DuALGen的第二个循环专门应对这一难题。它从生成的候选材料中筛选三类"高价值样本"加入预测器的训练集:
分布外样本(OOD):计算每个生成材料周围的已知材料密度,密度越低,表明其距已知区域越远——越需被标记
稀有样本:计算生成材料之间的内部密度,密度越低,说明其在生成批次中亦属罕见——可增强多样性
高不确定性样本:借助XGBoost集成模型计算预测不确定性,高不确定性意味着模型"心中无数"——标记这些样本能最快地提升预测器表现
仅需10%的样本被标记,预测器在新材料上的准确率即可回升至0.8以上。相较于纯不确定性采样,密度感知采样效率更高,尤其在小样本规模下优势明显。
在标准的生成模型中,新材料的结构原型数量在首次迭代后便急剧衰减——生成10000个结构,仅能发掘5个新原型。而DuALGen每次迭代均能稳定发现约20个新原型。20次迭代后,累计发现326个新结构原型,是基线方法的3倍。
更为关键的是,DuALGen在20次迭代中每轮均能维持约30%的新颖率,而非AL方法的模型到第5轮时新颖率便已衰减至约1%。
从产出速度来看:DuALGen实现了每月约1000种新型二维材料的发现速度,是传统方法的30倍提速。
20次迭代后,DuALGen生成的候选材料中,41.42%具有负的相对形成能(比C2DB中已知最稳定材料更稳定),而基线生成模型仅为18.67%。
耐人寻味的是,DuALGen在早期迭代中稳定材料的比例反而略有下滑——这是因为随着模型着手探索四元、五元等"高阶"组成空间,稳定性预测器遭遇严重的分布漂移,评估失准。但随着迭代推进,主动学习不断校正预测器,稳定率稳步回升。
这一现象本身即是一项重要发现:它佐证了"双循环"设计的必要性——若仅有单一生成循环,预测器将持续给出错误引导,致使模型"偏离航向"。
DuALGen在Cu-I-Te三元体系上的表现尤为亮眼。C2DB中已知的二维材料在该体系中主要为二元化合物(分布于相图边缘),仅记录有两种三元化合物。
DuALGen在第3次迭代便发现了4种新的三元构型,其中一种的ΔErel为-0.18 eV/atom,已超越所有已知三元化合物的稳定性。继续迭代后,又发现ΔErel低至-0.32 eV/atom的更稳定材料。
仅凭少量有针对性的DFT计算,DuALGen便系统性地重绘了该体系的"稳定相图"。
团队将DuALGen发现的所有经DFT验证的稳定二维材料汇编为Gen2DB数据库(Generated 2D Materials Database),涵盖:
超过10000种热力学稳定的二维材料(不含放射性元素,满足电荷中性)
数千种高性能功能材料:宽带隙半导体、高迁移率材料、本征磁性材料
三个代表性案例:
p-3m1 ScOF:超宽带隙4.67 eV,七配位Sc中心——打破了Sc化合物中常见的六配位模式,或将带来新颖的电子特性
pcm Pt₂OC₂:超高空穴迁移率(1.279×10⁴ cm² V⁻¹ s⁻¹)+ 直接带隙0.7 eV——p型半导体的理想候选
p-3m1 Cr₂O₃:反铁磁有序(区别于常见的CrI₃、Cr₂Ge₂Te₆等铁磁材料),由接近180°的Cr-O-Cr键增强超交换相互作用实现
这些材料的合成路径均有实验线索支撑——例如ZrNCl(ScOF的结构类似物)已被合成,Cr₂O₃的二维形式亦已成功制备。
众多团队的做法是"生成一批 → 筛选 → 加入数据集 → 重新训练"。DuALGen印证了:不加甄别的"自噬式"训练将引发模型坍塌(novelty快速衰减)。关键在于采样策略——仅选择那些既稳定又新颖又多样的样本回馈给模型,而非全盘接纳生成结果。
第二个循环揭示了一个深层问题:生成模型探索越广,预测器越易失准。若不主动校准预测器,生成循环将逐步失效。这告诫我们:在材料发现中,"如何评估新材料"与"如何生成新材料"同等重要。
分布漂移恰恰是模型真正在"创新"的标志——若生成的材料总与已知材料分布高度重叠,则说明模型并未真正走出舒适区。关键在于设计好"导航系统"——使模型走出去的同时,评估工具也能紧随其后。
对于从事二维材料计算或实验的研究人员:
Gen2DB提供了一个可直接调用的"候选库"——超过10000种结构,附带CIF文件与形成能数据
DuALGen的框架设计(双循环+密度感知采样)可推广至其他材料体系乃至其他领域的生成式发现任务
DuALGen的成功昭示:AI材料发现的瓶颈并非生成模型的精度,而在于数据循环的设计。
一个优秀的生成模型是"发动机",但一辆能持续探索未知地形的越野车,还需配备导航系统(采样策略)与避障系统(预测器校准)。
DuALGen证明了"发动机"与两套辅助系统协同工作时的潜力——326种新结构原型、41%稳定率、30倍加速、10000+种新材料——这些数字背后蕴含着一个更为重要的结论:主动学习驱动的生成模型,能够突破"数据稀缺"的诅咒,实现真正意义上的持续发现。
对于正在探索AI材料发现的团队,DuALGen的设计范式值得认真借鉴——尤其是"密度感知采样"这一小巧而关键的创新,或为提升效率性价比最高的切入点。
论文信息:Xinyu Chen et al., "Continuous discovery of novel 2D materials via dual active learning-driven generative models,"National Science Review, 2026, nwag101.
代码与数据库:https://github.com/XinYu-Chen98/DuALGen-Exploring-novel-2D-materials-with-generative-model-and-active-learning