周启涛生物技术工作室
其他前沿2025/01/16· 编译自 Nature

IF50.5|MatterGen:面向无机材料设计的生成式模型

扩散模型直接生成稳定、新颖、满足多目标约束的无机晶体结构。

扩散模型直接生成稳定、新颖、满足多目标约束的无机晶体结构。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

材料设计是能源存储、催化、碳捕集等领域技术突破的关键。传统方法依赖实验和人类直觉,候选材料测试数量有限,迭代周期长。高通量筛选和机器学习力场加速了材料发现,但受限于已知材料库,且难以高效定向搜索目标性质。生成式模型为逆向设计提供了新思路,可直接生成满足目标性质约束的新材料结构。然而,现有生成模型生成稳定结构的成功率低,或仅能处理有限元素子集和少数性质约束,限制了其实际应用。

科学问题

卡在哪里: 现有生成模型在生成稳定晶体方面成功率低,且大多仅能优化形成能等少数性质,无法满足多目标约束。同时,模型训练数据规模有限,生成结构距离DFT局部能量最小点较远,导致后续验证成本高。

本文要回答: 开发一个能够生成稳定、多样、新颖无机材料,并可通过微调满足广泛性质约束的生成式模型。

技术路线

作者主要用了:扩散模型、等变分数网络、适配器微调、DFT验证、MLFF预筛选

作者设计了一个针对晶体结构的扩散模型MatterGen。前向过程分别对原子类型、坐标和晶格施加物理启发的噪声,逆向过程通过等变分数网络联合去噪。在无标签结构数据上预训练后,引入适配器模块,利用带性质标签的数据进行微调,结合无分类器引导实现条件生成。该设计使模型能够处理周期性、对称性,并灵活适应不同下游任务。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了MatterGen的整体框架。a部分说明扩散过程分别对原子类型、坐标和晶格施加噪声,逆向过程逐步去噪生成结构。b部分显示等变分数网络在大规模稳定结构数据集上预训练,并通过适配器模块注入性质标签进行微调。c部分表明微调后的模型可针对化学组成、对称性和标量性质等不同约束进行条件生成。

核心亮点

亮点 1|生成稳定性显著超越基线

在1,024个生成结构中,78%的DFT能量位于MP凸包0.1 eV/atom以内,75%位于Alex-MP-ICSD凸包0.1 eV/atom以内。生成结构与DFT弛豫结构的平均RMSD低于0.076 Å,比氢原子半径小近一个数量级。与CDVAE和DiffCSP相比,MatterGen-MP的SUN结构比例提高60%,RMSD降低50%;使用更大数据集后,SUN比例再提高70%,RMSD降低5倍。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2评估了MatterGen生成结构的质量。a部分展示随机生成的晶体结构示例。b部分显示生成结构的能量分布,大部分位于凸包0.1 eV/atom以内。c部分显示生成结构与DFT弛豫结构的RMSD分布,中位数低于0.076 Å。d部分显示唯一性和新颖性随生成数量的变化。e和f部分对比了MatterGen与基线模型的SUN比例和RMSD,MatterGen显著优于CDVAE和DiffCSP。

亮点 2|大规模生成保持多样性与新颖性

生成1,000个结构时唯一性为100%,生成1,000万个结构时唯一性仍达52%,且61%的结构相对于Alex-MP-ICSD是新结构。模型还重新发现了超过2,000个训练中未见过的ICSD实验结构,表明其具有生成可合成材料的能力。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3比较了MatterGen与替代法和RSS在化学系统探索中的表现。a和b部分显示MatterGen在不同系统类型和元素数量下生成的SUN结构比例均最高。c和d部分显示MatterGen在部分探索和充分探索系统中发现的凸包上独特结构数量最多,尤其在五元系统中优势明显。e部分展示V–Sr–O系统的凸包图,MatterGen发现了3个新结构。

亮点 3|化学系统探索效率优于传统方法

在九种三元、九种四元、九种五元化学系统中,MatterGen生成的SUN结构比例均最高。在部分探索和充分探索系统中,MatterGen发现的凸包上独特结构数量最多。在五元系统中,MatterGen仅用10,240个样本就超过了替代法(约70,000样本)和RSS(约600,000样本)的性能。在V–Sr–O系统中,MatterGen发现了3个新的凸包结构。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了性质引导生成的结果。a–c部分显示微调后模型生成的SUN结构性质分布向目标值偏移,即使目标值位于数据分布尾部。d–f部分展示每个任务中性质最优的生成结构及其性质值。g和h部分显示在有限DFT计算预算下,MatterGen发现的满足极端性质约束的SUN结构数量远多于筛选方法,且随预算增加持续增长。

亮点 4|性质引导生成实现极端目标

针对磁密度、带隙和体模量三个任务,MatterGen微调后生成的SUN结构性质分布显著向目标值偏移,即使目标值位于数据分布尾部。在体模量任务中,仅用180次DFT计算就发现了106个SUN结构(95种不同组成),是筛选方法的2倍多,而标记数据集中仅2个材料满足条件。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了多目标设计低供应链风险磁体的结果。a部分显示联合微调模型生成的SUN结构在磁密度和HHI分数上均接近目标值,而单目标模型仅优化磁密度。b部分显示联合微调后Co和Gd等高风险元素几乎被完全消除。c部分展示Pareto前沿上的生成结构及其性质。

亮点 5|多目标设计降低供应链风险

联合微调磁密度和HHI分数后,MatterGen生成的SUN结构同时满足高磁密度(0.2 Å^-3)和低HHI(1,250)目标,且几乎完全消除了Co和Gd等高风险元素。模型还重新发现了67个训练中未见过的ICSD无序结构,其中许多与已知永磁材料相似。

亮点 6|实验验证生成材料可合成

从体模量微调模型生成的候选材料中,实验成功合成了TaCr2O6,其结构为MatterGen预测的有序结构的无序版本。DFT预测体模量为222 GPa,实验通过纳米压痕估算体模量最高达169 GPa(158±11 GPa),与目标值200 GPa偏差在20%以内。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 扩散模型、等变分数网络、适配器微调、DFT验证、MLFF预筛选
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 关注材料信息学、生成模型或计算材料设计的研究者。

带走一句

扩散模型结合大规模预训练和适配器微调,为材料逆向设计提供了强大工具,可高效生成满足多目标约束的稳定新结构。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。