FAIR Chemistry 论文全景:OCP 仓库背后的原子模拟机器学习研究体系 📅 发布时间:2026/9/18 11:52:45 👁 浏览次数: FAIR Chemistry 论文全景OCP 仓库背后的原子模拟机器学习研究体系【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp本文系统梳理当前仓库所依托的 FAIR ChemistryMeta团队研究论文体系覆盖通用模型与架构、大规模数据集、生成模型、采样与分子动力学、催化与材料发现应用、训练方法以及电子结构预测等主题。结合仓库内 docs/core/uma.md、docs/catalysts/datasets/oc20.md、docs/core/generative_models.md 等文档与 src/fairchem/core/models 下的实现读者可以按图索骥把论文中的方法对应到可运行的模型、配置与数据上。一、论文体系的整体版图FAIR Chemistry 团队的研究围绕用机器学习加速原子模拟展开覆盖分子、材料与催化剂三大领域。从 docs/core/fair_chemistry_papers.md 可以提炼出八条主线通用模型与架构UMA、eSEN、EquiformerV2、eSCN 等神经网络结构数据集OC20、OC22、OC25、OMol25、OMat24、OMC25、ODAC23/25、OCx24、OPoly26 等大规模开源数据生成模型ADiT、FlowMM、FlowLLM、Crystal-text-llm 等材料/分子生成方法采样与分子动力学Adjoint Sampling、Adjoint Schrödinger Bridge 等扩散采样方法应用与发现CatTSunami、AdsorbML、Catlas 等催化应用训练方法与技术DeNS、JMP、FINETUNA、主动学习、共形预测电子结构与性质HELM、电子密度衍生性质、XRD 损失景观分析观点与综述大模型在催化剂发现中的挑战、电催化剂设计入门等。这些论文与仓库代码高度对应模型类论文对应 src/fairchem/core/models 下的uma/、escaip/、allscaip/目录应用类论文对应 packages/fairchem-applications-AdsorbML、packages/fairchem-applications-cattsunami 等应用包数据集论文对应 docs/catalysts/datasets、docs/molecules/datasets、docs/inorganic_materials/datasets 下的数据文档。二、通用模型与架构从等变 GNN 到通用原子模型UMA面向原子的通用模型家族2025UMAUniversal Models for Atoms是当前仓库中最重要的模型论文 arXiv:2506.23971。其核心设计为混合线性专家Mixture of Linear Experts, MoLE在 5 亿以上结构的训练规模下模型总参数量达 14 亿但通过动态路由每个结构实际只激活约 5000 万参数兼顾容量与推理速度。从仓库 docs/core/uma.md 可以看到 UMA 的路由输入需要四类信息输入说明Task指定要模拟的 DFT 理论层级omol、oc20、omat、odac、omcUMA-1.2 另增oc25、oc22Charge体系总电荷仅omol任务使用默认 0Spin体系总自旋多重度仅omol任务使用默认 1Elemental Composition无序的元素总组成每个元素有原子嵌入组成嵌入取所有原子嵌入的均值UMA 训练自 5 个不同 DFT 理论层级的数据集每个 task 对应一种理论层级嵌入推理时必须显式指定使用哪一个。仓库中 UMA 的实现位于 src/fairchem/core/models/uma包含escn_md.py等变主干、escn_moe.pyMoE 层、escn_md_block.py、outputs.py与nn/、triton/子模块预训练 checkpoint 配置见 configs/uma/benchmark/checkpoint 下的uma_sm.yaml、uma_md.yaml、uma_lg.yaml等。各 task 的适用域依据 docs/core/uma.md 整理omolwB97M-V/def2-TZVPDORCA6生物、有机化学、小分子药物、均相催化、聚合物等需要电荷与自旋多重度训练数据均为非周期性体系omcPBED3VASP药物包装、生物启发材料、有机电子与 OLEDomatPBE/PBEUVASP无机材料发现、光伏、合金、超导、电子与光学材料oc20RPBEVASP可再生能源、催化、燃料电池、化肥生产、塑料合成/升级回收odacPBED3VASP直接空气捕获、碳捕获与封存、CO₂ 转化oc25RPBED3VASP 6.4含偶极校正仅 UMA-1.2固液界面电催化不提供功函数输出oc22PBEU自旋极化仅 UMA-1.2氧化物催化与载体、能量转换与存储。eSEN平滑且富有表现力的原子间势2025eSENarXiv:2502.12147通过能量守恒测试在热导率、声子与材料稳定性预测上取得当时的最优结果。它同时解决了两类问题平滑性对结构扰动的连续响应与表现力对复杂相互作用的拟合能力。仓库中对应实现位于 src/fairchem/core/models/escaipEScAIP.py为入口配套configs.py、custom_types.py、modules/与utils/训练配置示例见 configs/escaip/training/backbone如H1024L8.yaml、H512L10.yaml、H640L10.yaml。EquiformerV2改进的等变 Transformer2023EquiformerV2arXiv:2306.12059在力预测上最高提升 9%、能量预测提升 4%并将吸附能计算所需的 DFT 计算量减少约 2 倍。其核心思路是用更高效的注意力机制取代传统 SO(3) 卷积中的张量积运算。仓库中保留有该模型的快照测试 tests/core/models/snapshots/test_equiformer_v2_deprecated.ambr。eSCN将 SO(3) 卷积约简为 SO(2)2023eSCNarXiv:2302.03655把等变卷积的复杂度从 O(L⁶) 降至 O(L³)在 OC-20 与 OC-22 上取得当时最优。它的思想是沿 z 轴将 SO(3) 卷积分解为 SO(2) 上的快速运算大幅降低计算与显存开销。UMA 的等变主干escn_md.py正是 eSCN 的扩展形态相关单元测试可见 tests/core/models/uma/test_escn_md.py。更多架构论文GemNet-OCarXiv:2204.027822022面向更大、更多样的分子模拟数据集设计的图神经网络。作者指出新数据集在化学多样性、体系尺寸、数据规模与领域偏移四个维度上与旧数据集显著不同GemNet-OC 在 OC20 上超越此前最优 16%同时将训练时间降低 10 倍。Spherical Channel NetworkSCNarXiv:2206.143312022将原子嵌入表示为球谐函数定义的球面函数在 Open Catalyst 大规模数据集上取得当时最优结果。ForceNetarXiv:2103.014362021不施加显式物理约束而是通过基于物理的数据增强隐式施加从而在保持计算效率的同时灵活设计高表现力模型力预测精度超过基于物理约束的 SOTA GNN 且推理更快。Spin ConvRotation Invariant GNNarXiv:2106.095752021引入逐边局部坐标系与自旋卷积建模原子间角信息在 OC20 上取得当时最优。Towards Training Billion Parameter GNNsarXiv:2203.096972022提出 Graph Parallelism 图并行方法将输入图分布到多张 GPU 上支持数十亿参数 GNN 的训练在 OC20 上相对提升 15% 的力 MAE。仓库中 src/fairchem/core/common/parallelism 即对应图并行/张量并行实现配套测试见 tests/core/common/parallelism/test_graph_parallel.py。三、数据集支撑下一代化学 ML 模型的大规模开放数据四大旗舰数据集卡片数据集年份规模领域OMol25arXiv:2505.0876220251 亿 DFT 计算83 种元素分子最大 350 原子分子OMat24arXiv:2410.1277120241.1 亿 DFT 计算无机材料OMC25arXiv:2508.0265120252700 万 分子晶体结构含 DFT 标签分子晶体ODAC25arXiv:2508.0316220256000 万 DFT 计算MOF 吸附剂发现更多数据集论文OPoly26arXiv:2512.231172025含 657 万 聚合物团簇 DFT 计算、总计 12 亿 原子覆盖单体组成、聚合度、链构型与溶剂环境的化学多样性。OC25 固液界面数据集arXiv:2509.1786220257,801,261 个计算、1,511,270 个显式溶剂环境是目前最大的固液界面数据集覆盖 88 种元素与常用溶剂/离子。OMol25 细节docs/molecules/datasets/omol25.mdwB97M-V/def2-TZVPDORCA6层级含总能量eV与力eV/Å标签以 ASE DB 兼容的*.aselmdb格式提供总电荷与自旋多重度保存在atoms.info字典中ASE 不支持这两个默认属性。OMC25arXiv:2508.026512700 万 分子晶体结构、12 种元素、单胞最多 300 原子源自 23 万 结构的含色散 DFT 弛豫轨迹。ODAC25arXiv:2508.03162近 6000 万次 CO₂/H₂O/N₂/O₂ 在 15,000 个 MOF 中的吸附 DFT 计算通过官能团化 MOF、GCMC 衍生位点与合成框架引入化学多样性。OMat24arXiv:2410.127711.1 亿 DFT 计算聚焦结构与组成多样性论文报告 EquiformerV2 模型在 Matbench Discovery 上取得 F1 分数超过 0.9 的最优结果。OCx24 实验数据集arXiv:2411.117832024572 个合成样品、441 个气体扩散电极用于 CO₂RR 与 HER 评估DFT 验证吸附能覆盖约 2 万种材料需要 6.85 亿次 AI 加速弛豫。OC22 氧化物数据集arXiv:2206.08917202262,331 次 DFT 弛豫约 985 万单点计算覆盖氧化物材料、覆盖度与吸附质面向 OER 催化剂开发。与 OC20 的关键差异在于 OC22 使用 DFT 总能量而非吸附能训练见 docs/catalysts/datasets/oc22.md。ODAC23arXiv:2311.0034120233800 万 次 DFT 计算覆盖 8400 个含 CO₂/H₂O 吸附的 MOF面向直接空气捕获。OC20arXiv:2010.0999020201,281,040 次 DFT 弛豫约 2.65 亿单点评估是 Open Catalyst Project 的基石数据集。仓库 docs/catalysts/datasets/oc20.md 给出了完整的下载与预处理方式IS2* 任务 LMDB 可直接使用S2EF 训练/验证集需先下载轨迹并用脚本预处理python scripts/download_data.py --task is2re python scripts/download_data.py --task s2ef --split SPLIT_SIZE --get-edges --num-workers WORKERS --ref-energy其中--split可取200k、2M、20M、all、val_id、val_ood_ads、val_ood_cat、val_ood_both--get-edges会把边信息写入 LMDB存储约增加 10 倍、预处理慢 3~5 倍但训练期显存更省--ref-energy使用参考能量而非原始能量。仓库中还提供了oc20_data_mapping.pkl吸附质-催化剂体系到材料属性的映射含miller_index、adsorption_site、anomaly等字段与mapping_adslab_slab.pkl吸附质-催化剂体系到催化剂体系的映射。四、生成模型新分子、新材料的自动生成四张核心方法卡片模型年份一句话定位ADiTAll-atom Diffusion TransformersarXiv:2503.039652025分子与材料的统一生成模型共享潜空间FlowMMarXiv:2406.047132024黎曼流匹配用于材料生成发现稳定材料效率约 3 倍FlowLLMarXiv:2410.234052024LLM 流匹配稳定材料生成率约 3 倍Space Group Conditional Flow MatchingarXiv:2509.238222025面向空间群与 Wyckoff 位置的对称感知晶体生成从 docs/core/generative_models.md 可了解各模型的设计动机ADiT分子生成与材料生成以往是两个独立任务ADiT 用基于 Transformer 的潜扩散把两者编码进同一潜空间获得协同学习收益FlowLLM观察到 Crystal-text-llm 生成组成远比生成晶体结构出色于是采用LLM 生成待研究组成 Flow Matching 生成晶体结构的组合FlowMM将黎曼流匹配推广到含平移、旋转、置换与周期性边界条件的晶体Crystal-text-llmarXiv:2402.043792024微调后的 LLaMA-2 70B 生成材料被预测为亚稳态的比例约为 CDVAE 的两倍49% vs 28%约 90% 的采样结构满足物理约束说明 LLM 在原子级数据上具有出乎意料的适用性。更多生成模型论文Fine-Tuned Language Models Generate Stable Inorganic MaterialsarXiv:2402.04379即 Crystal-text-llm 论文详见上表。FastCSParXiv:2508.026412025随机结构生成 UMA 驱动的弛豫与自由能计算单个体系可在数十块 GPU 上数小时内出结果使高通量晶体结构预测CSP变得可行。仓库中对应应用包见 packages/fairchem-applications-fastcsp。ADiT 细节自动编码器把分子与材料映射到共享潜空间再以扩散生成新嵌入在 MP20、QM9、GEOM-DRUGS 上取得当时最优并较等变扩散模型显著加速。五、采样与分子动力学面向非归一化密度的扩散采样Adjoint SamplingarXiv:2504.117132025首个可扩展到大规模问题的 on-policy 扩散采样算法允许梯度更新次数显著多于能量评估次数可用于跨多个分子体系的摊销构象生成。Adjoint Schrödinger Bridge SamplerASBSarXiv:2506.225652025基于 Schrödinger Bridge 的动力学最优输运训练时无需目标样本可泛化到任意源分布用于分子玻尔兹曼分布采样。Enhancing Diffusion Sampling with Collective VariablesarXiv:2510.119232025沿集体变量施加序列偏置以改进模式发现并估计自由能首次用扩散采样器完成反应性采样配合通用原子间势捕捉断键与成键过程。这些方法与仓库中的动力学与采样组件相关例如 src/fairchem/core/components/dynamics、src/fairchem/core/modules/transforms.py以及 LAMMPS 接口 src/fairchem/lammps。六、应用与发现催化剂与材料的加速发现应用年份核心结论CatTSunamiarXiv:2405.020782024反应网络枚举加速约 1500 倍AdsorbMLarXiv:2211.164862022吸附能计算加速约 2000 倍、准确率 87%CatlasarXiv:2208.127172022合成气转化的高通量筛选自动化框架GA-Accelerated LCP DiscoveryarXiv:2505.134772025遗传算法 第一性原理用于 VR/AR 材料CatTSunami 细节基于 OC20 训练的 GNN 势 91% 的情况下在 0.1 eV 内找到 DFT 过渡态加速 28 倍以 12 GPU 天复现含 61 个中间体、174 个反应的 DFT 分辨率反应网络对比 52 GPU 年即 1500 倍加速。仓库对应包 packages/fairchem-applications-cattsunami教程见 docs/catalysts/examples_tutorials/cattsunami_tutorial.md。AdsorbML 细节ML 势以 87.36% 的准确率识别低能吸附质-表面构型同时实现约 2000 倍加速论文同时发布 Open Catalyst Dense 数据集约 1000 个表面、10 万构型见 docs/catalysts/datasets/oc20dense.md。仓库对应包 packages/fairchem-applications-AdsorbML教程见 docs/catalysts/examples_tutorials/adsorbml_walkthrough.md。Catlas 细节无需前期训练直接用预训练 ML 模型探索大规模设计空间对合成气制含氧化合物转化探索了 947 种二元金属间化合物识别出 144 个候选材料包括 Pt-Ti、Pd-V、Ni-Nb、Ti-Zn。LCP 细节将第一性原理计算与遗传算法结合发现低可见光吸收、高折射率的液晶聚合物用于 VR/AR/MR 技术。Adapting OC20-trained EquiformerV2 for High-Entropy MaterialsarXiv:2403.098112024通过能量过滤与少样本微调EquiformerV2 在高熵合金Ag-Ir-Pd-Pt-Ru上取得当时最优精度证明有序结构上的基础知识可外推到无序固溶体。七、训练方法与技术预训练、去噪与主动学习DeNSGeneralizing Denoising to Non-Equilibrium StructuresarXiv:2403.095492024将非平衡结构去噪作为辅助训练任务用编码后的力指明正在去噪的结构在 OC20 与 OC22 上取得新最优同时在 MD17 上显著提升训练效率。JMPJoint Multi-domain Pre-trainingarXiv:2310.168022023在 OC20、OC22、ANI-1x、Transition-1x 等约 1.2 亿体系上以多任务框架联合预训练相对从零训练平均提升 59%40 个任务中 34 个达到或追平 SOTA。FINETUNAFine-tuning Accelerated SimulationsarXiv:2205.012232022在线主动学习框架融合预训练模型先验将 DFT 计算量减少 91%同时 93% 的情况满足精度阈值。Generalization of Graph-Based Active Learning RelaxationarXiv:2311.019872023研究 FINETUNA 在域外体系更大吸附质、自旋极化金属氧化物、沸石与 MOF 等三维结构上的表现将 DFT 计算量减少 80%醇类/三维结构与 42%氧化物。Conformal Prediction 不确定性估计arXiv:2208.083372022将共形预测与潜空间距离结合估计神经力场的不确定性校准良好、尖锐且可扩展到百万级训练数据。Robust Offline Active LearningarXiv:2008.107732020Δ-机器学习方法通过规避非物理构型实现稳定的离线主动学习收敛将第一性原理计算减少 70~90%。这些训练方法在仓库中均有落地微调数据准备脚本见 src/fairchem/core/scripts/create_finetune_dataset.py 与 src/fairchem/core/scripts/create_uma_finetune_dataset.py微调配置模板见 configs/uma/finetune/uma_sm_finetune_template.yaml训练/微调流程说明见 docs/core/common_tasks/fine_tuning.md。八、电子结构与性质超越能量与力的预测HELMHamiltonian-trained Electronic-structure LearningarXiv:2510.002242025面向周期表 58 种元素、100 原子结构与大型基组的哈密顿量预测模型随论文发布 OMol_CSH_58k 数据集哈密顿量预训练在低数据场景下可改善能量预测。Chemical Properties from GNN-Predicted Electron DensitiesarXiv:2309.048112023无需训练预测电荷仅从模型预测的电子密度出发用成熟物理方法推导化学性质原子电荷误差比原子密度叠加法低一个数量级。XRD Loss Landscape AnalysisarXiv:2512.040362025研究粉末 XRD 到结构的映射常用 XRD 相似度指标导致高度非凸的损失景观将优化约束到真实晶体族可显著改善结构恢复。Physically-informed Graph-based Order ParameterarXiv:2106.082152021通用、可迁移的图基序参数用于表征原子结构在高达 300 GPa 的液态锂、含纳米管的碳相与多种铝构型上验证优于既有晶体序参数。九、观点与综述论文Open Challenges in Developing Large Scale ML Models for Catalyst DiscoveryarXiv:2206.020052022总结 OC20 开发中的挑战与发现涵盖能量守恒、局部极小值寻找与离平衡数据增强。An Introduction to Electrocatalyst Design using Machine LearningarXiv:2010.094352020面向可再生能源存储的电催化剂发现挑战、ML 应用方式与 OC20 数据集使用入门。Computational Catalyst Discovery: Active ClassificationarXiv:2102.015282021提出 myopic multiscale sampling将多尺度建模与自动化 DFT 选择结合催化剂分类相对随机采样加速约 7~16 倍。十、如何从论文走向仓库实践读论文的同时可以直接在仓库中找到对应实现与配置模型src/fairchem/core/models/umaUMA 系列、src/fairchem/core/models/escaipeSEN、src/fairchem/core/models/allscaip统一化学势/全 scaip 模型预训练权重配置configs/uma/benchmark/checkpoint、configs/uma/evaluate/checkpoint数据集详情与下载docs/catalysts/datasetsOC20/OC22/OC25/OCx24 等、docs/molecules/datasetsOMol25/OMC25 等、docs/inorganic_materials/datasetsOMat24应用包packages/fairchem-applications-AdsorbML、packages/fairchem-applications-cattsunami、packages/fairchem-applications-fastcsp、packages/fairchem-applications-ocxASE 计算器与推理src/fairchem/core/calculate/ase_calculator.py、src/fairchem/core/calculate/pretrained_mlip.py 及 docs/core/common_tasks/ase_calculator.md测试验证UMA 测试见 tests/core/models/umaeSEN 测试见 tests/core/models/escaipMLIP 单元测试见 tests/core/units/mlip_unit。上述论文共同构成了当前仓库的技术底座从 OC20 等基础数据集出发经过 eSCN/EquiformerV2/eSEN 等架构演进到 UMA 实现跨域通用的单模型能力再到生成模型、采样方法与主动学习等外围工具形成了一套从数据、训练到推理的完整研究-工程闭环。读者在阅读论文时建议始终以仓库中的 docs 目录、configs配置与tests测试为对照从而把学术方法快速映射为可运行的实践。【免费下载链接】ocpFAIR Chemistrys library of machine learning methods for chemistry项目地址: https://gitcode.com/GitHub_Trending/oc/ocp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考