Training-Free Active Learning Framework in Materials Science with Large Language Models

Training-Free Active Learning Framework in Materials Science with Large Language Models 文章核心总结与翻译一、主要内容本文提出一种基于大型语言模型(LLM)的无训练主动学习框架(LLM-AL),旨在解决材料科学领域传统机器学习(ML)主动学习方法存在的冷启动、特征工程依赖和泛化性不足等问题。核心设计:LLM-AL采用迭代少样本学习模式,设计两种提示策略——适用于成分型/结构化数据的简洁参数格式提示,以及适用于实验型/流程化数据的扩展描述文本提示,无需模型微调,仅通过提示工程适配不同任务。实验验证:在四种异质材料科学数据集(钢合金、聚合物纳米复合材料、钙钛矿、膜材料)上,将LLM-AL与随机森林回归器(RFR)、极端梯度提升(XGBoost)、高斯过程回归器(GPR)、贝叶斯神经网络(BNN)四种传统ML模型进行基准测试。关键结果:所有数据集上,LLM-AL能减少70%以上的实验次数即可找到最优候选材料,多数场景下仅需30%以内的数据量;提示策略需适配数据类型:高维成分数据适合参数格式,低维流程化数据适合报告格式;尽管LLM存在固有非确定性,但其性能稳定性与传统ML模型相当,多次运行和不同随机种子下结果一致;LLM-AL表现出更广泛的探索性搜索模式,在特征空间中遍历距离更长,但仍能更快收敛到最优解。二、创新点无训练泛化框架