A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
📅 发布时间:2026/9/17 22:46:36👁 浏览次数:
科学大语言模型(Sci-LLMs)综述总结与关键部分翻译一、文章主要内容总结该综述围绕科学大语言模型(Scientific Large Language Models, Sci-LLMs)展开,从数据基础到智能体前沿,构建了“数据-模型-应用”的完整分析框架,核心内容可分为以下六大模块:1. 科学数据与知识的基础框架科学数据统一分类体系:将科学数据划分为文本格式(论文、实验记录)、视觉数据(医学影像、天文观测图)、符号表示(分子SMILES字符串、晶体CIF文件)、结构化数据(数据库、知识图谱)、时间序列数据(LIGO引力波信号、EEG脑电数据)及多组学整合数据(基因组、转录组、蛋白质组联用),并分析了各类型数据的模态特性与处理难点。科学知识层级模型:提出五级知识结构——事实层(原始观测数据,如粒子碰撞记录)、理论层(科学定律与原理,如牛顿力学)、方法技术层(实验流程与工具,如CRISPR基因编辑)、建模仿真层(计算模型,如气候循环模拟)、洞察层(突破性发现,如暗物质提出),揭示了科学知识从具象到抽象的递进关系。2. Sci-LLMs的发展历程与分类四阶段范式演进:迁移学习阶段(2018-2020):基于BERT架构适配科学领域,如SciBERT(科学文本)、Bi