A Review of Developmental Interpretability in Large Language Models 📅 发布时间:2026/8/27 13:18:03 👁 浏览次数: 《大型语言模型发展可解释性综述》核心内容、创新点及关键部分翻译一、文章主要内容总结本文聚焦大型语言模型(LLMs)领域中新兴且关键的“发展可解释性”方向,系统梳理该领域从静态、事后分析训练后模型,到动态研究训练过程本身的演进脉络,核心内容可分为以下六大模块:1. 基础方法论:拆解Transformer的技术工具理论基础:以Anthropic团队Chris Olah等人的机械可解释性研究为核心,提出“神经网络即编译程序”框架,将参数视为二进制指令、激活值视为变量,并建立Transformer电路的数学分解体系,明确注意力头的QK(查询-键)和OV(输出-值)电路结构,发现“归纳头”这一可解释计算机制实例。表征探测与诊断分类器:通过训练次级“探测模型”,基于LLM内部激活向量预测词性标注、句法依赖等语言属性,追踪训练中知识分布与跨语言对齐等动态,但存在“相关性≠因果性”“探测模型能力干扰结果”等方法论挑战,需通过基线对比、控制任务等严谨验证。因果追踪与归因方法:突破探测的相关性局限,通过“激活修补”(如用“埃菲尔铁塔在巴黎”的干净输入激活,修补“罗马斗兽场在巴黎”的错误输入激活)、“重采样消融”等干预手段,建立组件与模型行为的因果关联,典型案例为定位GPT模型中存储事实知识的MLP块,支持直接模型编辑。机械电路分析:以“逆向工程”为目标,结合因果方法与人工权重/激