GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation——基于图的检索增强生成的图语言模型 📅 发布时间:2026/8/27 12:50:42 👁 浏览次数: 一、研究背景与问题核心问题传统的检索增强生成RAG在处理多跳推理问题时表现不佳因为需要跨多个文档追踪信息链。虽然图RAG方法通过知识图谱KG的结构来增强检索但现有方法如GFM-RAG存在一个关键缺陷仅利用图结构信号而严重忽视了节点和边的丰富文本语义。举例说明对于查询维护边境部队并声称Bernd Baumgart为公民的国家的三字母缩写GFM-RAG因不使用节点标签无法区分东德GDR和1976年奥运会与Bernd Baumgart关系的语义差异导致检索到Bruce Jenner、Kourtney Kardashian等完全不相关的实体。二、提出的方法GLM-RAG核心思想将图语言模型GLM引入图RAG框架替代原有的GNN检索器实现文本语义与图结构的深度融合。技术架构组件说明基础模型T5small/base/large最高770M参数图编码方式将三元组节点-关系-节点词元化通过结构感知的相对位置编码和稀疏注意力掩码保留图拓扑检索流程从种子实体提取局部子图 → GLM编码 → 实体嵌入与查询交互 → 排序打分训练方式仅监督微调无需昂贵的预训练使用BCEListCE联合损失与GNN检索器的关键差异对比维度GNN检索器GFM-RAGGLM检索器本文节点初始化仅种子实体有非零嵌入其余为零向量所有节点通过LM词元化获得语义嵌入文本利用仅用于识别种子实体全程参与编码和推理查询交互后期通过MLP拼接早期在注意力层与图结构融合图覆盖全图消息传递受限子图2跳≤600三元组三、实验设置训练数据集三个维基百科多跳QA数据集HotPotQA、2WikiMultihopQA、MuSiQue总计约27.4万个问答-文档对评估数据集域内上述三个数据集测试集域外单跳7个TechQA、ExpertQA、eManual、DelucionQA、MS MARCO、HAGRID、PubMedQA域外多跳4个MultihopRAG、G-Bench Novel/Medical/CS对比基线普通RAG纯稠密向量检索GFM-RAG原版图基础模型GFM-RAG*仅微调版本去除预训练GFM-RAG节点用句子嵌入初始化本文增强版四、主要实验结果1. 域内检索与QA性能发现说明所有图方法优于普通RAG证实了图结构对多跳任务的价值GFM-RAG与GFM-RAG*几乎持平大规模预训练收益甚微仅微调即可GLM-RAG与GFM-RAG互有胜负GFM-RAG在HotPotQA/2Wiki略优GLM-RAG在MuSiQue最佳GFM-RAG表现突出说明利用节点语义是关键改进方向2. 跨数据集迁移能力核心亮点维基百科间迁移表1GLM-RAG在全部9个跨数据集设置中一致优于两种GFM-RAG变体例如在HotPotQA上训练→MuSiQue测试GLM领先GFM-RAG达2.8点多跳域外数据表2最关键结果数据集普通RAGGFM-RAGGFM-RAGG-ReasonerGLM-RAGMultihopRAG R232.534.139.034.960.0G-Bench Medical ACC61.072.276.173.976.9G-Bench CS ACC71.772.176.173.976.6GLM-RAG在MultihopRAG上Recall2超出次优基线21个点在Medical和CS基准上达到新的SOTA。单跳域外数据图5GLM-RAG优于GFM-RAG变体但普通RAG全面胜出结论单跳任务不需要图结构普通RAG已足够3. 消融实验子图限制的影响表3收紧三元组预算600→300时GLM-RAG召回率仅下降2.5点而GFM-RAG*下降4.7点GLM在受限条件下更鲁棒但限制确实损害性能非噪声过滤模型规模扩展图6GFM-RAG*增加参数无性能提升过平滑问题GFM-RAG域内略有提升域外停滞GLM-RAG域内域外均持续提升证明LM的扩展法则优势容量匹配实验GNN参数从8M增至476MGLM仍保持可迁移性优势结论GLM的泛化优势源于预训练LM的语义能力而非单纯参数量五、深入分析语义相似度分析表4GLM-RAG和GFM-RAG检索的实体与问题语义相似度显著更高多跳数据集上GLM优势最为明显图覆盖距离分析表5GNN检索器检索的实体平均距离更远更广的图覆盖但这是以牺牲语义精准性为代价的两种检索策略的本质差异GLM精度优先——深入理解语义在局部子图中精准定位GNN广度优先——利用消息传递覆盖更远区域但忽视节点文本含义六、研究结论与贡献核心结论单跳问题→ 普通RAG即可无需图结构域内多跳→ GFM-RAG带节点嵌入与GLM-RAG竞争力相当零样本多跳最具挑战性→ GLM-RAG显著优于所有基线是更适合作为图RAG基础模型的方案主要贡献提出GLM-RAG首次将GLM引入图RAG检索器系统比较了普通RAG、GNN-RAG、GLM-RAG三种范式证明了基于预训练LM的GLM具备更强的零样本迁移能力和更好的扩展性揭示了语义理解与图覆盖之间的权衡为后续研究提供方向七、局限性与未来方向局限性未来改进方向受限于上下文窗口只能处理局部子图≤600三元组结合更高效的子图采样或长上下文LM当前使用T5最大770M未测试更大模型扩展至数十亿参数的现代LLM未与最新的G-Reasoner扩展KG索引结合GLM检索器与G-Reasoner的KG索引策略互补前景广阔计算成本高于GNN检索器优化推理效率或用于离线/非实时场景GLM-RAG通过将图语言模型引入图RAG检索器实现了文本语义与图结构的深度融合在零样本多跳推理任务上大幅超越现有方法同时验证了普通RAG在单跳任务中的充分性以及图覆盖与语义理解之间的本质权衡。摘要基于知识图谱的检索增强生成RAG需要能够有效捕捉图结构和语义信息的检索器。近期研究探索了基于图神经网络GNN的检索器来建模多跳推理任务中的图拓扑结构。与此同时图语言模型GLM已成为一种有前景的范式整合了图推理能力和语言模型的语义能力。在本工作中我们引入了一种基于GLM的检索器并研究了基于GLM、基于GNN和传统向量搜索的检索器在单跳和多跳RAG设置中的比较优势特别关注对未见领域的可迁移性。我们的发现表明微调后的GLM检索器在域外泛化能力更好在两个多跳基准上达到了最先进的性能。在域内多跳QA数据集上它们与先前工作表现相当且随着参数和子图覆盖范围的增加展现出有前景的扩展性。基于GNN的检索器以高效的训练设置实现了更高的图覆盖范围而向量搜索基线在单跳数据集上表现优异。1 引言语言模型LM在许多下游应用中存在幻觉问题Zhang等人2023且在专业领域中缺乏领域特定知识。检索增强生成RAG通过检索相关文档并将其作为额外上下文来解决这些挑战Lewis等人2020。因此领域特定知识可以被整合到LM的推理过程中并通过将LM的答案基于相关事实来减少幻觉。尽管RAG模型在许多知识密集型任务中表现出色但在需要跨多个文档进行多跳推理的任务中仍落后于需求Tang和Yang2024。图1GLM-RAG和GFM-RAG知识图谱检索轨迹查询为“维护边境部队并声称Bernd Baumgart为公民的国家的三字母缩写是什么”正确答案为“GDR”。示例选自MuSiQue测试集。知识密集型任务它们仍落后于需要跨多个文档进行多跳推理的任务Tang和Yang2024。图可以自然地捕捉文档之间的关系。与向量搜索不同基于图的检索可以遍历多个关系以纳入多维检索链实现更强的跨文档交互。因此图RAG方法被引入以结合图结构和RAG模型的优势Edge等人2024。当前的图RAG方法Gutierrez等人2024He等人2024Luo等人2025通常依赖于浅层语义整合例如句子嵌入并且无法在统一的图-文本模型中支持端到端训练。图1展示了一个知识图谱以及图RAG模型针对复杂查询的检索链“维护边境部队并声称Bernd Baumgart为公民的国家的三字母缩写是什么”GFM-RAG详见§4.2.1未利用节点标签。因此它将“东德GDR”和“1976年夏季奥运会”视为与“Bernd Baumgart”同等相关的邻居两者都是“Bernd Baumgart”的直接邻居并通过相似的关系“代表……参赛”和“参加……”连接。通过依赖这些结构信号GFM-RAG检索了不相关的实体如“Bruce Jenner”和“Kourtney Kardashian”。考虑到这些不足我们看到了利用文本属性图的语义意义的巨大潜力通过使用一个既能很好地理解文本含义又能同时在图上操作的模型。基于这一动机我们提出了GLM-RAG用于基于图的检索增强生成的图语言模型。在GFM-RAGLuo等人2025的基础上我们将其基于GNN和句子嵌入的检索器替换为一个端到端可训练的图语言模型GLMPlenz和Frank2024。GLMs将预训练语言模型适配为图变换器同时保留其预训练参数从而保留语言理解能力见§3。这使得GLM-RAG能够在词元级别原生处理文本属性图同时利用结构信息和实体、关系及查询的语义意义。在上述示例中另见图1这使GLM-RAG能够在两个相似的邻居之间做出明智的决定并成功检索到语义相关的邻域。除了引入GLM-RAG之外我们还系统评估了图增强检索方法何时带来益处。我们在多个领域进行了全面实验实现了基于图的方法与普通向量搜索方法之间的严格比较。文本[[115, 821, 486, 918], [511, 84, 881, 180]]在域外OOD单跳数据集上的零样本结果表明对于仅需单步推理的数据集普通RAG已经足够。这与Xiang等人2025的最新发现一致。然而在多跳设置中我们看到基于图的模型优于普通RAG。此外在OOD数据集上的结果突显了GLM-RAG强大的可迁移性表现在所有设置中均优于GFM-RAG并在Medical和计算机科学G-benchXiang等人2025Xiao等人2025上取得了新的SOTA结果。除了这些优势之外我们的消融实验表明GLM-RAG的性能随模型规模扩展良好而GFM-RAG则趋于平稳。结合强大的OOD性能这显示了GLM-RAG作为通用图RAG基础模型的价值。最后我们对排序结果的分析表明基于GLM的检索器在需要更深层语义理解的问题上表现尤为突出而基于GNN的检索器则受益于覆盖知识图谱的更大范围。我们的主要贡献是我们提出了GLM-RAG一种新的图RAG框架由基于图LM的检索器驱动以实现更强的文本特征整合。GLM-RAG展示了强大的零样本泛化能力超越了可比的图基础模型。我们的比较结果表明普通RAG足以应对单跳检索任务而基于图的方法在多跳设置中表现出色。消融研究表明与基于GNN的检索器相比GLM-RAG随模型规模增大具有更好的扩展性。大量分析表明基于GNN的检索器实现了更广的图覆盖但缺乏基于GLM的检索器更强的语义理解能力。2 相关工作检索增强生成RAG。RAG通常依赖于稠密向量搜索其中文本语料库被分割成独立的块并通过句子嵌入进行索引Reimers和Gurevych2019。检索后相关文档被纳入LM的上下文以帮助回答问题Lewis等人2020Karpukhin等人2020。虽然RAG模型提供了比微调模型更便宜的替代方案但它们在多跳推理和跨多个文本的复杂查询方面仍面临困难。图RAG。图RAG方法旨在通过对图内的信息依赖关系进行编码来解决更复杂的多文档任务。Edge等人2024将其框架定位为查询聚焦的摘要任务而非显式的检索任务。然而后续工作使用基于GNN的检索器来利用知识图谱的图拓扑结构进行多跳QA任务Mavromatis和Karypis2025。与我们工作最相关的是GFM-RAGLuo等人2025这是一个由基于GNN的检索器驱动的“图基础模型”旨在无需微调即可泛化到未见领域。GFM-RAG在域内数据集上取得了SOTA结果并展示了超越训练数据的有前景的可迁移能力。在最近的工作中Luo等人2026通过在被构建的KG中包含更多样化的信息扩展了GFM-RAG从而超越了之前的SOTA。在本工作中我们以GFM-RAG为基础目标是通过使用图LMGLM进行检索来提升其可迁移性Plenz和Frank2024。图LM基于预训练的LLM因此将强大的未见文本理解能力与图处理能力相结合。将我们的方法与Luo等人2026的方法结合留待未来工作。图上的LM。编码知识图谱的常见方法是将其线性化并用LM处理Schmitt等人2020Ribeiro等人2021Li等人2021Gao等人2024Yamada和Sugiyama2026。虽然能很好地捕捉文本特征但这种方法对图结构的利用有限。因此人们采用GNN与通常静态的语义嵌入相结合Lin等人2019Malaviya等人2020Yasunaga等人2022Zhao等人2023。通过对LM的架构进行轻微调整同时保持其预训练参数可以实现文本特征与图结构之间更深层的交互Plenz和Frank2024Egressy和Stuhmer2025Gong等人2026Vajda2026。我们基于这一研究方向来改进图RAG中的图推理。3 预备知识图语言模型图语言模型GLM通过将预训练LM转换为图变换器架起了语言模型和图变换器之间的桥梁Plenz和Frank2024。这种设计使模型能够利用来自LM的预训练语言理解能力同时通过架构设计融入结构化的图推理能力。这种设计使GLM非常适合处理文本属性图如知识图谱。该方法包括两个主要步骤。首先知识子图经过预处理边和节点标签被单独词元化并根据原始图结构进行连接。这种转换使得每个三元组可以表示为类似自然语言的词元序列同时在不同的三元组之间共享节点词元如同标准图结构一样。其次LM的自注意力机制被修改为使用相对位置编码来捕捉同一三元组内词元对之间的距离从而使模型能够将三元组作为序列文本读取——就像语言模型一样。虽然这些典型的LM注意力模式应用于三元组但GLM也使用类似GNN的注意力模式来捕捉整体图结构。这些改编共同产生了一个模型能够像读取连续语言一样读取带标签的图从而同时实现了强大的i语言理解能力和ii非常适合图RAG的基于图的推理能力。关于该方法的更多细节和实验验证请参考原始出版物。4 GLM-RAG基于GLM能够联合推理文本和图结构数据的能力我们提出了GLM-RAG一种依赖基于GLM的检索器的RAG架构。我们假设基于GLM的检索器具有更好的检索质量和后续的QA性能因为它能更好地理解图中的文本特征相比之下基于GNN的检索器仅能利用图结构和浅层文本整合。我们以Luo等人2025的GFM-RAG框架为基础采用其KG和QA数据集构建阶段以及其文档排序和答案生成机制。我们的贡献是基于GLM的检索器§4.2.2它取代了原始的KG检索组件。关键在于这种设置提供了一个受控环境使我们能够评估基于GLM的检索器与基于GNN的检索器。更多实现细节请参见附录B。图2基于GNN和基于GLM的检索器在查询“EMNLP 2026在哪里”上对KG进行推理的差异。基于GLM的检索器左使用图LM的编码器对节点、关系和查询进行词元化。词元化后的输入通过图LM产生每个词元的嵌入。每个节点对应的词元嵌入被聚合以产生最终的节点表示用于计算提取的子图中每个实体的相关性分数。基于GNN的检索器右通过句子嵌入模型计算查询和关系嵌入。只有种子实体被初始化为查询嵌入其余节点为零向量。GNN通过消息传递在整个图上迭代传播消息生成所有节点上的分数分布。4.1 KG和QA数据集构建该流程从文档语料库开始通过基于LM的命名实体识别器NER在实体级别构建相应的知识图谱使得像“EMNLP 2026正在布达佩斯举行布达佩斯是匈牙利的首都。”这样的文档在KG中被表示为[EMNLP_2026, is_in, Budapest]和[Budapest, capital_of, Hungary]等元组。查询经历类似的转换使得像“EMNLP 2026在哪里”这样的问题通过种子实体“EMNLP_2026”表示为KG内的起始点。根据查询的复杂性可能存在多个种子实体。4.2 KG检索4.2.1 基于GNN的检索器GFM-RAG的主要构建模块是查询相关的GNN检索器其任务是根据与给定输入查询的相关性对构建的KG中的实体进行排序。消息传递范式Gilmer等人2017用于在图上传送信息见图2右侧。虽然种子实体被初始化为查询嵌入但所有其他节点被初始化为零向量。相比之下关系用其句子嵌入进行初始化。因此GNN产生的节点表示由它们到种子实体的相对图距离驱动而非它们的语义特征。节点文本仅用于识别种子实体在GNN检索器中不发挥其他作用。鉴于这一不足我们还探索了GFM-RAG的一个变体GFM-RAG其中所有节点都用其句子嵌入进行初始化见第5.1节。在最后一层每个节点的表示与查询嵌入拼接并由MLP打分以找到最相关的节点。Luo等人2025在KG补全上预训练GNN检索器并在三个基于维基百科的多跳QA数据集上进行微调。4.2.2 基于GLM的检索器我们提出的基于GLM的检索器旨在实现一种最大化文本属性图潜力的图RAG方法。GLM检索器的内部工作原理与基于GNN的检索器有根本不同。最显著的是基于GNN的检索器不利用图中丰富的文本特征而是依赖查询和原始图结构而我们的GLM检索器通过GLM的文本编码能力§3充分利用图中的语义信息。GLM检索器提取种子实体周围的局部子图将其转换为文本三元组序列并通过具有结构感知相对位置的图编码器对单独词元化的边和节点表示进行编码见图2左侧。节点和关系使用底层LM自身的词元化和词元嵌入层进行词元化和嵌入。词元通过LM的层传递使用注意力掩码来编码图结构。这与GNN检索器形成对比后者只有种子实体被初始化为非零嵌入。因此查询-图交互发生在更早的阶段即当问题文本与提取的子图结构在GLM的第一个注意力层内部融合时。得到的每个实体嵌入与投影后的问题向量逐元素相乘并通过评分头传递。我们在三个基于维基百科的多跳QA数据集上微调基于GLM的检索器§5。4.3 排序与答案生成排序完成后最相关的实体被映射回其原始文档从而将实体排序转换为文档排序。最后LM从查询和top-k文档生成答案。5 实验在本节中我们介绍实验设置并报告以下实验结果我们在三个基于维基百科的多跳问答QA数据集上微调基于GLM和基于GNN的检索器并评估检索§5.2和QA性能§5.3。我们在11个OOD数据集上测试微调后的基于GLM的检索器的可迁移性§5.4。更多消融研究§C和按问题复杂度划分的检索性能细分§D.1可在附录中找到。5.1 实验设置模型我们选择all-mpnet-base-v2作为GFM-RAG的句子嵌入模型。遵循Plenz和Frank2024我们用T5-large模型权重初始化GLM检索器并在不同规模上进行测试如第5.5节所示。我们使用gpt-4o-mini作为所有文本生成的LM。在不同规模上进行测试如第5.5节所示。我们使用gpt-4o-mini作为所有文本生成的LM。数据集我们在三个基于维基百科的多跳QA数据集的训练集上微调模型HotPotQAYang等人2018、2WikiMultihopQA2WikiHo等人2020和MuSiQueTrivedi等人2022。这些训练集共提供282k个问答-文档对用于训练。为了评估GLM检索器的可迁移性能力我们遵循Luo等人2025选择了来自不同领域的七个可迁移性数据集TechQACastelli等人2020、ExpertQAMalaviya等人2024、eManualNandy等人2021、DelucionQASadat等人2023具有客户支持重点MS MARCOBajaj等人2018和HAGRIDKamalloo等人2023包含通用知识问题而PubmedQAJin等人2019需要生物医学知识。然而由于这些数据集不需要多跳推理它们可以有效地用普通RAG解决。因此我们还纳入了几个多跳基准MultihopRAGTang和Yang2024一个基于英文新闻文章的数据集G-Bench Novel和MedicalXiang等人2025以及G-Bench Computer ScienceCSXiao等人2025。数据集统计请参见附录A。基线为了将我们提出的GLM-RAG方法的结果置于背景中我们与四个基线进行比较a. 一个普通RAG基线使用all-mpnet-base-v2嵌入模型对文档和查询进行编码并根据余弦相似度检索top-5文档。该基线测试图RAG方法的必要性。b. 作为一个强比较基线我们使用HuggingFace上最新发布的GFM-RAG它使用相同的图RAG流程。c. 一个仅微调版本的GFM-RAG我们称之为GFM-RAG*。我们选择仅微调版本的GFM-RAG来测试预训练阶段的有效性。考虑到我们也仅进行微调这是一个与我们的GLM-RAG更具可比性的基线。d. 一个仅微调版本的GFM-RAG其中节点用文本嵌入而非零向量初始化。我们称之为GFM-RAG。与GLM-RAG相比这种方法也利用节点语义但仅通过静态句子嵌入。e. 对于QA性能我们还测试了一个无上下文基线评估LM在没有检索上下文的情况下回答问题的能力。指标我们在文档级别使用Recall2来衡量检索性能。我们评估文档级别而非实体级别的性能因为正确检索文档直接影响下游QA性能。对于QA性能我们报告精确匹配EM。所有指标均在先前工作中建立实现了直接比较。我们还在第D节报告Recall5在第E节报告F1分数。对于G-Bench我们遵循每个基准的标准评估实践报告证据召回率用于检索准确率答案正确性和答案得分用于QA性能。我们对所有LLM-as-a-judge调用使用gpt-4o-mini。遵循先前工作由于计算限制我们每次实验运行一次并在第H节提供显著性检验。5.2 检索性能图3显示了三个基于维基百科数据集测试集上的检索性能。所有图增强方法均优于RAG基线突显了图RAG方法在多跳任务中的贡献。GFM-RAG和GFM-RAG*即有和没有预训练在大多数数据集上表现几乎相同这对昂贵的预训练的必要性提出了质疑。因此我们也仅微调我们的GLM检索器。总体而言GFM-RAG和GLM-RAG表现最好显示了利用节点语义的优势。在HotPotQA和2Wiki上GFM-RAG略优于GLM-RAG而GLM-RAG在MuSiQue上取得了最佳结果。这证实了GLM-RAG具有竞争力的域内性能尽管被限制在较小的子图上。文本[[115, 806, 486, 918], [511, 84, 880, 115]]表17显示了额外图RAG方法的性能包括Luo等人2026在同期工作中取得的新SOTA结果。他们的主要创新是通过在KG索引步骤中包含更多信息来扩展GFM-RAG。这与我们的工作正交并与我们提出的GLM检索器兼容。结合两种方法超出了本文的范围留待未来工作。图3域内维基百科数据集上的检索性能Recall2。5.3 QA性能在图4的下游QA性能中可以观察到类似的趋势。无上下文和RAG基线得分最低显示了检索上下文的价值以及图增强检索器的价值。GFM-RAG和GFM-RAG*在所有三个数据集上表现相当在HotPotQA上最大差异为1.7点证实了预训练的效果可以忽略不计。GLM-RAG与基线的整体性能趋势与检索结果相当。唯一的区别是GLM-RAG在HotPotQA上取得了最佳的EM分数。其他方法的QA结果见表20。图4域内维基百科数据集上的QA性能精确匹配。5.4 可迁移性虽然GLM-RAG的域内性能并未显著优于GFM-RAG但可迁移性实验显示了对OOD数据集显著更好的泛化能力。在下文中我们首先仅在其中一个维基百科数据集上训练我们的模型并检验其对其他维基百科数据集的迁移§5.4.1。然后我们在七个单跳OOD数据集§5.4.2和一个多跳OOD数据集§5.4.3上测试完全训练好的模型。图5单跳域外数据集上的检索性能Recall2。表1GLM和GFM-RAG*在仅在一个维基百科数据集上微调时的泛化能力。5.4.1 维基百科数据集上的可迁移性我们在每个维基百科数据集上训练GLM-RAG、GFM-RAG*和GFM-RAG并研究对另外两个维基百科数据集的迁移性。表1显示在所有情况下GLM在域外设置中的表现均优于GFM-RAG变体甚至超过了GFM-RAG即带有额外节点嵌入的GFM-RAG。例如当在HotpotQA上训练时GLM在MuSiQue上分别超过GFM-RAG* 2.8点和GFM-RAG 1.8点。在MuSiQue上GLM-RAG始终优于两种模型而GFM-RAG变体在2Wiki和HotpotQA的域内表现更好。5.4.2 单跳数据集上的可迁移性基于前述结果我们在7个单跳数据集上测试模型对未见领域的泛化能力。图5显示GLM-RAG在所有数据集上始终优于GFM-RAG模型除了ExpertQA上的Recall2。考虑到GFM-RAG是一个为良好泛化而训练的基础模型这展示了GLM-RAG强大的可迁移性能力。我们假设这主要是通过GLM对KG丰富语义的深度融合实现的。然而值得注意的是普通RAG基线在所有测试数据集中均优于所有图RAG模型。虽然这可能看起来令人惊讶但这是由数据集的性质决定的单跳数据集包含不需要多跳推理能力的直接问题因此RAG“更简单”的相似性度量通常足以找到相关文档。相比之下图RAG方法在多跳数据集中展现其优势因为在这些数据集中检索与问题相似的文档不足以回答组合性问题。5.4.3 多跳数据集上的可迁移性我们通过在MultihopRAGTang和Yang2024、G-Bench Novel、G-Bench MedicalXiang等人2025和G-Bench CSXiao等人2025上测试零样本可迁移性的检索和QA性能来挑战模型所有这些都需要多跳推理。在此我们还包括最近引入的SOTA方法G-ReasonerLuo等人2026。表2显示了所有方法的检索和QA结果。GLM-RAG的检索性能在此多跳零样本设置中表现出色在MultihopRAG上超过RAG基线、GFM-RAG变体和G-Reasoner达20点的Recall2。三个G-Bench基准测试中也是如此GLM-RAG在所有基线上均优于包括G-Reasoner在内的所有方法。截至目前GLM-RAG在Medical和CS基准上取得了SOTA结果在Novel基准上排名第二。AutoPrunedRetrieverWang等人2026一种为先前问题保留最小推理子图并为后续问题逐步扩展的图RAG方法是Novel基准的当前SOTA方法。将此剪枝思想整合到GLM-RAG中是我们留待未来工作的扩展。这一具有挑战性的测试案例突显了GLM-RAG作为图基础模型在零样本多跳设置中具有强大能力的价值。总结主要实验我们的发现表明即使GLM-RAG在迁移数据集上优于其他图增强方法普通RAG在单步推理中仍然足够。然而在多跳OOD数据集上GLM-RAG明显优于普通RAG基线和所有GFM-RAG变体。5.5 消融实验我们旨在表明GLM-RAG的可迁移性增益源于其对文本特征的更深层整合而非输入过滤或模型规模。为了检验这一点以下部分消融了GLM-RAG与GFM-RAG变体之间的两个主要差异图输入和模型规模。对于这些消融实验我们在包含60k个实例的训练数据子集上训练所有模型。子图限制的影响GLM-RAG与GFM-RAG之间的关键差异之一是GLM-RAG由于上下文大小限制而具有受限的图可见性。在此我们测试这种限制是充当信息瓶颈还是噪声过滤器对检索性能的影响。我们通过调整GLM-RAG和GFM-RAG*中2跳邻域子图的可视三元组数量来评估这一点。表3显示GFM-RAG*的性能受到此限制的负面影响。此外当我们对两种模型都收紧限制时召回率单调下降。这支持我们的主张即GLM-RAG的受限可见性限制而非帮助其性能放宽限制将改善结果。表3受限GFM-RAG*和GLM-RAG的检索结果平均Recall2。召回率结果是在HotpotQA、MuSiQue和2Wiki测试集上的平均值。模型规模的影响有人可能认为GLM-RAG的增益源于其更高的参数数量考虑到GFM*和GLM检索器分别有8M和336M参数。为了排除这一假设我们通过增加基于GNN的检索器的隐藏维度来比较容量匹配设置下的模型。这产生了三对容量匹配的模型如表18所示。图6显示了基于GNN和基于GLM的检索器随参数数量增加的扩展趋势。虽然GFM-RAG*在拥有更多参数时没有显示出性能提升但GFM-RAG的上升趋势仅在域内数据集上成立另见图12和表19。相比之下GLM-RAG在两种设置中都显示出上升趋势证明了即使在控制模型规模的情况下其可迁移性优势仍然成立。这一发现与GNN过拟合和过平滑问题的相关工作一致Li等人2018Rong等人2020Oono和Suzuki2020Chen等人2022表明基于变换器的模型在扩展方面优于GNNKaplan等人2020Dehghani等人2023。图6GLM-RAG与容量匹配的GFM-RAG*和GFM-RAG的模型扩展比较。总之我们证明了GLM-RAG的可迁移性优势在匹配的可见性和容量下仍然成立这意味着泛化增益源于利用现有的大规模预训练LM。GLMs的扩展潜力是一个额外优势强烈表明通过切换到更大、更新的LM作为GLM的基础有进一步改进的潜力。6 分析在评估了所比较方法的域内和域外检索及QA质量之后我们进一步研究了每种基于图的检索模型的优势和劣势。虽然这些特性不是更好检索的代理指标但我们分析它们以更好地理解每个模型检索策略的特征。我们的分析表明GLM使用更多语义知识来检索正确的文档而GNN更依赖结构信号。附录G显示了这些度量的计算方法。6.1 相似性度量首先我们希望证实我们的假设即GLM检索器比其他模型更有效地利用语义特征。为此分析我们计算问题与检索到的答案实体之间的语义相似度。表4显示GLM-RAG和GFM-RAG在11个数据集中始终检索到语义更相似的实体。GLM的优势在多跳数据集中尤为突出对构建的图具有更好的语义理解。表4问题与检索实体之间的余弦相似度比较。6.2 距离度量为了比较两种模型的图覆盖范围我们找到从每个检索实体到任何问题实体的最短路径按样本和数据集汇总。表5中的结果显示基于GNN的检索器平均比基于GLM的检索器到达更远的距离。虽然由于架构差异这是预期的但它表明基于GNN的检索器的优势在于其对图的更广泛覆盖。表5种子实体与检索实体之间的平均跳距离比较。