DeepSieve:新一代RAG框架,让LLM成为智能知识导航员,破解异构检索难题,看到就是赚到!! 📅 发布时间:2026/8/27 15:04:32 👁 浏览次数: 前言大型语言模型LLM在数学推理、常识问答等任务中表现出色却难以回答需动态知识支持的复杂问题如实时新闻、专业领域查询。传统检索增强生成RAG通过引入外部知识缓解此问题但面临两大瓶颈查询侧将复杂问题视为原子单元缺乏对多步推理子目标的分解源侧从扁平化索引中检索无视知识源的异构性如API、数据库、文本库的格式差异。论文DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router地址https://arxiv.org/pdf/2507.22050DeepSieve应运而生。其核心创新是将LLM作为知识路由器Knowledge Router通过多阶段“信息筛”机制①分解复杂问题为结构化子查询②路由每个子查询至最适配的知识源③反思失败检索并动态调整④融合子答案生成最终响应。实验证明其在多跳问答任务中显著提升推理深度、检索精度与可解释性代码已开源。研究动机与问题定义传统RAG的局限性查询侧缺陷复杂问题如“创办尼日利亚飞行医生服务的女性的丈夫是谁”包含嵌套结构需多步推理。传统RAG直接检索整体问题导致无关结果或事实幻觉Hallucination。示例未识别“创始人”子目标直接猜测丈夫名字。源侧缺陷知识源可能包含私有数据库、结构化API、非结构化文本等异构形式。传统RAG强制合并为统一索引引发两大问题内容失配地理查询误用人物数据库无法兼容隐私或格式限制使部分源无法合并如医疗记录API维基百科。DeepSieve的解决思路提出信息筛Information Sieving框架核心思想将查询与知识源双向解耦通过路由实现“精准筛滤”—— 子查询匹配最适源筛除无关信息失败检索触发反思迭代优化路径。DeepSieve方法框架详解四阶段工作流*阶段I查询分解Decomposition*目标将复杂查询拆解为原子子问题构建有向无环图DAG。技术基于LLM的规划器生成结构化子查询链。示例Q: “英国脱欧公投期间辞职首相的继任者是谁”→q1: “脱欧公投时的英国首相”→q2: “q1答案的继任者”*阶段II知识路由Routing*核心创新LLM作为路由器为子查询分配合适的(工具, 知识源)对。路由依据子查询语义如涉及地理位置→地图API源描述文件如Local源人物实体信息失败历史记录避免重复路由无效源。模块化支持源以(Tool, Corpus)注册支持SQL/API/RAG等异构源。*阶段III检索与反思Reflexion*失败处理若答案无效不完整/无关/模糊触发反思循环记录失败到内存M_fail重路由至新源如从本地数据库切换至全局知识库限次迭代直至成功或超时。示例初始检索误判演员代表作反思后修正。*阶段IV答案融合Fusion*输入成功子答案集合{a_i}与DAG依赖关系。技术基于LLM的聚合器合成连贯答案解决冲突如矛盾时间线。效果融合后EM平均提升12%。模块化设计优势组件解耦分解、路由、反思、融合可独立替换如路由器可升级为成本感知模型。扩展灵活新增知识源仅需注册(Tool, Corpus)对及其描述文件。实验验证与核心发现实验设置基准数据集MuSiQue组合式问答2WikiMultiHopQA多实体推理HotpotQA多跳问答对比方法RAG基线ColBERTv2, HippoRAG, RAPTORAgent方法ReAct, ReWOO, Reflexion评估指标EM精确匹配、F1模糊匹配、推理成本Token数性能对比准确率全面领先DeepSieveNaive RAG在MuSiQue上F1达46.813.5 vs 最佳基线平均F1 58.9显著优于所有基线。效率优势突出在HotpotQA上DeepSieve仅用3.9K Token达到49.0 F1而Reflexion需37.9K Token。雷达图清晰展示其在精度-成本权衡上的优越性。消融实验核心模块贡献移除反思2WikiMultiHopQA F1暴跌至15.4-53移除分解MuSiQue F1下降17.5移除路由性能波动但仍是正收益。Token成本分布反思阶段占额外成本主导但其对精度至关重要。模块化扩展验证异构源支持成功集成SQL数据库与RAG文本库解决纯RAG无法处理的约束过滤问题如“19世纪出生”。路由有效性在SQL专家与RAG专家的诊断测试中路由决策达到理想性能的92%。结论DeepSieve通过信息筛范式革新了RAG的工作机制结构化分解复杂问题显式建模推理路径知识路由动态调度异构源实现精准检索反思式迭代提升容错性减少幻觉生成。实验证明其在多跳问答任务中实现SOTA性能与超高推理效率的平衡同时提供模块化架构支持工业落地。未来通过细化路由策略与个性化适配有望成为下一代知识密集型AI系统的核心引擎。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】