从十万页文档里挖出隐藏关系:GraphRAG 知识图谱 10 分钟跑通 📅 发布时间:2026/9/1 10:39:28 👁 浏览次数: 从十万页文档里挖出隐藏关系GraphRAG 知识图谱 10 分钟跑通【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphragGraphRAG 是一个开源的图检索增强生成RAG系统先用 LLM 从文本里抽实体和关系建成知识图谱再在图谱上做局部、全局两个层面的图检索与问答。它和向量 RAG 最大的不同是检索时先走结构化的骨架再补原文细节。普通 RAG 什么时候开始失灵你让向量 RAG 回答这本书的核心主题是什么它只能捞出几个孤立的文本块答案往往停留在段落级观点。GraphRAG 的做法是让 LLM 通读全文抽出实体、关系构建成知识图谱再把实体聚成社区给每个社区生成一份摘要报告。查询时宏观问题走社区报告细节问题走实体邻域两类问法都能接住。把 txt 丢进 input图谱就开始长安装是一条命令的事graphrag init会在工作区生成input/目录、.env填 LLM 的 API Key和settings.yaml流水线配置python -m pip install graphrag graphrag init把文本文件放进input/支持 .txt、.csv、.json、.jsonl 等格式仓库自带的 Operation Dulce 样本数据 可以直接拿来试。然后跑索引graphrag index这一步最耗 LLM 资源第一次跑建议用小数据集加便宜模型。跑完output/里会出现一串 parquetentities.parquet、relationships.parquet、communities.parquet、community_reports.parquet这就是你的知识图谱的存储形态。三种问法对应三种检索查询引擎的几种方法按问题类型选local问具体实体比如Scrooge 是谁、和谁有关系在知识图谱里找实体邻域再用原文补上下文global问宏观比如这批文档的核心主题对所有社区报告做 map-reduce 汇总drift两者混合从社区报告出发再往局部下钻适合看似宏观、其实要细节的问题。graphrag query What are the top themes in this story? graphrag query Who is Scrooge and his relationships? --method local想直观看图谱打开 Web 界面命令行能用但对比起来费劲。仓库里的 unified-search-app 是一个 Streamlit 演示应用同一个问题local、global、drift 三种检索的结果并排展示Community Explorer 里还能逐份翻社区报告。在它的目录下执行uv sync和uv run poe start浏览器打开本地 8501 端口即可数据集路径按 README 里的格式写进listing.json。效果不理想先改配置再改数据两个最该认识的旋钮settings.yaml里的models决定用哪个 LLM 和嵌入模型extract_graph控制实体与关系抽取的行为。抽出来的实体质量差官方建议先跟着提示词调优文档调整默认提示词模板就放在 packages/graphrag/graphrag/prompts/通常比换模型见效快。另外新文档进来时用graphrag update做增量索引不必整图重算。把graphrag index贴进终端换上你自己的那批文档看看图谱把你的数据组织成什么样。【免费下载链接】graphragA modular graph-based Retrieval-Augmented Generation (RAG) system项目地址: https://gitcode.com/GitHub_Trending/gr/graphrag创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考