WeKnora 知识图谱可视化:把文档变成可追问的网络,还能查答案出处

WeKnora 知识图谱可视化:把文档变成可追问的网络,还能查答案出处 WeKnora 知识图谱可视化把文档变成可追问的网络还能查答案出处【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora上周有同事问我「30 天无理由退货」这条规定在哪个文件里我在 80 份 PDF 里翻了半天没找着。要是开了 WeKnora 的知识图谱可视化点开图谱三十秒就能指给他看——实体「退货政策」和「已使用商品」之间的边直接连着两个原文分块。它到底在做什么输入你上传到知识库的一批文档PDF、Word、网页都行。 中间文档被切成分块Chunk即送进检索的最小文本段LLM 从每个分块里抽实体和关系再给每条关系算一个 1 到 10 的综合权重。 输出一张可交互的实体关系图、一张以分块为节点的关系图以及一条「答案引用了哪个分块、又为什么是它」的检索路径。开了 Neo4j 之后这套数据还能落库给你自己的应用查。一句话文档进可追问的知识网出检索时它顺手帮你把「答案从哪来」也画出来。拆开看里面到底怎么跑的核心代码在 internal/application/service/graph.go三个机制值得单独拎出来。LLM 抽实体同名实体自动合并每个分块单独送给 LLM用低温度0.1抽取实体每个实体带标题、描述、出现频次。跨分块按标题去重同一个「双床房」在 5 个分块出现就合并成 1 个节点频次记 5并把 5 个分块 ID 都挂上去。关系抽取按 5 个分块为一批送 LLM但有一条硬约束源实体和目标实体必须至少共现于 1 个分块否则这条关系直接丢弃——这一步很关键挡住了 LLM 的「自由发挥」。实体和关系的抽取都是 4 路并发所以几百个分块的文档建图不用排队等。一条边的粗细由 PMI 加强度两个数决定光有「A 指向 B」还不够得给边打个分先算 PMI点互信息白话就是这俩实体一起出现的频率比纯巧合高多少PMI log2(P(A,B) / (P(A)×P(B)))。再取 LLM 给的关系强度0-10 的置信度各自归一化到 0-1。综合权重 0.6 × 归一化 PMI 0.4 × 归一化强度线性拉伸到 1-10 区间就是你在图上看到的边粗细。实体度数连了多少条边同步算好决定节点大小。权重 8 以上的边基本可以放心当核心链路看低于 4 的多是边缘提及。分块关系图把实体关系投影回原文一条实体关系的源、目标实体各自挂着一组分块两组的笛卡尔积上连一条双向边边的权重继承自那条实体关系。查询时GetRelationChunks(chunkID, topK)按权重降序、度数打平返回最相关的 K 个分块。二跳邻居走GetIndirectRelationChunks两跳权重相乘再打 5 折衰减系数 0.5防止「远亲」污染近邻结果。说白了实体图谱负责「概念长什么样」分块图负责「答案在哪几段原文里」。拿一个真实例子从头到尾跑一次场景客服政策知识库30 份文档提问「已经拆封的商品还能退吗」。问题改写系统把口语化问题改写成「已使用商品的退货时限与条件」检索命中率更稳。混合检索向量检索加关键词检索各跑一遍合并后命中分块 A——「30 天无理由退货」条款原文。图谱扩展分块 A 挂在实体「退货政策」上该实体有一条权重 8.2 的边指向「已使用商品」顺着分块关系图一跳拉到分块 B——「已拆封商品需在 7 天内申请」的例外条款。生成与引用A、B 两个分块一起进 LLM 上下文答案生成后界面上高亮引用来源点引用能直接跳到分块 B 原文。想验证Neo4j 里跑一句match (n) return n能看到这条边连同两端实体的度数、权重和界面上完全对得上流程参考 docs/KnowledgeGraph.md。你拿到的不再是一句「能退7 天内」而是一张「答案来自分块 A 分块 B、经由权重 8.2 的那条边」的完整路径。三步跑起来起服务git clone https://gitcode.com/GitHub_Trending/we/WeKnora后进目录执行bash scripts/start_all.sh前端起在本地端口即可访问。开图谱开关进入知识库设置页打开「实体和关系提取」想同步到 Neo4j 就先跑docker-compose --profile neo4j up -d并设NEO4J_ENABLEtrue。传文档、看图谱上传任意 PDF处理完成后打开「知识图谱」标签页切实体视图或分块视图双击节点看它出现过的所有分块。适合 / 不适合适合需要向审计、合规、新人解释「答案为什么是这个」的场景图谱就是现成的证据链条款、规则分散在几十上百份文档里靠实体关系把它们串起来想把图谱数据灌进 Neo4j给自己的应用做二次查询不适合如果你只需要单条 FAQ 问答内置的 RAG 检索就够了开图谱纯属多花 LLM token纯图片为主的扫描件、幻灯片抽不出什么实体建图收益很低只想全文搜一句固定话术grep 或全文索引更快答案不再是黑箱这是这套机制给你的最大价值。想从零走一遍完整流程看 README_CN.md检索链路细节在 docs/QA.md。有问题评论区见。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考