WeKnora 知识图谱:把文档实体关系和 RAG 检索链路变成看得见的图 WeKnora 知识图谱把文档实体关系和 RAG 检索链路变成看得见的图【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora你往知识库传了几百页产品手册模型答得头头是道但同事追问这个结论依据哪条条款时你只能回翻原文慢慢找。WeKnora 的做法是把两样东西直接画出来实体之间连成什么网答案又是怎么一步步检索出来的。WeKnora 是什么一个把文档变成可查询知识的开源平台WeKnora 是一个自托管的 LLM 知识平台核心思路是把原始文档加工成三层能力基于 RAG 的快速问答、能自主编排检索与 MCP 工具的 ReAct Agent以及让 Agent 自动蒸馏文档、自我维护的 Wiki 模式。你上传的每一份文档都会被解析、切分、建索引后续无论是提问、图谱查询还是 Wiki 页面生成都建立在这套索引之上。整体架构分四层接入层Web 前端、Go SDK、IM 集成、REST API 服务、核心服务文档处理、向量检索、LLM 推理、会话管理以及底层的 OCR、Embedding、向量存储与 PostgreSQL。知识图谱散落文档里的实体是怎么连成网的你遇到的问题纯关键词检索只认字面退款规则和退货政策字面上完全不同但讲的都是同一件事。文档里的语义关联靠人脑串串到第三页就断了。它的处理构建逻辑在图谱构建模块里。文档切分成 chunk 后LLM 从每个 chunk 里抽取实体带标题、描述、出现频次再抽取实体间的有向关系并给出强度分。每条边的权重不是拍脑袋给的而是点互信息PMI和关系强度按PMIWeight0.6、StrengthWeight0.4的配比归一化后加权得出实体不直接相连、只隔了一跳的关系权重再按IndirectRelationWeightDecay0.5衰减避免弱关联被误当成强关联。你看到的效果在知识库的图谱标签页节点大小对应实体出现频次边的粗细对应关系权重。以电商文档为例优惠券节点会同时连着订单状态和退款规则点开节点右侧面板直接显示它的描述和涉及的文档片段不用回原文搜索。检索链路答案怎么来的每一步都有痕迹你遇到的问题RAG 系统最容易挨问的一句话是为什么得到这个答案。只给结果不给过程答案的可信度就靠模型自觉。它的处理检索走混合策略BM25 稀疏检索管字面命中向量检索管语义相近两路结果合并后再经过重排。检索引擎的详细配置父子切分、GraphRAG、HNSW 加速的 pgvector 等见检索引擎文档。你看到的效果问答界面会按步骤展示已完成问题理解 → 检索中知识库 → 找到 N 个结果 → 完成并在答案上方标注检索完成、引用了 1 篇文档。答案里的引用可以直接点开跳到对应文档和分块审一遍就知道模型有没有读偏。Wiki 模式图谱不只看还能改和回滚除了即时检索WeKnora 的 Wiki 模式让 Agent 把原始文档蒸馏成互相链接的 Markdown 页面自动组织成分层目录。关键点是这个知识图谱产物是可运维的每页都有版本快照支持行级 diff 和一键回滚也可以直接在浏览器里手动编辑。Agent 生成错了改回来即可不用重新灌库。从克隆到看见第一张图的最短路径git clone https://gitcode.com/GitHub_Trending/we/WeKnora拉下仓库在.env里配好 LLM 和 Embedding 模型名称、维度、Base URL。启动服务并带上图谱组件docker compose pull docker compose --profile neo4j up -d打开http://localhost进入知识库设置页启用实体和关系提取上传一份文档等后台跑完抽取。在知识库的图谱标签页查看自动生成的实体关系图或者登录http://localhost:7474执行match (n) return (n)从 Neo4j 侧核对。回到对话页提一个跨文档的问题对照上方展示的检索步骤和引用分块验证检索链路。两个容易踩的坑图谱不是默认开启的Neo4j 是 compose 的独立 profile不显式带--profile neo4j起服务.env里NEO4J_ENABLEtrue配了也不会生效。启动后记得用NEO4J_URIbolt://neo4j:7687这个默认地址核对连接。图谱脏了先查并发和批处理参数实体抽取默认MaxConcurrentEntityExtractions4并发、关系抽取按DefaultRelationBatchSize5分批LLM 负载高时抽取质量会波动。如果某条边的权重明显偏低优先怀疑是 PMI 样本量不足出现次数少而不是边本身没连对——衰减系数会再打五折。另外上传后文档一直卡在解析不动多半是 Embedding 模型没配全常见问题文档第 3 节有完整排查清单。下一步想深入的话建议从 Wiki 模式文档 开始看 Agent 是怎么组织页面链接的再配合 MCP Server 说明 把这套检索和图谱能力接到你自己的应用里。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考