"朴素 RAG 像是在一堆散落的纸条中找答案,GraphRAG 则是先看完目录和索引,再精准定位。"
引言:朴素 RAG 的天花板
传统 RAG(Retrieval-Augmented Generation)的流程很简单:把文档切块 → 向量化 → 检索 Top-K → 喂给 LLM 生成答案。这个方案在简单问答上效果不错,但在复杂场景下有明显局限。
朴素 RAG 的三大局限
┌──────────────────────────────────────────────────────┐
│ 朴素 RAG 的三大局限 │
├──────────────────────────────────────────────────────┤
│ │
│ 局限 1:全局理解缺失 │
│ ───────────────── │
│ 问题:"这部小说的主要主题是什么?" │
│ 朴素 RAG:检索到几个片段,无法概括全书主题 │
│ 原因:chunk 级检索丢失了全局视角 │
│ │
│ 局限 2:多跳推理弱 │
│ ───────────────── │
│ 问题:"A 公司的 CEO 毕业于哪所大学?" │
│ 朴素 RAG:可能只检索到 A 公司的介绍,或 CEO 的名字 │
│ 原因:答案需要 A 公司 → CEO → 教育背景,多跳推理 │
│ │
│ 局限 3:关系理解差 │
│ ───────────────── │
│ 问题:"张三和李四是什么关系?" │
│ 朴素 RAG:可能找到张三和李四各自的描述,但找不到关系 │
│ 原因:关系信息分散在不同文档中 │
│ │
└──────────────────────────────────────────────────────┘