5分钟讲透一个RAG教程不会教的边角场景:当全部文档都相关且数据高频整体替换时,该怎么办。
When All Context Matters: Extended Cache Augmented Generation - Luis Romero-Sevilla, Orbis · Luis Romero-Sevilla
全片 6 分钟·真正值得盯屏约 1 分钟·1 个必看点
- 0:00 – 0:45听
问题设定:全量相关 + 高频替换
开场界定一个特殊检索场景:集合中所有文档都与答案相关,且数据被高频整体替换,常规方案在此纷纷失效。
这不是通用RAG问题,而是一个双重约束的边角场景——听懂这个前提才能理解后面所有取舍。
全片无值得停留的画面标注,此段为口头问题陈述,听清前提即可。▶ 跳到 0:00讲者 · Luis Romero-Sevilla - 0:45 – 1:45听
向量RAG:召回不全但换库快
分析简单向量RAG的短板:只召回相似度阈值内的片段,无法覆盖“全部相关”的需求;但插入快,整库过期时可直接换新集合。
向量RAG在高更新频率场景的真正优势不是检索质量,而是数据可整体热替换。
论述型对比分析,无演示或关键图表,适合边听边记优劣势。▶ 跳到 0:45讲者 · Luis Romero-Sevilla - 1:45 – 2:35听
GraphRAG:答得好但建得慢
GraphRAG用LLM通读全集构建知识图谱,擅长跨全集合综合作答,但每次数据整体替换都要重建图谱,成本高耗时长。
GraphRAG只适合文档集合基本不变的场景——重建成本是它在本场景下的致命伤。
无标注视觉时刻,重点在“重建成本”这一口头论证。▶ 跳到 1:45讲者 · Luis Romero-Sevilla - 2:35 – 3:15听
CAG与上下文窗口的天花板
CAG把全部文档载入大上下文并缓存KV矩阵,省去检索;但窗口有限,填得过满回答质量反而下降。
CAG的瓶颈不只是窗口大小,还有“塞满即降质”——这直接引出后面的分片思路。
概念铺垫段,无画面依赖,理解KV缓存机制即可跟上下一段。▶ 跳到 2:35讲者 · Luis Romero-Sevilla - 3:15 – 4:40听
eCAG:并行分片 + 监督模型
提出eCAG:文档均衡分布到多个并行CAG分片,各分片答自己内容相关的问题,由一个较小的监督模型逐分片提问、渐进式构建理解并综合最终答案。分片可并行加载,知识构建远快于GraphRAG,答案又比简单RAG准。
分片不要按领域分类——文档关联密集时监督模型会忽略表面无关的领域,无序均衡分布反而更好。
虽是全片核心,但未标注现场演示或必看画面,架构逻辑靠口头讲清,需集中注意力听分片与监督模型的交互流程。▶ 跳到 3:15讲者 · Luis Romero-Sevilla - 4:40 – 5:40听
成本坦白与“没有银弹”的收尾
坦承KV缓存成本较高,可通过优化每分片的缓存保留量缓解;总结各类检索策略在计算、成本、速度上各有取舍,eCAG只是针对特定问题的定制解。
不存在普适方案——选型应从“数据更新频率 × 相关文档占比”这两个维度出发定制。
结论性口头论述,无图表依赖,适合作为选型心法记下来。▶ 跳到 4:40讲者 · Luis Romero-Sevilla