EN
AI Engineer World's Fair

5分钟讲透一个RAG教程不会教的边角场景:当全部文档都相关且数据高频整体替换时,该怎么办。

When All Context Matters: Extended Cache Augmented Generation - Luis Romero-Sevilla, Orbis · Luis Romero-Sevilla

6 min
Context

全片 6 分钟·真正值得盯屏约 1 分钟·1 个必看点

橙色 = 推荐必看的 1 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:00 0:45

    问题设定:全量相关 + 高频替换

    开场界定一个特殊检索场景:集合中所有文档都与答案相关,且数据被高频整体替换,常规方案在此纷纷失效。

    这不是通用RAG问题,而是一个双重约束的边角场景——听懂这个前提才能理解后面所有取舍。

    全片无值得停留的画面标注,此段为口头问题陈述,听清前提即可。▶ 跳到 0:00
    讲者 · Luis Romero-Sevilla
  2. 0:45 1:45

    向量RAG:召回不全但换库快

    分析简单向量RAG的短板:只召回相似度阈值内的片段,无法覆盖“全部相关”的需求;但插入快,整库过期时可直接换新集合。

    向量RAG在高更新频率场景的真正优势不是检索质量,而是数据可整体热替换。

    论述型对比分析,无演示或关键图表,适合边听边记优劣势。▶ 跳到 0:45
    讲者 · Luis Romero-Sevilla
  3. 1:45 2:35

    GraphRAG:答得好但建得慢

    GraphRAG用LLM通读全集构建知识图谱,擅长跨全集合综合作答,但每次数据整体替换都要重建图谱,成本高耗时长。

    GraphRAG只适合文档集合基本不变的场景——重建成本是它在本场景下的致命伤。

    无标注视觉时刻,重点在“重建成本”这一口头论证。▶ 跳到 1:45
    讲者 · Luis Romero-Sevilla
  4. 2:35 3:15

    CAG与上下文窗口的天花板

    CAG把全部文档载入大上下文并缓存KV矩阵,省去检索;但窗口有限,填得过满回答质量反而下降。

    CAG的瓶颈不只是窗口大小,还有“塞满即降质”——这直接引出后面的分片思路。

    概念铺垫段,无画面依赖,理解KV缓存机制即可跟上下一段。▶ 跳到 2:35
    讲者 · Luis Romero-Sevilla
  5. 3:15 4:40

    eCAG:并行分片 + 监督模型

    提出eCAG:文档均衡分布到多个并行CAG分片,各分片答自己内容相关的问题,由一个较小的监督模型逐分片提问、渐进式构建理解并综合最终答案。分片可并行加载,知识构建远快于GraphRAG,答案又比简单RAG准。

    分片不要按领域分类——文档关联密集时监督模型会忽略表面无关的领域,无序均衡分布反而更好。

    虽是全片核心,但未标注现场演示或必看画面,架构逻辑靠口头讲清,需集中注意力听分片与监督模型的交互流程。▶ 跳到 3:15
    讲者 · Luis Romero-Sevilla
  6. 4:40 5:40

    成本坦白与“没有银弹”的收尾

    坦承KV缓存成本较高,可通过优化每分片的缓存保留量缓解;总结各类检索策略在计算、成本、速度上各有取舍,eCAG只是针对特定问题的定制解。

    不存在普适方案——选型应从“数据更新频率 × 相关文档占比”这两个维度出发定制。

    结论性口头论述,无图表依赖,适合作为选型心法记下来。▶ 跳到 4:40
    讲者 · Luis Romero-Sevilla