EN
AI Engineer World's Fair

全免费本地栈现场跑通 RAG,证明干净分块比大模型更决定成败

Bypassing the Multimodal Tax: Hybrid RAG, SQL RRF & UI Telemetry - Abed Matini, Ogilvy · Abed Matini

46 min
ContextAgentAI 产品

全片 46 分钟·真正值得盯屏约 26 分钟·3 个必看点

橙色 = 推荐必看的 26 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:01 3:40

    问题定义与实机亮相

    开场就把屏幕右半边留给一个正在本地运行的 HR 员工手册问答助手,边讲边用它演示。随后交代要解决的问题:把文档整份丢给云端大模型,既付了不必要的 token 成本,也看不见它内部是怎么切分的。

    把文档交给云端模型处理,代价不只是钱,更是失去对切分质量的控制权。

    整段讲述都对着右侧那个真实在跑的问答界面和它的管理后台进行,光听会漏掉他手指的是哪个环节。▶ 跳到 0:01
    讲者 · Abed Matini
  2. 3:43 6:55

    全本地 CPU 技术栈盘点

    逐项列出这套系统用到的组件:FastAPI 与 React 做前后端,Postgres 存向量,Ollama 跑本地模型,Langfuse 做观测,全部开源、零付费依赖,普通 CPU 就能跑。

    生产级 RAG 的完整链路可以不含任何一项付费服务,硬件门槛也只是一台普通机器。

    这一段基本是一页技术栈清单加口头逐条介绍,画面信息量低,扫一眼组件名再往后跳即可。▶ 跳到 3:43
    讲者 · Abed Matini
  3. 6:59 11:35

    结构优先的摄取管线

    讲解端到端蓝图:PDF、PPT、图片先在本地统一转成 Markdown,清洗后再切分入库,用户提问时只在自己的库里检索。最后切到管理后台,展示已经入库的文档长什么样。

    先转成结构化文本再切分,是整套架构绕开外部依赖的关键前提。

    前四分多钟是一张静态的流程架构图配讲解,跟着听就够;接近 10:50 时他切到后台页面开始点实际文档,那里值得放慢。▶ 跳到 6:59
    讲者 · Abed Matini
  4. 11:39 18:37

    分块对照实验

    先展示把整本 28 页手册直接切分会产生什么——致谢页、签名栏这类毫无意义的片段大量混入。然后换成先整理成问答对、再按标题切分的做法,用同一个问题分别提问两套库并比对答案与引用来源。

    答案带上引用片段之后,对错才变得可验证、可调试;片段一旦太大,你连自己错在哪都查不出来。

    全程是在两个界面之间来回切换的实机操作,回答文本和它引用的原文片段并排显示,两种切分方式的差距完全靠画面呈现。▶ 跳到 11:39
    讲者 · Abed Matini
  5. 18:41 22:05

    另外三种切分方式

    依次演示按段落切、按固定 512 字符加 64 字符重叠切、按句子组切三种做法,并说明重叠区的作用是让相邻片段保住上下文。

    定长切分不是最优解,但面对没有结构、也来不及清洗的杂乱数据,它仍是务实的兜底选择。

    屏幕上直接翻出定长切分产生的片段,能看见它在一个单词中间断开——这种缺陷用说的很抽象,看一眼就懂了。▶ 跳到 18:41
    讲者 · Abed Matini
  6. 22:08 29:10

    图片入库与纯函数智能体

    介绍截图这类图片如何经图像转文本模型进入知识库,适合维护通知这种临时信息快速上下线。随后抛出全片最反直觉的一条主张:系统里所谓的「智能体」其实是普通 Python 函数,完全没有调用大模型。

    能用确定性代码解决的环节就别塞给模型——快、零幻觉、还能写单元测试。

    这一段以观点论述为主,画面停在幻灯片上没有实际操作,听讲者的推理过程就够了。▶ 跳到 22:08
    讲者 · Abed Matini
  7. 29:11 33:52

    向量加关键词的混合检索

    解释为什么单靠语义检索不够:它只能给出「意思相近」的结果。产品编号、价格、药品名这类必须精确命中的场景,需要把关键词检索和向量检索的结果融合排序,召回条数也要按业务调。

    凡是用户会输入精确字符串的业务,纯语义检索一定会漏,必须补上关键词这一路。

    全段是检索原理的口头推演,没有对应的操作演示,边做别的事听也不会丢信息。▶ 跳到 29:11
    讲者 · Abed Matini
  8. 33:56 45:46

    护栏、可观测性与小模型收尾

    讲护栏应该写在代码里、在请求到达模型之前就拦截——医疗类问题直接返回转人工话术,注入攻击靠正则和词典在发送前挡掉,系统提示词保持极简。接着展示本地部署的观测面板,最后回到后台用一个 0.5B 的小模型现场作答收尾。

    把数据和请求都在进入模型之前管好,剩下的事一个 0.5B 模型就能胜任。

    35:30 前后会切到观测面板,能看到按会话追踪的提问内容、命中片段数量和毫秒级延迟;42:25 之后又回到后台跑真实问答,这两处都是画面本身在给结论作证。▶ 跳到 33:56
    讲者 · Abed Matini