全免费本地栈现场跑通 RAG,证明干净分块比大模型更决定成败
Bypassing the Multimodal Tax: Hybrid RAG, SQL RRF & UI Telemetry - Abed Matini, Ogilvy · Abed Matini
全片 46 分钟·真正值得盯屏约 26 分钟·3 个必看点
- 0:01 – 3:40看
问题定义与实机亮相
开场就把屏幕右半边留给一个正在本地运行的 HR 员工手册问答助手,边讲边用它演示。随后交代要解决的问题:把文档整份丢给云端大模型,既付了不必要的 token 成本,也看不见它内部是怎么切分的。
把文档交给云端模型处理,代价不只是钱,更是失去对切分质量的控制权。
整段讲述都对着右侧那个真实在跑的问答界面和它的管理后台进行,光听会漏掉他手指的是哪个环节。▶ 跳到 0:01讲者 · Abed Matini - 3:43 – 6:55略
全本地 CPU 技术栈盘点
逐项列出这套系统用到的组件:FastAPI 与 React 做前后端,Postgres 存向量,Ollama 跑本地模型,Langfuse 做观测,全部开源、零付费依赖,普通 CPU 就能跑。
生产级 RAG 的完整链路可以不含任何一项付费服务,硬件门槛也只是一台普通机器。
这一段基本是一页技术栈清单加口头逐条介绍,画面信息量低,扫一眼组件名再往后跳即可。▶ 跳到 3:43讲者 · Abed Matini - 6:59 – 11:35略
结构优先的摄取管线
讲解端到端蓝图:PDF、PPT、图片先在本地统一转成 Markdown,清洗后再切分入库,用户提问时只在自己的库里检索。最后切到管理后台,展示已经入库的文档长什么样。
先转成结构化文本再切分,是整套架构绕开外部依赖的关键前提。
前四分多钟是一张静态的流程架构图配讲解,跟着听就够;接近 10:50 时他切到后台页面开始点实际文档,那里值得放慢。▶ 跳到 6:59讲者 · Abed Matini - 11:39 – 18:37看
分块对照实验
先展示把整本 28 页手册直接切分会产生什么——致谢页、签名栏这类毫无意义的片段大量混入。然后换成先整理成问答对、再按标题切分的做法,用同一个问题分别提问两套库并比对答案与引用来源。
答案带上引用片段之后,对错才变得可验证、可调试;片段一旦太大,你连自己错在哪都查不出来。
全程是在两个界面之间来回切换的实机操作,回答文本和它引用的原文片段并排显示,两种切分方式的差距完全靠画面呈现。▶ 跳到 11:39讲者 · Abed Matini - 18:41 – 22:05看
另外三种切分方式
依次演示按段落切、按固定 512 字符加 64 字符重叠切、按句子组切三种做法,并说明重叠区的作用是让相邻片段保住上下文。
定长切分不是最优解,但面对没有结构、也来不及清洗的杂乱数据,它仍是务实的兜底选择。
屏幕上直接翻出定长切分产生的片段,能看见它在一个单词中间断开——这种缺陷用说的很抽象,看一眼就懂了。▶ 跳到 18:41讲者 · Abed Matini - 22:08 – 29:10听
图片入库与纯函数智能体
介绍截图这类图片如何经图像转文本模型进入知识库,适合维护通知这种临时信息快速上下线。随后抛出全片最反直觉的一条主张:系统里所谓的「智能体」其实是普通 Python 函数,完全没有调用大模型。
能用确定性代码解决的环节就别塞给模型——快、零幻觉、还能写单元测试。
这一段以观点论述为主,画面停在幻灯片上没有实际操作,听讲者的推理过程就够了。▶ 跳到 22:08讲者 · Abed Matini - 29:11 – 33:52听
向量加关键词的混合检索
解释为什么单靠语义检索不够:它只能给出「意思相近」的结果。产品编号、价格、药品名这类必须精确命中的场景,需要把关键词检索和向量检索的结果融合排序,召回条数也要按业务调。
凡是用户会输入精确字符串的业务,纯语义检索一定会漏,必须补上关键词这一路。
全段是检索原理的口头推演,没有对应的操作演示,边做别的事听也不会丢信息。▶ 跳到 29:11讲者 · Abed Matini - 33:56 – 45:46看
护栏、可观测性与小模型收尾
讲护栏应该写在代码里、在请求到达模型之前就拦截——医疗类问题直接返回转人工话术,注入攻击靠正则和词典在发送前挡掉,系统提示词保持极简。接着展示本地部署的观测面板,最后回到后台用一个 0.5B 的小模型现场作答收尾。
把数据和请求都在进入模型之前管好,剩下的事一个 0.5B 模型就能胜任。
35:30 前后会切到观测面板,能看到按会话追踪的提问内容、命中片段数量和毫秒级延迟;42:25 之后又回到后台跑真实问答,这两处都是画面本身在给结论作证。▶ 跳到 33:56讲者 · Abed Matini