用一个开源库把 PDF 变成 AI 能读懂的结构,还省掉向量库
Structuring the Unstructured - Cedric Clyburn, Red Hat · Cedric Clyburn
全片 21 分钟·真正值得盯屏约 8 分钟·3 个必看点
- 0:00 – 2:40听
上下文才是瓶颈
开场立论:决定 AI 应用和 agent 上限的是喂给模型的上下文,而企业里最有价值的数据大多锁在 PDF、演示文稿、合同、扫描件和图表里,模型根本读不到。
非结构化数据正在成为 AI 的新上下文层,而现有方案要么是专有服务,要么得把私有数据交给第三方
这一段基本是讲者站着讲观点,画面只有几行标题文字,边做别的事听着就够▶ 跳到 0:00讲者 · Cedric Clyburn - 2:40 – 4:35听
一个被污染的术语
讲了一个真实事故:AI 读一份扫描版双栏 PDF 时,把左右两栏各自的两个词错误地拼成了一个根本不存在的术语,这个词此后出现在 20 篇科学论文里并被反复引用。
解析环节出错不是格式问题,是会顺着引用链扩散出去的知识污染
纯讲故事,没有配图,是全片最好复述给同事听的一段▶ 跳到 2:40讲者 · Cedric Clyburn - 4:35 – 7:03略
两条路都不好走
对比现有两个极端:简单解析器快而便宜但输出惨不忍睹;前沿大模型解析质量好,但输出 token 约 30 美元每百万,且每次结果不一致、模型一升级格式就变。
贵不是大模型方案最大的问题,输出不确定、规模化后被幻觉污染才是
屏幕上是解析结果的对照截图和成本数字,扫一眼那份乱码般的输出就够了,不必逐帧看▶ 跳到 4:35讲者 · Cedric Clyburn - 7:03 – 9:37略
Docling 是中间答案
介绍这个 Linux Foundation 旗下的开源项目:把 OCR 和版面分析结合起来,在本地 CPU 上把文档转成保留原有版面结构的 Markdown 或 JSON,并延伸到用视觉模型给图片自动写描述。
本地 CPU 就能跑,适合不愿付费服务或处在完全隔离网络里的团队
配的是能力总览图和一张文档结构示意,快速扫过图上的模块名,重点听中间那段关于图片自动标注的用途说明▶ 跳到 7:03讲者 · Cedric Clyburn - 9:37 – 12:09看
三行代码转一份论文
切到现场演示:装完包后用一个转换器对象直接吃进一份 8 页 PDF,输出是带类型定义的数据对象,可以查页数、查表格分布,再导出成 Markdown 或网页。
转换结果不是一坨文本,而是有类型、可编程查询的文档对象
从这里开始进入实机操作,代码和运行结果都在屏幕上滚动,跟着看能直接照抄用法▶ 跳到 9:37讲者 · Cedric Clyburn - 12:09 – 14:03看
表格、图片和坐标框
演示更细的抽取能力:把 8 张表导成可查询的数据表;调整流水线放大并提取图片,拿到图片本体、对应图注和内嵌文字的映射;最后用可视化工具给页面上每个可抽取元素画出方框。
还能只抽指定字段,比如发票里的账单号和总价,不必整篇转换
画方框那一段把「模型到底看懂了页面上哪些块」直接摊在屏幕上,是全片信息密度最高的画面,光听讲解体会不到▶ 跳到 12:09讲者 · Cedric Clyburn - 14:03 – 16:40看
扔掉向量数据库
提出一种反常规的检索做法:不切块、不做向量化、不建向量库,直接拿生成好的文档目录(每节带摘要)当索引,让模型在多轮循环里挑出相关章节再拉全文作答,并现场跑通。
这套做法在一份含 418 个章节的年报上依然成立,靠多轮迭代应付复杂问题
屏幕上能看到模型逐轮选章节、拉原文的过程,正是这段的说服力所在;只听结论会觉得像是在吹牛▶ 跳到 14:03讲者 · Cedric Clyburn - 16:40 – 20:40听
上量与接进 agent
收尾讲工程化:Hugging Face 做 FinePDFs 数据集时用它清洗网络抓取的 PDF,相比直接上视觉模型和 OCR 省了约 50 倍成本且 CPU 就能跑;面对几十万份文件可以部署成 REST 微服务,也可以通过标准协议把工具暴露给编码助手直接调用。
接进 agent 后不用再记参数命令,一句话就能让助手完成转换、摘要和跨文件汇总
主要是架构讲解和数字佐证,末尾那段本地模型配编辑器的演示画面较短,听着就能跟上▶ 跳到 16:40讲者 · Cedric Clyburn