EN
AI Engineer World's Fair

用一个开源库把 PDF 变成 AI 能读懂的结构,还省掉向量库

Structuring the Unstructured - Cedric Clyburn, Red Hat · Cedric Clyburn

21 min
ContextAgent

全片 21 分钟·真正值得盯屏约 8 分钟·3 个必看点

橙色 = 推荐必看的 8 分钟其余读导览就够
逐段导览 · 8 段
  1. 0:00 2:40

    上下文才是瓶颈

    开场立论:决定 AI 应用和 agent 上限的是喂给模型的上下文,而企业里最有价值的数据大多锁在 PDF、演示文稿、合同、扫描件和图表里,模型根本读不到。

    非结构化数据正在成为 AI 的新上下文层,而现有方案要么是专有服务,要么得把私有数据交给第三方

    这一段基本是讲者站着讲观点,画面只有几行标题文字,边做别的事听着就够▶ 跳到 0:00
    讲者 · Cedric Clyburn
  2. 2:40 4:35

    一个被污染的术语

    讲了一个真实事故:AI 读一份扫描版双栏 PDF 时,把左右两栏各自的两个词错误地拼成了一个根本不存在的术语,这个词此后出现在 20 篇科学论文里并被反复引用。

    解析环节出错不是格式问题,是会顺着引用链扩散出去的知识污染

    纯讲故事,没有配图,是全片最好复述给同事听的一段▶ 跳到 2:40
    讲者 · Cedric Clyburn
  3. 4:35 7:03

    两条路都不好走

    对比现有两个极端:简单解析器快而便宜但输出惨不忍睹;前沿大模型解析质量好,但输出 token 约 30 美元每百万,且每次结果不一致、模型一升级格式就变。

    贵不是大模型方案最大的问题,输出不确定、规模化后被幻觉污染才是

    屏幕上是解析结果的对照截图和成本数字,扫一眼那份乱码般的输出就够了,不必逐帧看▶ 跳到 4:35
    讲者 · Cedric Clyburn
  4. 7:03 9:37

    Docling 是中间答案

    介绍这个 Linux Foundation 旗下的开源项目:把 OCR 和版面分析结合起来,在本地 CPU 上把文档转成保留原有版面结构的 Markdown 或 JSON,并延伸到用视觉模型给图片自动写描述。

    本地 CPU 就能跑,适合不愿付费服务或处在完全隔离网络里的团队

    配的是能力总览图和一张文档结构示意,快速扫过图上的模块名,重点听中间那段关于图片自动标注的用途说明▶ 跳到 7:03
    讲者 · Cedric Clyburn
  5. 9:37 12:09

    三行代码转一份论文

    切到现场演示:装完包后用一个转换器对象直接吃进一份 8 页 PDF,输出是带类型定义的数据对象,可以查页数、查表格分布,再导出成 Markdown 或网页。

    转换结果不是一坨文本,而是有类型、可编程查询的文档对象

    从这里开始进入实机操作,代码和运行结果都在屏幕上滚动,跟着看能直接照抄用法▶ 跳到 9:37
    讲者 · Cedric Clyburn
  6. 12:09 14:03

    表格、图片和坐标框

    演示更细的抽取能力:把 8 张表导成可查询的数据表;调整流水线放大并提取图片,拿到图片本体、对应图注和内嵌文字的映射;最后用可视化工具给页面上每个可抽取元素画出方框。

    还能只抽指定字段,比如发票里的账单号和总价,不必整篇转换

    画方框那一段把「模型到底看懂了页面上哪些块」直接摊在屏幕上,是全片信息密度最高的画面,光听讲解体会不到▶ 跳到 12:09
    讲者 · Cedric Clyburn
  7. 14:03 16:40

    扔掉向量数据库

    提出一种反常规的检索做法:不切块、不做向量化、不建向量库,直接拿生成好的文档目录(每节带摘要)当索引,让模型在多轮循环里挑出相关章节再拉全文作答,并现场跑通。

    这套做法在一份含 418 个章节的年报上依然成立,靠多轮迭代应付复杂问题

    屏幕上能看到模型逐轮选章节、拉原文的过程,正是这段的说服力所在;只听结论会觉得像是在吹牛▶ 跳到 14:03
    讲者 · Cedric Clyburn
  8. 16:40 20:40

    上量与接进 agent

    收尾讲工程化:Hugging Face 做 FinePDFs 数据集时用它清洗网络抓取的 PDF,相比直接上视觉模型和 OCR 省了约 50 倍成本且 CPU 就能跑;面对几十万份文件可以部署成 REST 微服务,也可以通过标准协议把工具暴露给编码助手直接调用。

    接进 agent 后不用再记参数命令,一句话就能让助手完成转换、摘要和跨文件汇总

    主要是架构讲解和数字佐证,末尾那段本地模型配编辑器的演示画面较短,听着就能跟上▶ 跳到 16:40
    讲者 · Cedric Clyburn