EN
AI Engineer World's Fair

300万条真实记录验证:合规风险藏在文档之间

AI-Driven Multi-Document Correlation for Financial Compliance - Varsha Shah, Independent · Varsha Shah

19 min
AI 产品Evals

全片 19 分钟·真正值得盯屏约 3 分钟·3 个必看点

橙色 = 推荐必看的 3 分钟其余读导览就够
逐段导览 · 7 段
  1. 0:04 3:20

    真正的风险藏在文档缝隙里

    开篇抛出核心命题:薪资记录、供应商发票、税务申报三份文件各自审都完全合规,问题只在把它们摆到一起时才浮现。讲者用这个反差定义了「文档之间」的风险概念。

    合规风险不在单份文档内部,而在文档与文档的关系中,单文档检测天然看不见它。

    整段是讲者口头铺陈问题,画面基本停在标题页,边通勤边听不会漏信息。▶ 跳到 0:04
    讲者 · Varsha Shah
  2. 3:20 7:13

    为什么规则引擎和文档级 NLP 都不够

    拆解现有两类主流方案的结构性盲区:规则引擎依赖预先写死的条件,文档级 NLP 再准也只看一份文件。两者都缺少跨系统建立联系的能力。

    这不是模型精度不够的问题,而是分析单元选错了——单位是「一份文档」时,跨文档的矛盾无从暴露。

    论证靠逻辑推演而非图示,讲者一直在做概念对比,只听就能跟上。▶ 跳到 3:20
    讲者 · Varsha Shah
  3. 7:13 9:50

    三大组件:关联、评分、跨辖区对齐

    框架主体在这里讲透:图实体关联引擎负责回答「什么和什么是关联的」,自适应概率风险模型判断「哪些关联才是真风险」,跨辖区规范化层统一货币、税制、报告周期和分类体系。

    三者是分工而非叠加——少了规范化层,同一笔交易会因所在辖区不同被读成不同结论,风险评分就失去了可比性。

    架构讲解以口述职责划分为主,配的是文字要点而非结构图,听清三者各管什么就够了。▶ 跳到 7:13
    讲者 · Varsha Shah
  4. 9:50 11:40

    评估:91% 精确率、87% 召回率

    公布在五年跨度、约 300 万条真实财务记录、四个监管辖区上的评估结果,精确率约 91%、召回率 87%、F1 0.89,且多辖区表现一致。

    值得关注的不只是指标高低,而是「四个辖区表现一致」——这说明效果来自方法本身,不是在某一套本地规则上过拟合。

    屏幕上是一张信息密度很高的结果表,指标和评估条件挤在一页,暂停扫一眼比跟着语速听更省时间。▶ 跳到 9:50
    讲者 · Varsha Shah
  5. 11:40 12:58

    误报降 76%,审计工作量降 40%

    把技术指标翻译成运营账:误报减少 76%,人工审计工作量降低约 40%,调查人员因此能把时间投到真正的高风险案件上。

    这套方案的回报主要来自「少查错的」而不是「多查出的」——省下的调查人力才是可量化的 ROI 来源。

    两个百分比和它们对应的业务解释都印在同一页上,看一眼记下数字即可,讲解部分是对数字的展开。▶ 跳到 11:40
    讲者 · Varsha Shah
  6. 12:58 15:50

    对比基线与持续学习闭环

    先与传统规则系统做逐项对比,确认各关键指标全面领先;随后讲清系统如何自我进化——确认的欺诈案例强化后续检测,误报回流用于精化评分,欺诈手法变化时无需人工改规则。

    静态规则会被新的欺诈模式绕过,而审计反馈构成的闭环让检测能力随对抗一起演进,这是与规则引擎最本质的差别。

    前半段有一张与规则系统的横向对比要看清,后半段的学习闭环则是纯口述,可以扫完对比图后转为听。▶ 跳到 12:58
    讲者 · Varsha Shah
  7. 15:50 18:58

    企业落地四要点与范式转变

    收束到落地条件:与 ERP、薪资、采购、税务平台的集成,面向本地法规的辖区级配置,与既有审计流程对齐,以及承载数百万级记录的可扩展性。最后提出合规应从事后验证转向预测式治理,并留下联系方式。

    落地成败往往不取决于模型,而取决于能否接进现有 ERP 与审计流程——组织要从问「什么出错了」转为问「接下来什么可能出错」。

    四点建议和结尾展望都是口头交付,只有最后留联系方式时才需要瞄一眼屏幕。▶ 跳到 15:50
    讲者 · Varsha Shah