EN
AI Engineer World's Fair

8.5万美元失败的银行chatbot如何8周投产——模型第7周才选

The Production AI Playbook: Deploying Agents at Enterprise Scale — Sandipan Bhaumik, Databricks · Sandipan Bhaumik

37 min
AgentEvalsAI 产品

全片 37 分钟·真正值得盯屏约 7 分钟·3 个必看点

橙色 = 推荐必看的 7 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:15 7:16

    为什么demo漂亮生产翻车

    剖析企业AI典型失败模式:从争论选哪个模型开始、缺评估缺追踪缺数据战略,并抛出五支柱框架作为解法。

    评估、追踪、数据、编排、治理五支柱必须在写任何代码之前就纳入规划

    以论述为主,唯一值得停留的是约313秒的五支柱框架图,扫到该页即可▶ 跳到 0:15
    讲者 · Sandipan Bhaumik
  2. 7:16 12:25

    评估:AI系统的规格说明

    讲如何用数字定义成功(60%查询由agent处理、85%准确率),与领域专家从约200条真实案例起步建评估集,以及确定性检查、LLM judge、行为评估三层架构。

    行为评估(agent是否调对工具、是否陷入循环)最重要却最常被遗漏

    纯方法论口头论述,无关键画面,适合边做事边听▶ 跳到 7:16
    讲者 · Sandipan Bhaumik
  3. 12:25 16:27

    追踪与数据:Agent不原谅坏数据

    用透支费减免的完整追踪链讲清生产级可观测性要捕获什么,并强调数据基础是最重要的支柱——讲者典型项目60%时间花在数据上。

    人类对错数据宽容,agent会找到坏数据并自信地答错而你毫不知情

    约758秒的决策链追踪示例是全片信息密度最高的画面,值得对照屏幕看每一步捕获了什么▶ 跳到 12:25
    讲者 · Sandipan Bhaumik
  4. 16:27 23:29

    数据栈、集中追踪层与编排模式

    介绍Delta Lake如何给非结构化数据带来数据库属性、多框架多云下的集中式追踪层,以及orchestrator-worker与choreography两种多Agent编排模式的取舍。

    企业AI必然跨框架跨云,追踪数据要收进一个共享的集中层才能服务看板与监控

    架构图密集(1010秒Delta Lake、1182秒集中追踪层、1266/1308秒两种编排模式),扫图理解结构即可,Databricks产品部分可加速▶ 跳到 16:27
    讲者 · Sandipan Bhaumik
  5. 23:29 30:32

    案例:第7周才选模型的银行chatbot

    此前花8.5万美元失败的银行客服chatbot,按五支柱方法逐周重建:前6周搭评估集、追踪与数据基础,第7周拿评估数据集跑各模型按数字定夺,8周投产。

    模型最后选而不是最先选——有了自己的评估数据集,选型决策反而非常快

    以叙事为主,逐周时间线口头讲述即可跟上;1778秒上线6周后的运营指标页可瞥一眼▶ 跳到 23:29
    讲者 · Sandipan Bhaumik
  6. 30:32 36:47

    生产事故Playbook与收尾

    讲AI项目最常缺失的生产事故playbook:评估看板检测、追踪诊断、prompt版本下线遏制、修复后把用例加回评估集闭环;结尾给出可下载的模板与清单资源。

    prompt用Git管理,commit信息必须记录因何失败而改;评估数据集是需要owner和治理的活系统

    流程性论述为主,最后2186秒的资源下载页记得截屏或记下获取方式▶ 跳到 30:32
    讲者 · Sandipan Bhaumik