8.5万美元失败的银行chatbot如何8周投产——模型第7周才选
The Production AI Playbook: Deploying Agents at Enterprise Scale — Sandipan Bhaumik, Databricks · Sandipan Bhaumik
全片 37 分钟·真正值得盯屏约 7 分钟·3 个必看点
- 0:15 – 7:16略
为什么demo漂亮生产翻车
剖析企业AI典型失败模式:从争论选哪个模型开始、缺评估缺追踪缺数据战略,并抛出五支柱框架作为解法。
评估、追踪、数据、编排、治理五支柱必须在写任何代码之前就纳入规划
以论述为主,唯一值得停留的是约313秒的五支柱框架图,扫到该页即可▶ 跳到 0:15讲者 · Sandipan Bhaumik - 7:16 – 12:25听
评估:AI系统的规格说明
讲如何用数字定义成功(60%查询由agent处理、85%准确率),与领域专家从约200条真实案例起步建评估集,以及确定性检查、LLM judge、行为评估三层架构。
行为评估(agent是否调对工具、是否陷入循环)最重要却最常被遗漏
纯方法论口头论述,无关键画面,适合边做事边听▶ 跳到 7:16讲者 · Sandipan Bhaumik - 12:25 – 16:27看
追踪与数据:Agent不原谅坏数据
用透支费减免的完整追踪链讲清生产级可观测性要捕获什么,并强调数据基础是最重要的支柱——讲者典型项目60%时间花在数据上。
人类对错数据宽容,agent会找到坏数据并自信地答错而你毫不知情
约758秒的决策链追踪示例是全片信息密度最高的画面,值得对照屏幕看每一步捕获了什么▶ 跳到 12:25讲者 · Sandipan Bhaumik - 16:27 – 23:29略
数据栈、集中追踪层与编排模式
介绍Delta Lake如何给非结构化数据带来数据库属性、多框架多云下的集中式追踪层,以及orchestrator-worker与choreography两种多Agent编排模式的取舍。
企业AI必然跨框架跨云,追踪数据要收进一个共享的集中层才能服务看板与监控
架构图密集(1010秒Delta Lake、1182秒集中追踪层、1266/1308秒两种编排模式),扫图理解结构即可,Databricks产品部分可加速▶ 跳到 16:27讲者 · Sandipan Bhaumik - 23:29 – 30:32听
案例:第7周才选模型的银行chatbot
此前花8.5万美元失败的银行客服chatbot,按五支柱方法逐周重建:前6周搭评估集、追踪与数据基础,第7周拿评估数据集跑各模型按数字定夺,8周投产。
模型最后选而不是最先选——有了自己的评估数据集,选型决策反而非常快
以叙事为主,逐周时间线口头讲述即可跟上;1778秒上线6周后的运营指标页可瞥一眼▶ 跳到 23:29讲者 · Sandipan Bhaumik - 30:32 – 36:47听
生产事故Playbook与收尾
讲AI项目最常缺失的生产事故playbook:评估看板检测、追踪诊断、prompt版本下线遏制、修复后把用例加回评估集闭环;结尾给出可下载的模板与清单资源。
prompt用Git管理,commit信息必须记录因何失败而改;评估数据集是需要owner和治理的活系统
流程性论述为主,最后2186秒的资源下载页记得截屏或记下获取方式▶ 跳到 30:32讲者 · Sandipan Bhaumik