用一桩理赔审核案例,走通 AI 系统从需求到上线的完整四步
AI System Design: From Idea to Production - Apoorva Joshi, MongoDB · Apoorva Joshi
全片 29 分钟·真正值得盯屏约 10 分钟·3 个必看点
- 0:02 – 4:10听
AI 会写代码之后,难的是什么
开场论证:vibe coding 只适合低风险、结果肉眼就能验证的小东西;一旦系统要被别人依赖,功夫就转移到定义需求、系统设计和评估标准上,让编码助手去构建正确的东西。她提到这也是近期 Anthropic 和 OpenAI 演讲共同指向的结论。
「Specs are the new code」——瓶颈从写代码搬到了把要什么说清楚。
这一段基本是站着讲观点,画面只有标题页,边通勤边听不损失信息。▶ 跳到 0:02讲者 · Apoorva Joshi - 4:14 – 8:31看
先写业务问题,再收集约束
进入健康保险理赔审核这条贯穿案例。她示范怎么把问题写成面向具体用户、带量化痛点、且完全不预设是否用 agent 的一句话,然后逐条清点约束:合规要求、数据驻留、模型采购限制、哪些场景必须人工签字、延迟和预算的服务水平承诺。
约束不是设计完了再检查的清单,它会反过来塑造下游每一个架构决策,必须先摸清。
问题陈述范例和约束清单都以整页文字打在屏幕上,她只念要点、不逐条展开,光听会漏掉页面上的具体措辞——而那正是最值得抄走的部分。▶ 跳到 4:14讲者 · Apoorva Joshi - 8:35 – 14:05看
从数据摸底到推导出架构
设计的起点是数据:需要哪些数据、它们在哪、原始形态能不能直接喂给模型,以及按各数据源的更新频率安排管线节奏。接着讲处理和检索要匹配数据特性——长文档切块嵌入并抽元数据,走向量或混合检索,医学术语靠元数据过滤和关键词兜底;结构化数据精确匹配、去掉个人身份信息即可。最后把一次理赔请求的完整流转画完,架构自然浮现。
别一上来就搭 agent、也别让编码助手替你定架构和技术栈;先画请求怎么走,推出满足需求的最简系统。
后半段那张请求流转图是全片信息密度最高的一屏,分支条件和最终回写都画在图上,讲述时并没有把每条线都念出来。▶ 跳到 8:35讲者 · Apoorva Joshi - 14:10 – 17:28略
四种设计模式怎么挑
过一遍可选模式并说明在理赔系统里各自派什么用场:用检索增强补外部知识、用控制流让模型只在预定工作流里执行特定任务、把模型当分类路由器只做分发、在关键节点插入人工审核。她的立场是按需组合,而不是默认上全自治 agent。
模式是拿来拼的,选型依据是前面列出的约束,不是哪个更时髦。
配图是几张模式示意的方框箭头图,形状本身没有新增信息,扫一眼确认哪种模式对应哪个环节就够。▶ 跳到 14:10讲者 · Apoorva Joshi - 17:31 – 20:51听
让系统自证,让审核员喂回反馈
谈交互层的设计:用引用让系统能自我解释每条裁定的依据;同时给真实使用者——理赔审核员——留下改判裁定、标记引用有幻觉的入口,让日常操作本身产出改进信号。后半段落到技术栈选型。
反馈通道要长在审核员本来就要做的动作上,而不是另做一套打分表。
这段是产品判断的口头论述,屏幕停在要点列表上没有变化,听比看有效率。▶ 跳到 17:31讲者 · Apoorva Joshi - 20:56 – 23:57略
评估和护栏要从第一天就长在里面
因为模型系统是概率性的,护栏在这个时代成了必需品:输入侧拦掉无关请求,输出侧检测没有引用的响应,而且护栏的合规率本身要被量化。指标体系分三层:响应质量(比如答案是否忠于检索到的材料)、领域北极星指标(理赔处理时长)、系统健康(token 成本)。
评估不是上线前补的一道关,是和系统一起建的;你无法改进你无法度量的东西。
指标按层排成表格,扫表格比听她逐行念快得多,值得停一下截图。▶ 跳到 20:56讲者 · Apoorva Joshi - 24:01 – 28:46听
准确率之外:成本、延迟、可靠性
上线后还能追人工改判率、复核耗时这类隐式信号。优化分三路:准确率的本质是优化进入上下文窗口的信息(提示词、重排序、记忆),成本和延迟靠语义缓存与批处理,可靠性靠结构化输出保证每次都吐出带裁定和引用的固定结构。收尾重申约束先行、最简设计、评估内建,并给出资源链接。
「准确率看起来不错」不等于能上线——成本、延迟、可靠性是不可妥协的三道门。
优化手段是一条条口头列举,跟着听就行;只在最后几秒抬头把资源页的链接记下来。▶ 跳到 24:01讲者 · Apoorva Joshi