把云端 Sonnet 换成端上 Llama 3.2 且不掉性能:一套可照做的小模型右尺寸化评测实录
Frontier results, on device - RL Nabors, Arize · Rachel Lee Nabors
全片 31 分钟·真正值得盯屏约 12 分钟·3 个必看点
- 0:01 – 6:49略
为什么别一刀切用云端大模型
指出云端推理的三重代价:隐私合规风险、突破 4 秒可信度上限的延迟、持续上涨的推理支出,并铺开 SLM 选项谱系。
摘要、内容审核这类任务不需要万亿参数模型;10 亿参数模型量化后约 2GB,已能装进手机等终端设备。
内容以论述为主,几张幻灯片(SLM 与 LLM 参数量对比、量化体积、NVIDIA 论断)扫一眼即可,不必逐帧看▶ 跳到 0:01讲者 · Rachel Lee Nabors - 6:52 – 13:53听
方法论:Prototype Big, Deploy Small
讲解四步法(先用最强模型证明可行,再定义成功标准,逐级评测小模型,选出 SAGE),并展示如何用 14 个真实线程、28 个人工标注样例搭黄金数据集与成功指标。
动手换模型前必须先有 ground truth 和量化指标(JSON 可解析性、结构有效性、事实一致性、长度、P50/P95 延迟),否则无从判断『够不够好』。
这一段是纯口头方法论论述,画面依赖低,边听边记框架即可▶ 跳到 6:52讲者 · Rachel Lee Nabors - 13:53 – 17:20略
基准与四个候选小模型
确立 Claude Sonnet 基准(平均延迟 2.9 秒、14 个任务约 0.22 美元),列出四个候选端上模型:Qwen 2.5、Qwen 3、Llama 3.2、Gemma 4,并点出口碑推荐的陷阱。
本地推理的调用成本为零,因为算力被推到了用户设备上;但候选选型不能听口碑,要靠评测。
基准数字和候选模型清单以幻灯片呈现,扫一眼记下数字即可,论证部分靠听▶ 跳到 13:53讲者 · Rachel Lee Nabors - 17:20 – 20:58看
评测对决:Llama 3.2 胜出
用 Phoenix 跑出各候选模型的准确率与延迟对比:最快的 Qwen 2.5 准确率明显偏低,Llama 3.2 以约 90% 准确率综合胜出,多数输出与 Claude 几乎无法区分。
速度不能当唯一标准,单一指标会选错模型;要看准确率与延迟的综合面板。
这一段的说服力全在评测对比图上,数字反差(8 秒延迟 vs 1 秒、准确率差距)需要亲眼看图才有体感▶ 跳到 17:20讲者 · Rachel Lee Nabors - 20:58 – 28:00看
提示实验与后处理:追平大模型
逐一隔离变量测试提示技巧:负面约束反而更差、思维链得不偿失、Few-Shot 是最大赢家;再用 harness 后处理零成本修复结构与长度缺陷,最终 Llama 3.2 追平 Claude Sonnet。
小模型的提示优化结论与大模型直觉相反,且必须人工打开评测样本核查——LLM 裁判会偏袒同门模型的措辞。
实验结果图表和逐条翻看评测样本的画面是本段核心,反直觉结论要对着数据看才可信▶ 跳到 20:58讲者 · Rachel Lee Nabors - 28:01 – 30:50听
防退化与行动号召
建议把评测像 CI/CD 测试一样持续运行防止退化;号召听众回去审视每一个 LLM 调用,问『小模型能否胜任』,并利用设备内置模型(如 Chrome Prompt API 直连 Gemini Nano)。
起步动作很具体:挑一个现有功能,用本片流程换成端上小模型,评测常态化跑起来。
收尾以口头号召和展望为主,画面信息量低,听清行动清单即可▶ 跳到 28:01讲者 · Rachel Lee Nabors