EN
AI Engineer World's Fair

不重建 Docker:给 Python 函数加个装饰器,直接在本地 IDE 里把代码丢上 GPU 云热重载迭代

GPU Cloud Deployment Without Leaving Your IDE — Audry Hsu, RunPod · Audry Hsu

20 min
AI 编程AI 产品

全片 20 分钟·真正值得盯屏约 7 分钟·3 个必看点

橙色 = 推荐必看的 7 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:00 5:31

    从闲置矿卡到 1.2 亿 ARR

    RunPod 创业故事(2022 年失败挖矿项目的闲置 GPU + Reddit 免费换反馈起家)与四条产品线全景:Pods、Serverless、Clusters、Hub,现覆盖 10 国 30 多个数据中心。

    四条产品线对应四种使用形态:独占 GPU、弹性函数、多节点训练、一键部署预审核模型

    纯口头叙述加常规介绍页,无关键画面,可当播客听▶ 跳到 0:00
    讲者 · Audry Hsu
  2. 5:43 9:01

    Flash 的切分哲学

    指出 GPU 开发真实瓶颈是基础设施而非模型(CUDA/PyTorch 版本对齐、每次改动都要走完整镜像循环),引出 Flash:给 async 函数加 endpoint 装饰器,函数体上云执行,其余代码留在本地。

    本地与云端的切分粒度是单个函数,无需预先搭建任何云端基础设施

    以概念讲解为主,画面信息量低;末尾 502 秒 flash run 启动本地 FastAPI 服务器可瞥一眼终端▶ 跳到 5:43
    讲者 · Audry Hsu
  3. 9:06 12:17

    现场演示:装饰器配置与首次请求

    逐项讲解 endpoint 装饰器的声明式参数(端点名、GPU 族、最大 worker 与常驻 worker 数),并向本地端点发请求,在终端实时看到云上任务被接收、创建、排队。

    部署配置全部收敛在装饰器参数里,扩缩容行为由声明式配置决定

    视觉时刻密集(626 秒终端实时观测、668 秒装饰器参数、719 秒 prompt 传参翻车),代码与终端画面是理解机制的关键▶ 跳到 9:06
    讲者 · Audry Hsu
  4. 12:21 16:18

    热切换模型与三模型编排管线

    演示热文件重载:把 SDXL Turbo 换成 Dreamshaper 并调推理步数后直接重发请求;随后串起 Qwen3 扩写 prompt、Dreamshaper 生图、Nano Banana 2 合成的三段式管线。

    真实 AI 应用的复杂度在多模型 orchestration,开源、自部署与商业模型可在同一管线混合编排

    全片价值最高的演示段,776 秒热切换与 903 秒管线串联都需看代码改动和生成结果对比才能体会▶ 跳到 12:21
    讲者 · Audry Hsu
  5. 16:24 19:43

    计费数字与 Pods/Serverless 选型

    给出 Serverless 按实际运行时长计费的数字(H100 约每秒 0.00116 美元)及其相对 Pods 的溢价逻辑;建议实验阶段用 Pods,数百 worker 跨数据中心的波动负载才用 Serverless。中间穿插 Qwen3 prompt 工程前后效果对比。

    Serverless 的溢价买的是自动扩缩容;实验期先用按秒计费的 Pods 更划算

    以幻灯片数字和口头建议为主,快进扫过定价页即可;1110 秒 prompt 扩写前后的生图对比值得停一下▶ 跳到 16:24
    讲者 · Audry Hsu
  6. 19:46 20:01

    收尾:本地起步即可

    总结 Flash 的定位:从本地环境直接起步,开源与私有模型皆可部署。

    上手路径是先在本地装 Flash 跑通一个函数,再考虑生产形态

    15 秒口头收尾,无画面依赖▶ 跳到 19:46
    讲者 · Audry Hsu