EN
AI Engineer World's Fair

单块GPU跑进开放榜前十:DeepMind亲授何时值得自托管Gemma 4,附现场演示。

Sovereign Escape Velocity: Ownership w Open Models — Gus Martins, & Ian Ballantyne, Google DeepMind · Gus Martins

21 min
AgentAI 编程EvalsAI 产品

全片 21 分钟·真正值得盯屏约 8 分钟·3 个必看点

橙色 = 推荐必看的 8 分钟其余读导览就够
逐段导览 · 6 段
  1. 0:15 4:00

    开场:开放模型的价值主张

    Gus 借 Gemma 4 发布切入,阐述开放模型对企业与主权机构的定位——不是追前沿,而是可控、可自持。

    大多数日常与 agentic 任务不需要前沿模型,这是全片论证的出发点。

    纯口头铺垫,无关键画面,适合当播客听。▶ 跳到 0:15
    讲者 · Gus Martins
  2. 4:00 7:22

    Gemma 4 家族与榜单表现

    介绍四款新模型:手机端 E2B/E4B、26B MoE(约 4B 激活参数)与最强的 31B Dense,并展示 LMArena 开放榜排名。

    两款大模型约排开放榜第 4 和第 7,而邻近模型至少比它们大 3 倍——体积效率是核心差异化。

    信息集中在 324 秒的 LMArena 榜单幻灯片上,扫一眼图表即可抓住要点,其余可快进。▶ 跳到 4:00
    讲者 · Gus Martins
  3. 7:22 11:17

    Apache 2.0 与主权 AI 实例

    许可从自定义许可改为 Apache 2.0,扫清法务采纳障碍;列举乌克兰公共服务、保加利亚国家级 LLM、巴西葡语微调等主权 AI 案例。

    许可变更解决的是“法务审查常常无果”这一真实采纳瓶颈,主权 AI 已有多国落地先例。

    案例与许可条款均为口头论述,无视觉依赖,听即可。▶ 跳到 7:22
    讲者 · Gus Martins
  4. 11:17 14:25

    token 经济账与手机端演示

    Ian 用 OpenRouter 数据说明 agentic 转向推高 token 成本(编程消耗最高),论证高消耗任务正是自托管收益最大处;随后现场演示手机直接运行 agent 技能。

    重构、分析、生成模块化代码这类“遵循具体指令”的高 token 任务,可卸载到单 GPU 或个人硬件。

    前半段有 OpenRouter 消耗图表,末尾 836 秒是手机端 agent 现场演示,是本段不可只听的部分。▶ 跳到 11:17
    讲者 · Ian Ballantyne
  5. 14:25 18:15

    本地部署形态与多智能体演示

    从端侧到企业级的部署选型:26B 含上下文约占 26GB 内存,48GB 统一内存的 M4 Mac 即可本地跑;压轴演示本机多智能体并行翻译并汇总成网页。

    同一套编排器+子 agent 的本地模式,可平移到文件处理、数据分析等任意 agentic 任务。

    本段是全片视觉密度最高处,含硬件配置实测与 1046 秒的完整多智能体现场演示,画面即论据。▶ 跳到 14:25
    讲者 · Ian Ballantyne
  6. 18:15 20:35

    上手路径与自持成本清单

    试用迁移成本极低:OpenAI 兼容接口指向 Ollama/LMStudio、换个模型名即可;给出能力、硬件、延迟、成本四维评估框架,并提醒成本要算入 GPU 维护与资本开支。

    用自有评测套件而非通用 benchmark 做判断——模型好不好取决于它在你的具体任务上的表现。

    决策框架与行动建议以口头总结为主,无需盯画面,适合边记要点边听。▶ 跳到 18:15
    讲者 · Ian Ballantyne