8月13日,Google 发布了 Gemini 3.7 Flash——距离上一代 3.6 Flash 仅过去三周。官方给它的定位很直白:“我们迄今最聪明的 workhorse(工作马)模型”,主攻编码与 Agent 场景。更关键的是价格: introductory 定价为每百万 token 输入 $0.75 / 输出 $3.75,正好是 3.6 Flash 原价的一半,优惠持续到年底(2027年1月1日起恢复 $1.50/$7.50)。

背景:Flash 系列的"三周一代"节奏

Gemini 3.6 Flash 发布于7月下旬,3.7 Flash 在不到三周后接棒。Google 明确表示这次迭代是"开发者反馈 + 算法创新"的直接产物——这种节奏在旗舰模型上很少见,通常只出现在走量的中端线上。Flash 系列承担的是 Google AI 生态里最大的调用量:Gemini app、Antigravity IDE、Android Studio、企业 Agent 平台,全部以它为底座。把"最聪明的工作马"做便宜一半,本质上是把成本压力从开发者身上卸掉,换取更深的生态绑定。

核心能力:编码与知识工作的双线跃升

官方公布的基准对比(3.7 Flash vs 3.6 Flash)相当激进:

基准 3.7 Flash 3.6 Flash
FrontierCode 1.1 Main(生产级代码生成) 43.6% 34.4%
DeepSWE v1.1(真实仓库问题修复) 65.3% 49.0%
WebDev Arena Elo(Arena.ai 1588 1538
GDP.pdf(复杂文档处理) 34.0% 22.0%
AutomationBench(真实业务工作流) 30.4% 17.0%

几个值得注意的点:

  • DeepSWE v1.1 的 65.3% 意味着 3.7 Flash 在"修复真实 GitHub issue"这类任务上,已经追平甚至略超 Claude Opus 5(约 65.0%)——而价格只有后者的零头。这是本次发布最具攻击性的数字;
  • GDP.pdf 从 22% 跳到 34%:这个评测考察模型处理复杂长文档的能力,是金融、法律、生物科学等知识密集型场景的核心指标。Flash 级模型在这一档的进步幅度远超编码任务;
  • AutomationBench 接近翻倍(17% → 30.4%):对应的是"多步骤业务自动化"——整理文件、起草邮件、更新状态文档这类 Agent 日常动作。

官方还展示了几个演示:用 3.7 Flash + Nano Banana 实时生成角色、道具和纹理,从一句提示词直接产出可玩的 3D 游戏;以及用子代理编排(配合 Gemini Omni)一次性生成交互式落地页。

技术分析:纪律性执行是这次的主旋律

Google 对 3.7 Flash 的开发者体验描述集中在一个词:discipline(纪律)——遇到障碍时更好地适应、必要时主动澄清意图、更忠实地遵循指令,在多步规划和工具调用上"思考得更卖力"。翻译成工程语言就是:更少的人工盯守、更少的重试次数。

这与 Meta 上周发布 Muse Code 时的叙事形成了有趣的对照:Meta 卖的是"能扛 24 小时的运行时 + 极致低价",Google 卖的则是"模型本身变聪明了,而且半价"。两条路线殊途同归——Agent 时代的竞争焦点已经从峰值能力转向单位智能成本(cost per unit of intelligence)

另一个生态动作:Gemini Spark(面向 AI Pro/Ultra 订阅者的 24/7 个人 Agent,覆盖 160+ 国家)即日起切换到 3.7 Flash,重点强化了 Google Workspace 应用内的工具调用。安全方面,3.7 Flash 更新了 CBRN(化学生物放射核)与网络攻击领域的滥用防护。

影响与未来

对开发者而言,3.7 Flash 的 introductory 定价窗口(到年底)值得认真评估:如果你的 Agent 工作负载以编码和知识处理为主、且不需要 Opus/GPT-5.6 级别的峰值能力,$0.75/$3.75 的价格配合 DeepSWE 65.3% 的表现,性价比在当前所有 API 模型里几乎无出其右。

对竞争格局的影响更深远:Google 用三周一代的节奏证明 Flash 线的迭代速度可以脱离旗舰发布周期独立运转。接下来值得观察的是——当"工作马"越来越聪明、越来越便宜时,各家旗舰模型的溢价空间会被压缩到什么程度。答案可能比所有人预期的都要快。