Gemini-3.7-Flash发布:Google把"最聪明的工作马"价格砍半
8月13日,Google 发布了 Gemini 3.7 Flash——距离上一代 3.6 Flash 仅过去三周。官方给它的定位很直白:“我们迄今最聪明的 workhorse(工作马)模型”,主攻编码与 Agent 场景。更关键的是价格: introductory 定价为每百万 token 输入 $0.75 / 输出 $3.75,正好是 3.6 Flash 原价的一半,优惠持续到年底(2027年1月1日起恢复 $1.50/$7.50)。
背景:Flash 系列的"三周一代"节奏
Gemini 3.6 Flash 发布于7月下旬,3.7 Flash 在不到三周后接棒。Google 明确表示这次迭代是"开发者反馈 + 算法创新"的直接产物——这种节奏在旗舰模型上很少见,通常只出现在走量的中端线上。Flash 系列承担的是 Google AI 生态里最大的调用量:Gemini app、Antigravity IDE、Android Studio、企业 Agent 平台,全部以它为底座。把"最聪明的工作马"做便宜一半,本质上是把成本压力从开发者身上卸掉,换取更深的生态绑定。
核心能力:编码与知识工作的双线跃升
官方公布的基准对比(3.7 Flash vs 3.6 Flash)相当激进:
| 基准 | 3.7 Flash | 3.6 Flash |
|---|---|---|
| FrontierCode 1.1 Main(生产级代码生成) | 43.6% | 34.4% |
| DeepSWE v1.1(真实仓库问题修复) | 65.3% | 49.0% |
| WebDev Arena Elo(Arena.ai) | 1588 | 1538 |
| GDP.pdf(复杂文档处理) | 34.0% | 22.0% |
| AutomationBench(真实业务工作流) | 30.4% | 17.0% |
几个值得注意的点:
- DeepSWE v1.1 的 65.3% 意味着 3.7 Flash 在"修复真实 GitHub issue"这类任务上,已经追平甚至略超 Claude Opus 5(约 65.0%)——而价格只有后者的零头。这是本次发布最具攻击性的数字;
- GDP.pdf 从 22% 跳到 34%:这个评测考察模型处理复杂长文档的能力,是金融、法律、生物科学等知识密集型场景的核心指标。Flash 级模型在这一档的进步幅度远超编码任务;
- AutomationBench 接近翻倍(17% → 30.4%):对应的是"多步骤业务自动化"——整理文件、起草邮件、更新状态文档这类 Agent 日常动作。
官方还展示了几个演示:用 3.7 Flash + Nano Banana 实时生成角色、道具和纹理,从一句提示词直接产出可玩的 3D 游戏;以及用子代理编排(配合 Gemini Omni)一次性生成交互式落地页。
技术分析:纪律性执行是这次的主旋律
Google 对 3.7 Flash 的开发者体验描述集中在一个词:discipline(纪律)——遇到障碍时更好地适应、必要时主动澄清意图、更忠实地遵循指令,在多步规划和工具调用上"思考得更卖力"。翻译成工程语言就是:更少的人工盯守、更少的重试次数。
这与 Meta 上周发布 Muse Code 时的叙事形成了有趣的对照:Meta 卖的是"能扛 24 小时的运行时 + 极致低价",Google 卖的则是"模型本身变聪明了,而且半价"。两条路线殊途同归——Agent 时代的竞争焦点已经从峰值能力转向单位智能成本(cost per unit of intelligence)。
另一个生态动作:Gemini Spark(面向 AI Pro/Ultra 订阅者的 24/7 个人 Agent,覆盖 160+ 国家)即日起切换到 3.7 Flash,重点强化了 Google Workspace 应用内的工具调用。安全方面,3.7 Flash 更新了 CBRN(化学生物放射核)与网络攻击领域的滥用防护。
影响与未来
对开发者而言,3.7 Flash 的 introductory 定价窗口(到年底)值得认真评估:如果你的 Agent 工作负载以编码和知识处理为主、且不需要 Opus/GPT-5.6 级别的峰值能力,$0.75/$3.75 的价格配合 DeepSWE 65.3% 的表现,性价比在当前所有 API 模型里几乎无出其右。
对竞争格局的影响更深远:Google 用三周一代的节奏证明 Flash 线的迭代速度可以脱离旗舰发布周期独立运转。接下来值得观察的是——当"工作马"越来越聪明、越来越便宜时,各家旗舰模型的溢价空间会被压缩到什么程度。答案可能比所有人预期的都要快。
