Gemini 3.7 Flash 半价突袭:三周一迭代,谷歌把竞争拉进 Agent 成本战
三周迭代、半价入场:这不是一次普通升级
8 月 13 日,谷歌发布 Gemini 3.7 Flash——距 3.6 Flash 只有三周,促销价只有前代首发价的一半。谷歌给它的定位是「迄今最智能的主力模型(workhorse model)」,主攻编程和 Agent。在 DeepMind 换帅八天后打出这张牌,3.7 Flash 更像是新管理层的宣言:竞争的主战场已经变了。
涨分的全是硬骨头:代码、工具调用、长链路 Agent
- FrontierCode 1.1 Main:34.4% → 43.6%,超过 Claude Sonnet 5(42.7%)和 GPT-5.6 Terra(41.3%)
- DeepSWE v1.1:约 49% → 65.3%(长周期软件工程)
- Terminal-bench 3.0:5.4% → 14.9%(困难终端 Agent 任务)
- OSWorld 2.0:33.8% → 47.9%(Computer Use)
- AutomationBench:17.0% → 30.4%(企业真实工作流)
注意没有数学、没有知识问答的刷分项。模型卡像一张谷歌最需要补课区域的清单——也正是 Agent 真正烧 Token 的地方。
真正的杀招是价格:Agent 时代成本结构变了
年底前,Gemini 3.7 Flash 定价输入 0.75 美元 / 输出 3.75 美元(每百万 Token),是 3.6 Flash 首发价的一半;2027 年 1 月 1 日起恢复至 1.5 / 7.5 美元。聊天模型一次调用就结束,而一个真正干活的 Agent 要规划、检索、读文件、调工具、失败重试——完成一个任务可能要调用模型几十上百次。成本结构从「按次回答」变成「按任务计费」,谁能用最低成本把一个足够聪明的模型跑完几百步,谁就是默认底座。半价,就是在为这个习惯播种。
三周节奏背后:Koray 时代的第一个动作
8 月 5 日 DeepMind 换帅,8 月 13 日新模型上线。Koray Kavukcuoglu 本就是 DeepMind 与 Google Cloud 之间的主要接口,他的任务清单写得很直白:更快迭代、把 Coding 抢回来、让 Gemini 真正跑进 Agent。布林重新下场督战,而旗舰 Gemini 3.5 Pro 至今没有发布时间——一边是 Flash 三周一更,一边是旗舰缺席,谷歌的紧迫感集中在哪,一目了然。
对行业意味着什么
竞争口径正在从「谁 benchmark 第一」转向「每个完成任务花多少钱」。Flash 与旗舰的差距已经小到很多生产负载根本不需要顶级模型(Artificial Analysis 智能指数 56,对比 GPT-5.6 Terra 57、Claude Sonnet 5 55)。谷歌在用当年云计算的打法打模型层:把单位成本打下来,让对手不得不跟。
开发者现在该做什么
- 拿自己的 Agent 循环(多文件修改、终端任务)实测 3.7 Flash,比「完成任务成本」而不是单次质量
- 算清 12 月 31 日促销窗口:价格翻倍前把工作负载落定
- 盯 Gemini 3.5 Pro:Flash 的节奏只是信号,旗舰才是真正的考试
订阅智宅客
AI / 技术 / 数字生活方式,新文章第一时间送到邮箱。








