在距离 Gemini 3.6 Flash 上线仅仅过去三周之际,Google 再次出人意料地火速推出了 Gemini 3.7 Flash。然而,与轻量级模型的密集迭代形成鲜明对比的是:曾经被寄予厚望的旗舰模型 Gemini 3.5 Pro,至今依然“遥遥无期”。
- 承诺周期(2026 年 5 月):Google I/O 大会公开承诺:“Gemini 3.5 Pro 下月(6月)正式推送”。
- 现实窘境(6月~8月):6月、7月已过,8月中旬迎来的却是 3.6 与 3.7 Flash 的连续填补。
- 核心现状(当前战局):旗舰 Pro 遭遇技术与对齐难产,前线只能依靠轻量级 Flash 苦撑门面。
那么,开启了最高思考模式(High)的 Gemini 3.7 Flash,究竟交出了一份怎样的战报?跳票数月的 3.5 Pro 背后究竟发生了什么?这场危机又如何引爆了 Google 近年来最剧烈的高层人事地震?
一、 榜单实测:Flash 的极限突围与断层天花板
根据 LMSYS Chatbot Arena 以及 Artificial Analysis 同步公布的最新评测数据,开启高推理算力(high)的 Gemini 3.7 Flash 确实展现出了作为轻量级模型的惊人战力,成功挤入全球第一梯队,但同时也清晰暴露了它与顶级超大旗舰之间的硬实力差距。
1. LMSYS 文本对话榜:位列全球第 9,跻身头部梯队

在考察通用对话与跨领域综合推理能力的 LMSYS 文本对话榜中:
- 实测表现:开启高推理算力(
high)的 Gemini 3.7 Flash 斩获 1490 分,位列全球第 9 名; - 同台对抗:与阿里巴巴的
qwen3.8-max(1491 分)、Anthropic 的claude-opus-5-max(1489 分)处于同一对抗区间; - 头名差距:落后榜首的
claude-fable-5(1506 分)16 分。
2. LMSYS 前端开发榜:与顶级代码旗舰存在明显代差

在考验真实前端代码构建与 UI 还原交付的 LMSYS 前端开发榜中:
- 实测表现:Gemini 3.7 Flash 以 1588 分 位列全球第 8 名;
- 局部表现:小幅领先智谱
glm-5.2-max(1587 分)与深度求索deepseek-v4-flash-high(1582 分); - 明显代差:落后榜首的
claude-opus-5-max(1691 分)高达 103 分,与第二梯队的kimi-k3-max(1674 分)、gpt-5.6-sol(1622 分)也有 30~80 分的差距,在处理复杂软件工程任务时依然存在瓶颈。
3. Artificial Analysis 综合智能指数:代际跨越与梯队定位

在综合 9 项前沿复杂基准(涵盖 Terminal-Bench、GPQA、Humanity's Last Exam 等)的 Artificial Analysis 综合智能指数中:
- 实测表现:Gemini 3.7 Flash 综合指数达到 56 分,位列全球第 9 名;
- 代际跨越:相比上一代
Gemini 3.5 Flash-Lite(37 分)实现了大幅跃升; - 头名差距:距离第一名
Claude Opus 5(63 分)落后 7 分。
阶段小结:轻量级的极限与战略真空
榜单实测数据清晰地表明:Gemini 3.7 Flash 已经把轻量级架构的推理性价比发挥到了极致,在通用对话与标准化基准中表现出色;但它无法替代全血旗舰(Pro / Ultra)在极难软件工程与 Agent 规划任务上的统治力。
当竞品纷纷拿出 Opus 5、GPT-5.6 Sol 等重型旗舰在代码高地上攻城略地时,Google 手中却只有 Flash 牌苦撑战线——这种绝对制高点上的缺位,正是 Google 内部当前最大焦虑的直接来源。
二、 旗舰失踪之谜:Gemini 3.5 Pro 为何深陷难产?
如果说 Flash 凭借极致的推理性价比还在苦苦维持战线,那么 Gemini 3.5 Pro 的“隐身” 则直接戳中了 Google 内部最敏感的神经。
从 2026 年 5 月 Google I/O 大会上高调承诺的“已在内部广泛使用,下月(6月)正式推送”,到如今 8 月中旬依然杳无音讯,这场长达数月的跳票背后,绝非简单的“排期微调”,而是一场深层次的技术攻坚失利与内部机制博弈。
1. 核心死穴:Agentic Coding(智能体编程)表现未达预期
在大模型全面迈入智能体(Agent)时代的背景下,代码能力早已不再是单纯的“函数补全”,而是衡量模型自主拆解复杂逻辑、跨仓库重构以及环境交互的最核心试金石。然而,这恰恰成了 3.5 Pro 的重灾区。
- 内部评测的“滑铁卢”:据彭博社等多家权威科技媒体披露,3.5 Pro 在内部严苛的软件工程与自动化基准(如复杂代码库 Debug、长时程 Agent 规划)测试中,表现始终无法达到对标竞品(如 Anthropic 的 Claude Opus 5 系列与 OpenAI 的 GPT-5 系列)的基线标准。
- 回炉重造后的再次失望:为了挽救代码短板,研发团队在 6 月下旬曾紧急重构并注入了新的微调与强化学习训练集。然而,重新评估的结果依然未见质的突破。在无法确保对同代旗舰形成压制的情况下,强行发版只会让 Google 陷入巨大的公关与技术信任危机。
- 5 月 I/O 大会承诺发版:内部多轮严苛评估未达标,Coding 与 Agentic 规划差距明显。
- 6 月下旬紧急重构重训:注入全新代码微调与强化学习(RL)数据集。
- 7 月全面复测评估:依然未见质的突破,无法确保压制同代旗舰。
- 8 月被迫继续推迟:避免贸然发版引发公关与技术信任危机,选择雪藏。
2. 数据的结构性劣势:缺乏高频开发者原生闭环
对于代码与智能体能力的落后,Google CEO Sundar Pichai 曾在内部与公开场合坦承:Google 在 Agentic Coding 领域确实“落后于前沿(a bit behind the frontier)”。
这暴露出 Google 在数据飞轮上的深层软肋:
- 缺少高粘性的原生开发产品:竞品凭借高频的开发者工具(如直接面向开发者的原生代码编辑生态、交互式 Artifacts)沉淀了海量真实的跨文件修改、Debug 试错与多轮反馈数据。
- 数据养料贫瘠:由于缺乏类似的高粘性闭环产品,Google 在用于强化学习(RLHF / RLAIF)的高质量真实开发者交互数据上处于天然劣势,导致模型在处理真实工业级代码场景时显得生硬且容易迷失上下文。
3. “军阀割据”:内部部门博弈与资源分散
除了纯算法层面的挑战,Google 庞大官僚体系下的组织内耗也是拖慢 3.5 Pro 的罪魁祸首:
- 主导权之争:在 Google 内部,Google DeepMind、Google Cloud、Android 以及开发者生态团队 都在试图主导自家的 AI 编程与 Agent 工具链,各自立项、互相争夺 TPU 算力与工程资源。
- 技术栈与目标冲突:云业务部门急于将模型封装为企业级 API 变现,而 DeepMind 的研究员则执着于前沿理论验证与学术纯洁性,导致产品定义反复摇摆,沟通与决策链路被无限拉长。
4. 巨头的对齐包袱:宁可跳票,不可犯错
初创公司可以“小步快跑、上线再修”,但 Google 的旗舰基座一旦正式打上“Pro”标签,必须立刻承接全球十亿级 Android 终端、Workspace 办公套件以及全球财富 500 强企业的核心工作流。
- 严苛的红队与合规压力:极高的安全审核、事实校验(Grounding)与反幻觉标准,使得任何处于及格线边缘的模型版本都会被安全委员会直接打回。
- 商业防守的被动:在没有绝对胜算超越竞品顶配旗舰之前,贸然发布一个处于下风的 3.5 Pro,不仅无法提振股价,反而会削弱企业客户对 Google 云生态的信心。这最终促使管理层做出了“按住 Pro 不发,靠 Flash 连环换代顶住战线”的妥协决策。
阶段小结
Gemini 3.5 Pro 的难产,是技术瓶颈、数据短板、部门内耗与大厂包袱共同催生的恶果。而正是这种旗舰难产带来的巨大危机感,直接引爆了 8 月初 Google 核心管理层的“人事大地震”。
三、 8月人事大地震:从“学术象牙塔”到“战时交付兵工厂”
旗舰基座 3.5 Pro 的难产与延期,不仅让 Google 在大模型竞争中倍感被动,更直接引爆了 Google 内部多年未见的高层人事海啸与权力洗牌。
2026 年 8 月 5 日,Google 母公司 Alphabet CEO Sundar Pichai 发布内部全员信,正式宣布了针对 AI 核心领导层的重大架构重组。这场调整彻底撕下了温和过渡的表象,宣告了 Google AI 战略的全面转向。
| 阵营派系 | 核心人物与变动 | 核心去向与权责变化 |
|---|---|---|
| 学术与科研探索派 (老将出走 / 退居幕后) |
Jeff Dean(效力 27 年灵魂元老) Sanjay Ghemawat(Google Senior Fellow) Quoc Le / Oriol Vinyals(核心技术骨干) |
离开 Google,四人联合创立专注于 AI 自动化科研实验的初创公司 Discovery Loop |
| Demis Hassabis(DeepMind 联合创始人) | 卸任 DeepMind CEO 日常运营管理,转任 董事长兼 Alphabet 首席科学家,退居宏观战略 | |
| 战时工程交付派 (实权统揽 / 硅谷中枢) |
Koray Kavukcuoglu (原 DeepMind CTO / 首席 AI 架构师) |
升任 Google DeepMind SVP,直接向 CEO Sundar Pichai 汇报,独揽 Gemini 研发、产品与开发者生态全权 |
1. 核心震荡:元老出走、统帅退位与铁腕接盘
① 27 年灵魂元老谢幕:Jeff Dean 携核心天团离职
- 事件:Google 第 30 号员工、现代分布式系统与深度学习基石的奠基人 Jeff Dean 正式离开效力 27 年的 Google。
- 带走的核心班底:包括其数十年的黄金搭档 Sanjay Ghemawat(Google Senior Fellow)、Quoc Le(Google Brain 联合创始人、AutoML 先驱)以及 Oriol Vinyals(原 DeepMind 研究副总裁兼 Gemini 核心技术负责人)。
- 去向:四人联合创立专注于利用 AI 自动化科学与工程实验循环的初创公司 Discovery Loop(Google 仅作为早期投资人与云算力伙伴参与)。
② Demis Hassabis 卸任 CEO,退居宏观幕后
- DeepMind 联合创始人兼 CEO、诺贝尔化学奖得主 Demis Hassabis 正式卸任 Google DeepMind 的日常运营与行政管理职务。
- 转任 Google DeepMind 董事长(Chair) 兼 Alphabet 首席科学家,并将主要精力转向宏观 AGI 战略、全球 AI 治理政策以及其亲自创立的 AI 制药公司 Isomorphic Labs。
③ Koray Kavukcuoglu 实权统揽:全面接管一线指挥权
- 原 DeepMind 首席技术官兼 Google 首席 AI 架构师 Koray Kavukcuoglu 升任 Google DeepMind 高级副总裁(SVP),直接向 Sundar Pichai 汇报。
- 一人全面统领 Gemini 基座模型开发、前沿 AI 研究、Gemini App 消费端以及开发者平台生态 的全部核心团队。
2. 深度剖析:人事风暴背后的终极焦虑
这一连串标志性的人物进退,深刻映射了 Google 在当前大模型战局下的三个底层逻辑变化:
① 烧钱压力与发版滞后的双重夹击
Google 2026 年的全年资本支出(CapEx)预计高达 1,950 亿至 2,050 亿美元,绝大部分砸向了庞大的 TPU/GPU 算力基础设施与数据中心。然而,与天文数字般的投入形成残酷对比的,是旗舰 3.5 Pro 的难产与 Coding 智能体能力的掉队。面对华尔街与董事会的严苛审视,管理层必须迅速给出交代并重构执行链路。
② 终结“学术浪漫主义”,全面转向“战时工程交付”
- 旧模式的局限:过去的 Google Brain 与 DeepMind 享有极高的学术自由度,研究员习惯于以攻克科学难题、发表顶级论文为导向(如 AlphaGo、AlphaFold),发版周期漫长且对商业落地缺乏紧迫感。
- 新模式的铁律:面对对手“以月为单位”的狂暴工程迭代,Google 已经没有时间等待漫长的学术探索。由具备极强工程落地能力的 Koray 掌权,标志着 Google 彻底终结了实验室文化,全面转入以“产品交付、版本迭代、商业防守”为绝对优先级的工业化战时状态。
③ 破除“双轨制”内耗,权力彻底收归硅谷中枢
自 2023 年两部门强行合并以来,伦敦 DeepMind 团队与山景城总部之间在技术路线、算力分配、发版标准上的隔阂始终未消。此外,Hassabis 长期常驻伦敦,跨时区指挥加州一线也带来了极高的沟通成本。
随着 Google 联合创始人谢尔盖·布林(Sergey Brin)在加州总部一线高频督战,常驻山景城、深受管理层信任的 Koray 接管实权,意味着 Google 彻底理顺了内部层级,完成了对 DeepMind“独立王国”的最终收编。
阶段小结
这场人事地震并非简单的内部倾轧,而是 Google 在大模型下半场为自身臃肿体制所动的一次“刮骨疗毒”。它扫清了学术研发与工程交付之间的沟通壁垒,而重新集结完毕的战时团队,其真正的终极考验与唯一救赎,全部压在了正在秘密训练的下一代王牌——Gemini 4 之上。
四、 破局的底牌:全力押注 Gemini 4
对于当前的 Google 而言,不断推陈出新的 Flash 系列只是在前线苦撑防线,而 3.5 Pro 的难产与受阻,促使管理层放弃在修补性过渡代上继续消耗资源,将翻盘的希望直接押注在了下一代重型基座 —— Gemini 4 之上。
- 正式开训:2026 年 7 月 21 日,Google 官方确认已正式开启 Gemini 4 的全量预训练(Pre-training);
- 官方定调:管理层将其称为公司历史上“最具雄心、体量跃升的顶级前沿模型预训练(Most ambitious pre-training run yet)”;
- 战略取向:在理顺高层人事与组织架构后,Google 不再将核心算力分散消耗在 3.5 Pro 这类修补性的过渡版本上,而是集中全球 TPU 算力集群,全力攻坚代际跨越的真正前沿基座。
总结
从这一系列的最新动态中,我们可以清晰地勾勒出 Google 当前的战役节奏:
- 战术防御:用 Gemini 3.7 Flash 这样高性价比、高响应速度的轻量模型稳住开发者生态和基本盘;
- 战略转型:通过剧烈的人事重组彻底终结“学术象牙塔”的拖沓内耗,全面转向“以工程交付为核心”的战时状态;
- 终极决战:将所有资源与翻盘胜负手,全部压在正在预训练的 Gemini 4 身上。