5月19日,桑达尔·皮查伊站在台上说:"再给我们一个月"。 台下观众当场发出嘘声。62天过去了,Gemini 3.5 Pro还是没有上线。

3秒读懂
I/O大会承诺"下个月" 6月跳票 7月17日也跳票 基础模型推倒重训 4名核心研究员出走+2250亿美元蒸发 那现在该怎么判断

谷歌当初在台上承诺了什么

5月19日的谷歌I/O大会上,谷歌发布了Gemini 3.5 Pro:200万token的上下文窗口、专为复杂问题设计的"Deep Think"深度推理模式,以及前沿级别的多模态理解能力——这套配置直接把原本划归顶级"Ultra"层级的场景都收进了Pro里。

皮查伊让大家再等一个月,开发者们当场就发出了嘘声。 这个反应本身就说明,大家的耐心早就被磨光了——毕竟谷歌今年早些时候已经把Gemini Ultra 1.5跳票了整整三个月。

同一天真正上线的,是更轻量的兄弟模型Gemini 3.5 Flash——它是实打实发布了,还附带了官方基准测试。根据谷歌官方发布文章,它在Terminal-Bench 2.1上拿到76.2%(此前的3.1 Pro是70.3%),在MCP Atlas上拿到83.6%(此前是78.2%)。 Flash是真实存在的。问题出在Pro身上。

这个承诺,已经是第三次跳票了

6月就这么过去了,什么都没发生。谷歌把目标改成了7月17日——但这也不是官方公告,只是媒体爆料。截至7月13日,公开的API文档里依然找不到任何模型卡、定价页面,甚至连gemini-3.5-pro这个名字都没有。 到了7月中旬,连7月17日这个日子也过去了。据Geeky Gadgets报道,重建后的模型仍然频繁出现幻觉和输出不一致的问题,连基本的可靠性门槛都过不了。

这背后的原因不是简单的调优问题。HackerNoon和Geeky Gadgets援引匿名内部消息源报道称,谷歌DeepMind直接放弃了已经接近完成的基础模型,在原生Gemini 3架构上从头重新开始预训练(pre-training)。 预训练是构建前沿模型中成本最高的阶段,它决定了后续微调都无法突破的能力天花板。选择推倒重来,意味着谷歌自己的工程师判断这个差距不是表面问题,而是结构性的。

具体来说,被放弃的那版模型在生成复杂的多层SVG场景时无法保持结构一致性,在需要多步骤的递归工具调用(智能体调用一个工具、用结果再调用另一个工具,如此层层推进)场景下也会崩溃。 递归工具调用的稳定性正是智能体编程模型的核心要求,而这恰恰是谷歌押注整个3.5代际的核心场景。Flash已经证明这条路是可行的,如果Pro在同样的任务上出现倒退,那就不是旗舰升级,而是一场灾难。

受影响的不只是时间表。6月18日到24日的十天里,DeepMind有四名资深研究员集体出走——Gemini联合负责人Noam Shazeer去了OpenAI,诺贝尔奖得主John Jumper去了Anthropic,Jonas Adler和Alexander Pritzel同一周也加入了Anthropic。 同一周,市场直接从Alphabet市值中抹去了约2250亿美元——这是过去一年里最大的单日跌幅。

Gemini 3.5 Pro(路线图)现在真正能用的
发布状态6月、7月17日连续跳票已发布,基准数据公开
官方文档无模型卡、无定价页面公开API文档和定价
性能依据发布会演示+匿名爆料可由独立测试者验证
竞争格局GPT-5.6 Sol、Grok 4.5已于7月9日上线现在就能试用对比

就在谷歌重启预训练的这段时间里,竞争对手的模型早已抢先上线。OpenAI的GPT-5.6 Sol和xAI的Grok 4.5都在7月9日同一天面向公众开放。 外界流传的定价大约是Flash的10倍——每百万输入token约15美元,输出约60美元,Deep Think功能据说会被锁定在每月250美元的Ultra订阅层级里。 但请记住,这些目前都还只是"传闻"。

这不只是谷歌自己的事

如果你是正在把AI嵌入日常工作流的创业者、市场人员或开发者,这件事的意义不止于一条新闻。如果你看完5月的发布会就想着"等200万token上下文窗口出来了再搭长文档工作流",那么62天过去,你其实什么都还没搭起来。

核心问题在于:发布会演示里的基准数字,和真正发布、经过独立验证的产品,完全是两回事。没有模型卡、没有定价页面,意味着这些数字目前还没有任何官方在为其背书。 而且这也不是谷歌第一次这样——Gemini Ultra 1.5同样以这种方式跳票了三个月。 前沿模型延期本身并不罕见,但这一次基础模型整体重训与核心人才同时出走叠加在一起,才是让这次延期不一样的地方。

以后这样过滤AI路线图承诺

  1. 先分清"确定"和"传闻"
    只有官方博客、模型卡、定价页面上的数字才算确定。发布会演示和"据消息人士透露"式的报道,在证实之前都只是传闻。
  2. 花一次搜索确认跳票历史
    查一下这个模型已经跳票了几次。如果已经跳票两次以上,默认再延期一次会更安全。
  3. 追溯基准数据的来源
    这个数字是企业自己公布的,还是独立评测机构或第三方测试者给出的?只有企业自报数据的话,实际表现可能会有出入。
  4. 算一算"等待的成本"
    用现有工具就能完成的工作,还是真的非要新模型的某个特定规格(比如200万token)不可?大多数情况下是前者。
  5. 先用现在已经发布的东西开工
    把工作流设计成将来只需替换一个API接口就能切换新模型,而不是干等路线图停滞不前。

想深入了解

DeepMind人才出走时间线 按时间顺序梳理这十天里发生的一切 the-agent-report.com

谷歌"最糟糕两周"全貌 关于2250亿美元市值蒸发与研究员离职的完整分析 tech-insider.org

为什么要重启预训练 SVG生成与递归工具调用失败的具体情况 hackernoon.com

确定规格 vs 传闻规格 200万token上下文窗口与定价预估的逐项梳理 blog.getbind.co

为什么七月中旬AI发布扎堆 GPT-5.6、Grok 4.5等竞品发布时间为何撞在一起 swisherpost.com

重训到底想解决什么:数学、SVG、图像质量 重建方向与相关配套模型的最新动态 finance.biggo.com