5月19日,桑达尔·皮查伊站在台上说:"再给我们一个月"。 台下观众当场发出嘘声。62天过去了,Gemini 3.5 Pro还是没有上线。
谷歌当初在台上承诺了什么
5月19日的谷歌I/O大会上,谷歌发布了Gemini 3.5 Pro:200万token的上下文窗口、专为复杂问题设计的"Deep Think"深度推理模式,以及前沿级别的多模态理解能力——这套配置直接把原本划归顶级"Ultra"层级的场景都收进了Pro里。
皮查伊让大家再等一个月,开发者们当场就发出了嘘声。 这个反应本身就说明,大家的耐心早就被磨光了——毕竟谷歌今年早些时候已经把Gemini Ultra 1.5跳票了整整三个月。
同一天真正上线的,是更轻量的兄弟模型Gemini 3.5 Flash——它是实打实发布了,还附带了官方基准测试。根据谷歌官方发布文章,它在Terminal-Bench 2.1上拿到76.2%(此前的3.1 Pro是70.3%),在MCP Atlas上拿到83.6%(此前是78.2%)。 Flash是真实存在的。问题出在Pro身上。
这个承诺,已经是第三次跳票了
6月就这么过去了,什么都没发生。谷歌把目标改成了7月17日——但这也不是官方公告,只是媒体爆料。截至7月13日,公开的API文档里依然找不到任何模型卡、定价页面,甚至连gemini-3.5-pro这个名字都没有。 到了7月中旬,连7月17日这个日子也过去了。据Geeky Gadgets报道,重建后的模型仍然频繁出现幻觉和输出不一致的问题,连基本的可靠性门槛都过不了。
这背后的原因不是简单的调优问题。HackerNoon和Geeky Gadgets援引匿名内部消息源报道称,谷歌DeepMind直接放弃了已经接近完成的基础模型,在原生Gemini 3架构上从头重新开始预训练(pre-training)。 预训练是构建前沿模型中成本最高的阶段,它决定了后续微调都无法突破的能力天花板。选择推倒重来,意味着谷歌自己的工程师判断这个差距不是表面问题,而是结构性的。
具体来说,被放弃的那版模型在生成复杂的多层SVG场景时无法保持结构一致性,在需要多步骤的递归工具调用(智能体调用一个工具、用结果再调用另一个工具,如此层层推进)场景下也会崩溃。 递归工具调用的稳定性正是智能体编程模型的核心要求,而这恰恰是谷歌押注整个3.5代际的核心场景。Flash已经证明这条路是可行的,如果Pro在同样的任务上出现倒退,那就不是旗舰升级,而是一场灾难。
受影响的不只是时间表。6月18日到24日的十天里,DeepMind有四名资深研究员集体出走——Gemini联合负责人Noam Shazeer去了OpenAI,诺贝尔奖得主John Jumper去了Anthropic,Jonas Adler和Alexander Pritzel同一周也加入了Anthropic。 同一周,市场直接从Alphabet市值中抹去了约2250亿美元——这是过去一年里最大的单日跌幅。
| Gemini 3.5 Pro(路线图) | 现在真正能用的 | |
|---|---|---|
| 发布状态 | 6月、7月17日连续跳票 | 已发布,基准数据公开 |
| 官方文档 | 无模型卡、无定价页面 | 公开API文档和定价 |
| 性能依据 | 发布会演示+匿名爆料 | 可由独立测试者验证 |
| 竞争格局 | GPT-5.6 Sol、Grok 4.5已于7月9日上线 | 现在就能试用对比 |
就在谷歌重启预训练的这段时间里,竞争对手的模型早已抢先上线。OpenAI的GPT-5.6 Sol和xAI的Grok 4.5都在7月9日同一天面向公众开放。 外界流传的定价大约是Flash的10倍——每百万输入token约15美元,输出约60美元,Deep Think功能据说会被锁定在每月250美元的Ultra订阅层级里。 但请记住,这些目前都还只是"传闻"。
这不只是谷歌自己的事
如果你是正在把AI嵌入日常工作流的创业者、市场人员或开发者,这件事的意义不止于一条新闻。如果你看完5月的发布会就想着"等200万token上下文窗口出来了再搭长文档工作流",那么62天过去,你其实什么都还没搭起来。
核心问题在于:发布会演示里的基准数字,和真正发布、经过独立验证的产品,完全是两回事。没有模型卡、没有定价页面,意味着这些数字目前还没有任何官方在为其背书。 而且这也不是谷歌第一次这样——Gemini Ultra 1.5同样以这种方式跳票了三个月。 前沿模型延期本身并不罕见,但这一次基础模型整体重训与核心人才同时出走叠加在一起,才是让这次延期不一样的地方。
以后这样过滤AI路线图承诺
- 先分清"确定"和"传闻"
只有官方博客、模型卡、定价页面上的数字才算确定。发布会演示和"据消息人士透露"式的报道,在证实之前都只是传闻。 - 花一次搜索确认跳票历史
查一下这个模型已经跳票了几次。如果已经跳票两次以上,默认再延期一次会更安全。 - 追溯基准数据的来源
这个数字是企业自己公布的,还是独立评测机构或第三方测试者给出的?只有企业自报数据的话,实际表现可能会有出入。 - 算一算"等待的成本"
用现有工具就能完成的工作,还是真的非要新模型的某个特定规格(比如200万token)不可?大多数情况下是前者。 - 先用现在已经发布的东西开工
把工作流设计成将来只需替换一个API接口就能切换新模型,而不是干等路线图停滞不前。
想深入了解
DeepMind人才出走时间线 按时间顺序梳理这十天里发生的一切 the-agent-report.com
谷歌"最糟糕两周"全貌 关于2250亿美元市值蒸发与研究员离职的完整分析 tech-insider.org
为什么要重启预训练 SVG生成与递归工具调用失败的具体情况 hackernoon.com
确定规格 vs 传闻规格 200万token上下文窗口与定价预估的逐项梳理 blog.getbind.co
为什么七月中旬AI发布扎堆 GPT-5.6、Grok 4.5等竞品发布时间为何撞在一起 swisherpost.com
重训到底想解决什么:数学、SVG、图像质量 重建方向与相关配套模型的最新动态 finance.biggo.com




