5月19日、サンダー・ピチャイはステージでこう言いました。「あと1ヶ月待ってください」。 会場からはブーイングが起きました。あれから62日、Gemini 3.5 Proはまだリリースされていません。

3秒でわかる要約
I/Oで「あと1ヶ月」と約束 6月も未達 7月17日も未達 ベースモデルを丸ごと再学習 研究者4人流出+2,250億ドル蒸発 じゃあ今どう判断すべきか

Googleがステージで約束していたこと

5月19日のGoogle I/Oで、GoogleGemini 3.5 Pro を発表しました。200万トークンのコンテキストウィンドウ、複雑な問題をじっくり考える「Deep Think」推論モード、フロンティア級のマルチモーダル理解力 — これまで最上位の「Ultra」ティアに回していた用途をProひとつに統合する構成でした。

ピチャイは「来月まで待ってほしい」とステージ上で言い、開発者たちはその場でブーイングを飛ばしました。 この反応自体が、期待がすでに冷めていたことを示していますGoogleは今年初め、Gemini Ultra 1.5でも3ヶ月の遅延を出していたんです。

同じ日にリリースされたのは、より軽量な兄弟モデル、Gemini 3.5 Flashでした。こちらは実際に出て、公式ベンチマークも公開されました。Googleの公式ローンチ投稿によると、Terminal-Bench 2.1で76.2%(旧3.1 Proは70.3%)、MCP Atlasで83.6%(旧78.2%)を記録しています。 Flashは実体がありました。問題はProでした。

その約束、もう3回目の未達です

6月はそのまま過ぎました。Googleは7月17日と再度約束しましたが、これも公式発表ではなくリーク報道でした — 7月13日時点で、公式のモデルカードも、価格ページも、公開APIドキュメントへの記載も一切ありませんでした。 そして7月中旬、その7月17日も過ぎました。Geeky Gadgetsの報道によると、再構築されたモデルは依然として幻覚(ハルシネーション)と一貫性の問題を抱え、基本的な信頼性基準をクリアできていないとのことです。

理由は単純なチューニング不足ではありませんでした。HackerNoonとGeeky Gadgetsが匿名の内部関係者を引用して伝えたところによると、Google DeepMindはほぼ完成していたベースモデルを丸ごと破棄し、ネイティブのGemini 3基盤で事前学習(pre-training)からやり直したそうです。 事前学習はフロンティアモデル構築の中で最もコストがかかる工程で、ファインチューニングでは超えられない性能上限を決める段階です。これをやり直すということは、「調整すれば済む」レベルではなく「構造的に間違っていた」という自己判断があったということです。

具体的に何が失敗したかというと、複雑な多層SVGシーンを描画する際に構造的な一貫性が崩れ、複数ステップを経る再帰的なツールコール(エージェントが1つのツールを呼び、その結果でまた別のツールを呼ぶ連鎖)環境でも破綻したそうです。 再帰的なツールコールの安定性はエージェント型コーディングモデルの核心要件で、Googleが3.5世代全体を賭けた用途そのものです。すでに出ているFlashがそのカテゴリーが実現可能だと証明した以上、Proが同じ領域で後退していたら、フラッグシップのアップグレードどころか失態になっていたでしょう。

スケジュールだけが崩れたわけではありません。6月18日から24日までの10日間で、DeepMindのシニア研究者4人が一斉に離脱しました — Gemini共同リードのノーム・シェイザーはOpenAIへ、ノーベル賞受賞者のジョン・ジャンパーはAnthropicへ、ヨナス・アドラーとアレクサンダー・プリツェルも同じ週にAnthropicへ移籍しました。 同じ週、市場はAlphabetの時価総額から約2,250億ドルを消し去りました — 1年で最大の一日下落幅だったそうです。

Gemini 3.5 Pro(ロードマップ)今すぐ実際に使えるもの
リリース状況6月→7月17日と3回連続未達すでにリリース済み、ベンチマーク公開
公式文書モデルカード・価格ページなし公式APIドキュメント・価格公開
性能の根拠基調講演発表+匿名リーク独自テスターやベンチマークで検証可能
競合状況GPT-5.6 Sol・Grok 4.5は7月9日に公開済み今すぐ試して比較できる

Googleが事前学習をやり直している間に、競合モデルはすでに市場に出ていました。OpenAIのGPT-5.6 SolとxAIのGrok 4.5は7月9日に揃って一般公開されました。 噂されている価格は、Flashの約10倍水準 — 入力100万トークンあたり15ドル、出力60ドル前後と見られ、Deep Thinkは月額250ドルのUltra購読者限定になるという話です。 これらすべて、まだ「噂」というラベルが付いたままだということを忘れてはいけません。

これは他人事ではありません

業務にAIを組み込んでいる起業家・マーケター・開発者にとって、この話はニュースだけで終わりません。5月の基調講演を見て「200万トークンのコンテキストが出たら長文ドキュメントのワークフローを組もう」と待っていた人がいるなら、62日経った今も何も組めていないということです。

核心はこれです。基調講演のデモで出たベンチマーク数値と、実際にリリースされて独立検証まで終わった製品はまったく別物だということです。モデルカードも価格ページもないということは、まだ誰も公式に責任を持っていない数字だということです。 そして今回が初めてでもありません — Gemini Ultra 1.5も同じパターンで3ヶ月遅れました。 フロンティアモデルの遅延自体は珍しいことではありませんが、今回はベースモデル全体の再学習と主要人材の同時流出が重なった点が、これまでの遅延と違います。

AIロードマップの約束、こう見極めましょう

  1. 「確定」と「噂」をまず区別する
    公式ブログ・モデルカード・価格ページに載っている数字だけが確定です。基調講演の発表や「関係者によると」という報道はすべて噂として扱いましょう。
  2. 延期の履歴を検索一発で確認する
    そのモデルが何回延期されているか調べましょう。2回以上延期していれば、さらなる遅延をデフォルトのシナリオとして見込むのが安全です。
  3. ベンチマークの出所をたどる
    企業の自社発表の数字なのか、独立した評価機関やサードパーティのテスターが出した数字なのかを区別しましょう。自社発表だけなら、実際の性能は異なる可能性があります。
  4. 「待つコスト」を計算する
    今ある道具で今すぐ処理できる業務なのか、それとも新モデルの特定スペック(200万トークンなど)が本当に必須なのかを区別しましょう。多くの場合は前者です。
  5. 今使えるものからまず始める
    新モデルが出たらAPIエンドポイントを差し替えるだけで済むように設計しておき、ロードマップを待って手を止めないようにしましょう。

さらに深く知りたいなら

DeepMind人材流出のタイムライン 10日間に起きた出来事を時系列で追った分析 the-agent-report.com

Googleの「最悪の2週間」全体像 2,250億ドルの時価総額消失と研究者離脱をまとめた分析 tech-insider.org

なぜ事前学習をやり直したのか SVG生成・再帰的ツールコールの具体的な失敗内容 hackernoon.com

確定スペック vs 噂のスペック 200万トークンのコンテキストウィンドウと価格推定を項目別に整理 blog.getbind.co

7月中旬にAIモデルが集中した理由 GPT-5.6・Grok 4.5などの競合モデルのリリース時期が重なった背景 swisherpost.com

再学習が狙うもの:数学・SVG・画質 再構築の方向性と周辺モデルの動き finance.biggo.com