マイクロソフトが自社の調査で確認しました。Claude Codeを使ったエンジニアは、PRのマージ数が24%多かったということを。
そして2026年6月30日、会計年度が終わるその日に、5,000人を超えるエンジニアのライセンスを打ち切りました。
効果は証明されたのに、なぜ止めたのでしょうか。
ところが、請求書がおかしかった
マイクロソフトによるClaude Code導入は順調に進みました。2025年12月、数万人規模でロールアウトし、その効果は4カ月間ずっと衰えませんでした。導入したエンジニアは、そうでないエンジニアに比べて1日あたりのPRマージ数が24%多かったのです。
問題は、最初はシート単位の定額制でスタートしたことでした。使用量が見えないので誰もが気兼ねなく使い、従量制に切り替わった途端に本当のコストが露わになったのです。1人あたり月500〜2,000ドル水準まで膨らみ、結局会計年度末の6月30日に多くのエンジニアのライセンスを整理しました。
ほぼ同じ頃、Uberは2026年のAIコーディング予算をわずか4カ月で使い切りました。対応はシンプルでした——従業員1人あたり、モデルごとに月1,500ドルの上限を設けたのです。
このニュースに接したHacker Newsの開発者たちの反応は冷ややかでした。リクエストの結果が出るまで、いくらかかるか誰にも分からない——それは白紙の小切手にサインするようなものだ、というわけです。
みんながブレーキを踏み始めた
Uber・マイクロソフトだけの話ではありません。業種を問わず、上限が設けられ始めています。
| 会社 | ポリシー |
|---|---|
| AhnLab | GitHub Copilot 月3,000クレジット制限 |
| LG電子 | 基本トークン予算を支給、超過時は事前稟議 |
| サムスン電子 | トークン対比成果を測る「トークンコスパ」システム |
| Netmarble・NHN | 役職・チーム別に段階的な月間利用上限 |
| 現代自動車 | 重複契約禁止、許可されたAIのみ使用 |
| Uber | モデルごとに従業員1人あたり月1,500ドルの上限 |
| Walmart・Amazon | 低価格モデルを優先適用 |
ここまでくると空気感が伝わってきます。GartnerのシニアアナリストはAIトークンの利用料が2年以内にソフトウェアエンジニアの月給水準に達するか、それを超える可能性があると警告しました。すでに月2万〜3万2,000ドルを使う極端な事例も出ています。
Metaでは、ある社員が1カ月で2,800億トークンを使いました。会社全体では30日間で60兆トークンが消費されています。こうなると、「生産性」と「支出」はまったく別の問題になります。
だからといって、とにかく安いモデルに切り替えればいいわけではない
ここでよくある誤解が一つあります。「じゃあ、一番安いモデルだけ使えばいいじゃないか」というものです。ですが、実際にコストを管理している企業のやり方はそれとは違います。
Databricksはこの問題を扱ったブログで、「インテリジェンス・フロンティア」ではなく「エフィシエンシー・フロンティア」へ移行すべきだと述べています——とにかく最新・最高性能のモデルを選ぶのではなく、タスクごとにコストパフォーマンスの合ったモデルを選ぶべきだということです。
実際にこのブログではStripeの事例が紹介されています。Stripeは上位モデル(Opus 4.7)へのアップグレードを試したものの、コスト上昇分に見合う価値が得られないと判断し、見送ったそうです。
| 管理せずに使う | ルーティング+上限で管理する | |
|---|---|---|
| コスト把握のタイミング | 請求書が届いてから | リアルタイムダッシュボード |
| モデル選択 | 常に最上位モデルがデフォルト | タスクの難易度別に自動ルーティング |
| 予算超過時の対応 | 無制限、または全面停止 | 75%・90%でアラート後にダウンシフト |
| 実際の結果 | Uberは4カ月で年間予算を使い切った | ハーネス・キャッシュの調整でトークンを約50%削減 |
Anthropicも同じ流れを追っています。2026年7月2日、Claude Enterpriseに支出しきい値アラート(75%・90%)とチームごとのモデルデフォルト設定機能を追加しました。管理者が「今月使用量が2倍に増えたチームはどこか」と尋ねればすぐに答えが返ってくる分析チャット機能も搭載されています。
今すぐ見直せる5つのこと
- まず使用量を可視化する
すでに用意されている管理者ダッシュボードから開いてみましょう。Claude Enterprise Analytics、Cursor Businessのレポートといった機能が標準で提供されています。 - タスクの難易度でモデルを使い分ける
簡単な作業は低価格モデルをデフォルトにし、複雑なリファクタリングだけ高性能モデルにエスカレーションしましょう。とにかく安いモデルだけを使うと手戻りが増え、かえってトークン消費が増えてしまいます。 - アラートのしきい値をまず設定する
ハードカット(全面停止)ではなく、75%・90%の時点でアラートが来るようにし、その後に低価格モデルへ自動切り替え(ダウンシフト)する順序で設計しましょう。 - トークンの無駄を減らす
コンテキストをこまめに圧縮し、タスクを小さな単位に分割し、プロンプトキャッシュを有効にしましょう。Databricksはこの調整だけでトークンをほぼ半分に減らしました。 - コードベースを軽量に保つ
Hacker Newsの開発者たちは、コードベースが肥大化するほどエージェントが迷走し、トークンも余計に消費すると指摘しています。ミニマルなコードこそ、AIエージェントを1カ月以上まともに動かし続けるための前提条件だというわけです。
チーム規模が小さいなら
Uber・マイクロソフトのように数千人規模でないなら、専用のAIゲートウェイ基盤はオーバースペックかもしれません。すでに使っているツールの管理者コンソール(使用量ダッシュボード、アラート機能)から有効にするのが順番です。
もっと深く知りたい方へ
AIコーディングコスト管理の原文 Databricksがまとめた、エフィシエンシー・フロンティア/ルーティング/予算管理の4大戦略 databricks.com
マイクロソフトのロールアウト調査 数万人のエンジニアを4カ月間追跡し、PR24%増を検証した原論文 arxiv.org
Claude Enterpriseの支出管理機能 Anthropicが公開した、アラートしきい値・モデルデフォルトの設定方法 claude.com
企業のトークン予算 実例集 Meta・Uber・Stripeなど、実際の上限数値をまとめたニュースレター newsletter.semianalysis.com
韓国大手企業のAIトークン制限状況 AhnLab・LG電子・サムスン電子など韓国企業の対応まとめ insightkorea.co.kr
元Hacker Newsスレッド 開発者たちの生々しい反応と反論 news.ycombinator.com




