微软通过自己的研究证实了这一点:使用Claude Code的工程师合并的PR数量多出24%。
可到了2026年6月30日,财年结束的那一天,微软却砍掉了5000多名工程师的许可证。
效果已经得到证实,为什么还要关掉呢?
但账单出了问题
微软引入Claude Code的过程很顺利。2025年12月,公司以数万人规模推广了这款工具,效果在整整4个月里都没有减弱。使用该工具的工程师,平均每天合并的PR数量比未使用的工程师多出24%。
问题在于,一开始采用的是按坐席收费的固定套餐。用量看不见,大家就放开了用;等到改成按量计费,真实成本才浮出水面。每位员工每月的费用一度涨到500到2000美元,最终在财年末的6月30日,微软清理了大批工程师的许可证。
差不多同一时期,优步仅用4个月就花光了2026年全年的AI编程预算。他们的应对很直接——给每位员工按模型设定了每月1500美元的上限。
看到这则消息,Hacker News上的开发者反应很冷静:没有人在请求结果出来之前就知道要花多少钱,这跟签一张空白支票没什么两样。
大家都开始踩刹车了
这不只是优步和微软的故事。不分行业,各家企业都在设置上限。
| 公司 | 政策 |
|---|---|
| AhnLab | GitHub Copilot每月3000积分限额 |
| LG电子 | 发放基础Token预算,超出需提前申请审批 |
| 三星电子 | 衡量Token投入产出比的"Token性价比"体系 |
| Netmarble、NHN | 按职级、团队设定差异化月使用上限 |
| 现代汽车 | 禁止重复付费,只允许使用获批的AI工具 |
| 优步 | 按模型设定每位员工每月1500美元上限 |
| 沃尔玛、亚马逊 | 优先采用低价模型 |
看到这些,大概就能理解这种氛围了。Gartner首席分析师警告说,AI Token使用费可能在两年内达到甚至超过软件工程师的月薪水平。已经出现了每月花费2万到3.2万美元的极端案例。
在Meta,有一名员工一个月用掉了2800亿个Token。整个公司30天内的用量则达到60万亿个Token。到了这个地步,"生产力"和"支出"已经是两个完全不同的问题了。
但也不能一味切换成便宜模型
这里有一个常见的误解:"那不就用最便宜的模型不就行了吗?"但实际上,那些真正管理好成本的公司,采用的方法并不是这样。
Databricks在一篇讨论这个问题的博客中提出,企业应该转向"效率前沿"而不是"智能前沿"——不是无条件使用最新、最强的模型,而是要按任务挑选性价比合适的模型。
这篇博客还提到了Stripe的案例:Stripe曾尝试升级到更高阶的模型(Opus 4.7),但判断其带来的价值配不上成本的增幅,最终否决了这次升级。
| 不加管理地使用 | 用路由+上限来管理 | |
|---|---|---|
| 发现成本的时间点 | 收到账单之后 | 实时仪表盘 |
| 模型选择 | 始终默认用最贵的 | 按任务难度自动路由 |
| 预算超支应对 | 不设限或直接全面中止 | 75%、90%预警后自动降级 |
| 实际结果 | 优步4个月耗尽全年预算 | 调整执行框架、缓存后Token减少约50% |
Anthropic也在跟进同样的思路。2026年7月2日,Claude Enterprise新增了支出阈值提醒(75%、90%)和按团队设置默认模型的功能。管理员甚至可以直接用分析聊天功能提问"这个月用量翻倍的是哪个团队",马上就能得到答案。
现在马上就能调整的5件事
- 先让用量可见
先打开已经内置的管理员仪表盘。Claude Enterprise Analytics、Cursor Business报表这类功能都是标配。 - 按任务难度区分模型
简单任务默认用低价模型,只有复杂的重构才升级到高性能模型。一味只用便宜模型,返工增多反而会消耗更多Token。 - 先设置预警阈值
不要用硬性中断(全面停用),而是设计成在75%、90%节点先提醒,然后再自动切换到低价模型(降级)的顺序。 - 减少Token浪费
经常压缩上下文,把任务拆分成更小的单位,并开启提示词缓存(prompt caching)。Databricks仅凭这些调整就把Token用量减少了近一半。 - 保持代码库轻量
Hacker News上的开发者指出,代码库越臃肿,智能体就越容易迷失方向,消耗的Token也越多。精简的代码是让AI智能体能持续稳定运行一个月以上的前提条件。
如果团队规模较小
如果不是像优步、微软那样数千人规模的团队,单独搭建AI网关基础设施可能有点过头了。更合理的顺序是,先打开现有工具自带的管理员控制台(用量仪表盘、预警功能)。
想深入了解
AI编程成本管理原文 Databricks整理的效率前沿、路由、预算管理四大策略 databricks.com
微软推广研究 追踪数万名工程师4个月、验证PR增加24%的原始论文 arxiv.org
Claude Enterprise支出管理功能 Anthropic公布的预警阈值、模型默认值设置方法 claude.com
企业Token预算真实案例集 整理了Meta、优步、Stripe等公司实际限额数字的通讯 newsletter.semianalysis.com
韩国大企业AI Token限额现状 整理了AhnLab、LG电子、三星电子等韩国企业的应对方式 insightkorea.co.kr
原始Hacker News讨论帖 开发者们最真实的反应和反驳 news.ycombinator.com




