如果AI编程费用已经涨到每月15万美元,比起先问“哪个模型用得最多”,还有一个更该问的问题。那就是:这些钱让我们交付了路线图中承诺的什么内容?
先区分一下数字的来源。每月15万美元是Product Hunt用户向Navigara提问时提到的Claude账单规模,并不是公开资料验证过的Navigara客户案例。另一方面,Navigara公开的产品功能是将Git记录、Jira·Linear和AI支出关联起来,展示按路线图事项划分的成本以及未关联的工作。 本文并不把15万美元作为确证案例,而是将其作为说明如何把大额账单转化为管理会计数据的起点。
只看按模型分类的账单,会错过真正昂贵的原因
按模型分类的成本是采购记录,而不是成果记录。一张写着“Opus花了6万美元、Sonnet花了5万美元”的表,无法告诉你是结账流程改造昂贵、故障应对昂贵,还是钱流向了已经取消的实验。
供应商API提供的数据通常也止步于这条边界。Anthropic的Usage & Cost API可以按模型、工作区、API密钥等拆分用量,并按天查询成本。OpenAI的组织API同样可以查询用量和成本,并按项目ID等维度归集。 这些数据有助于核对账单,却不能告诉你该项目推动了哪项产品目标。
| 观察单位 | 可以回答的问题 | 无法回答的问题 |
|---|---|---|
| 模型·令牌 | 哪个模型产生了成本? | 发布了什么? |
| 用户·席位 | 谁使用了工具? | 这种使用是否属于必要工作? |
| PR·提交 | 关联了哪项代码变更? | 它为客户或路线图带来了什么价值? |
| 路线图事项 | 每个目标花了多少钱? | 这个目标本身是否正确? |
因此,成本单位不应是模型,而应是倡议、史诗或功能等成本对象。Navigara也说明,它会将AI支出关联到倡议、项目、议题、PR和提交,并将其分类为功能、维护、修复等。 核心思路并不是购买某个特定产品,而是在供应商账单数据和实际发布记录之间建立可追溯的连接。
答案是一张“美元→会话→PR→议题→目标”关联表
路线图成本无法一步算出。你需要依次关联:成本事件发生在哪个工作会话中,该会话产生的变更又属于哪个议题和目标。
自动关联的起点是工作命名规范。运行智能体时带上议题键,将分支命名为ENG-2917-checkout这类形式,并在PR正文中保留同一键,就可以连接三个系统。如果直接运营API调用,可按团队分开工作区或项目,从而建立第一道成本边界。但如果一个会话涉及多个议题,或混入共享席位成本,就不要硬性分摊到每一分钱;应将其保留为共同成本。
GitHub Copilot也可以导出组织、企业、仓库和用户范围的使用指标及PR生命周期数据。不过,GitHub说明组织级数据按成员资格归属,因此可能看似重复;而且不应直接比较不同的Copilot API资源。 因此,在开始细分分摊前,应该先将供应商仪表盘数字和自有总账与每月账单总额进行核对。
不要自动判定“未关联路线图 = 浪费”。
紧急故障应对、安全补丁、重构和探索性实验可能合理,但未必在路线图中。Navigara创始人也曾在Product Hunt上回答,未关联工作不一定是坏事,但应能够解释其必要性。 未关联成本不应作为已确认的浪费,而应作为需要分类的待办队列处理。
在实务中,将成本分为四组会更便于判断。第一组是已发布的路线图工作;第二组是获批的维护和风险降低;第三组是公共基础设施和席位等共享成本;第四组是没有关联证据的未分类成本。只让负责人审查最后一组,再将其拆分为取消的实验、重复工作和遗漏的工单。
成本表除金额外,还应附上置信度和质量
如果只按路线图做一个美元总额,就会得到另一个虚荣指标。PR数或提交数增加,并不意味着价值会按相同比例增加。Navigara提出将用LLM和规则评估提交所得的自有单位ETV作为分母,但这是一项由该公司定义的专有指标。其公开研究报告也明确指出,分析仅限于公开仓库中的已合并提交,无法观察代码审查、辅导和事故应对等活动,也不估算AI采用与结果之间的因果比例。
因此,无论是ETV还是自定义评分,都不要把单一数字当成真相。DORA同样建议,在评估AI工具时,将建议接受率、模型质量、信任度和审查时间等补充指标与既有交付指标结合使用。 路线图成本表至少应同时具备以下三个维度。
例如,相比“结账流程改造的AI成本为2万美元”,“直接关联1.4万美元、分摊共同成本4000美元、估算2000美元;比计划提前两周发布;发布后有3项返工”是一份更有用的报告。即使要决定削减成本,也可以先查看未分类比例高且返工也多的工作类型,而不是先砍掉最昂贵的模型。
本周制作路线图成本表的步骤
1. 将供应商账单汇入一个总账
Anthropic请以组织级的/v1/organizations/cost_report和用量报告为准,OpenAI请以/v1/organization/costs和Usage API为准。对于API、Claude Enterprise、固定席位等计费方式不同的项目,请设置单独列,并先确认月末合计是否与实际账单一致。
2. 强制将议题键作为所有工作的共同标识
在Jira或Linear中整理倡议→史诗→议题层级,并在智能体提示词、分支、提交和PR中至少两个位置保留议题键。还应创建用于紧急工作的INC、用于维护的MAINT、用于实验的EXP类型,避免路线图之外的合理工作落入未分类项。
3. 区分自动分摊和估算分摊
通过会话ID或专用工作区直接关联的成本标记为“确认”,仅因时间段、用户或仓库匹配而推断的成本标记为“估算”,席位和公共基础设施标记为“共同成本”。当一个会话跨越多个议题时,按变更文件、运行时间等预先商定的标准分摊,并将分摊规则记录在总账中。
4. 在月度评审中只问三个问题
请检查:“哪个目标的单位成本变了?”、“未分类成本为何产生?”、“在节省成本的同时,返工、故障和审查时间是否也减少了?”第一个月应专注于提高直接关联率,而不是计算精确ROI,也不要将个人排名用于绩效考核。
这样建立后,每月15万美元就会从令人恐惧的总额变成可用于决策的组合。比起使用了昂贵模型这一事实,你会开始看清哪些路线图事项值得继续投入,哪些工作流程应先修复关联和质量。
如果想继续深入
Navigara: Connect Your AI Spend Directly to Your Roadmap — 可查看产品说明、创始人的衡量方法,以及有关安全和未关联工作的回答。 producthunt.com
Token Spend Intelligence · Navigara — 展示Navigara如何将模型路由、成本与工作单位之比、路线图关联产品化。 navigara.com
Usage and Cost API - Claude Platform Docs — 可查看查询Anthropic组织用量和成本的范围及端点。 platform.claude.com
Usage | OpenAI API Reference — 按项目等维度查询OpenAI组织用量和成本数据的官方API文档。 developers.openai.com
Choosing measurement frameworks to fit your organizational goals — 说明为何应将AI使用指标与交付成果、质量和开发者体验一同解读。 dora.dev


