如果AI编程费用已经涨到每月15万美元,比起先问“哪个模型用得最多”,还有一个更该问的问题。那就是:这些钱让我们交付了路线图中承诺的什么内容?

3秒摘要
收集各供应商账单 关联会话、PR和议题 按路线图事项汇总成本 结合质量和发布结果判断

先区分一下数字的来源。每月15万美元是Product Hunt用户向Navigara提问时提到的Claude账单规模,并不是公开资料验证过的Navigara客户案例。另一方面,Navigara公开的产品功能是将Git记录、Jira·Linear和AI支出关联起来,展示按路线图事项划分的成本以及未关联的工作。 本文并不把15万美元作为确证案例,而是将其作为说明如何把大额账单转化为管理会计数据的起点。

只看按模型分类的账单,会错过真正昂贵的原因

按模型分类的成本是采购记录,而不是成果记录。一张写着“Opus花了6万美元、Sonnet花了5万美元”的表,无法告诉你是结账流程改造昂贵、故障应对昂贵,还是钱流向了已经取消的实验。

供应商API提供的数据通常也止步于这条边界。Anthropic的Usage & Cost API可以按模型、工作区、API密钥等拆分用量,并按天查询成本。OpenAI的组织API同样可以查询用量和成本,并按项目ID等维度归集。 这些数据有助于核对账单,却不能告诉你该项目推动了哪项产品目标。

观察单位可以回答的问题无法回答的问题
模型·令牌哪个模型产生了成本?发布了什么?
用户·席位谁使用了工具?这种使用是否属于必要工作?
PR·提交关联了哪项代码变更?它为客户或路线图带来了什么价值?
路线图事项每个目标花了多少钱?这个目标本身是否正确?

因此,成本单位不应是模型,而应是倡议、史诗或功能等成本对象。Navigara也说明,它会将AI支出关联到倡议、项目、议题、PR和提交,并将其分类为功能、维护、修复等。 核心思路并不是购买某个特定产品,而是在供应商账单数据和实际发布记录之间建立可追溯的连接。

答案是一张“美元→会话→PR→议题→目标”关联表

路线图成本无法一步算出。你需要依次关联:成本事件发生在哪个工作会话中,该会话产生的变更又属于哪个议题和目标。

建议的总账结构:成本发生时间·供应商·模型·金额·工作区 → 智能体会话ID → 仓库·分支·PR → 议题键 → 史诗·倡议 → 部署状态和质量结果

自动关联的起点是工作命名规范。运行智能体时带上议题键,将分支命名为ENG-2917-checkout这类形式,并在PR正文中保留同一键,就可以连接三个系统。如果直接运营API调用,可按团队分开工作区或项目,从而建立第一道成本边界。但如果一个会话涉及多个议题,或混入共享席位成本,就不要硬性分摊到每一分钱;应将其保留为共同成本。

GitHub Copilot也可以导出组织、企业、仓库和用户范围的使用指标及PR生命周期数据。不过,GitHub说明组织级数据按成员资格归属,因此可能看似重复;而且不应直接比较不同的Copilot API资源。 因此,在开始细分分摊前,应该先将供应商仪表盘数字和自有总账与每月账单总额进行核对。

不要自动判定“未关联路线图 = 浪费”。

紧急故障应对、安全补丁、重构和探索性实验可能合理,但未必在路线图中。Navigara创始人也曾在Product Hunt上回答,未关联工作不一定是坏事,但应能够解释其必要性。 未关联成本不应作为已确认的浪费,而应作为需要分类的待办队列处理。

在实务中,将成本分为四组会更便于判断。第一组是已发布的路线图工作;第二组是获批的维护和风险降低;第三组是公共基础设施和席位等共享成本;第四组是没有关联证据的未分类成本。只让负责人审查最后一组,再将其拆分为取消的实验、重复工作和遗漏的工单。

成本表除金额外,还应附上置信度和质量

如果只按路线图做一个美元总额,就会得到另一个虚荣指标。PR数或提交数增加,并不意味着价值会按相同比例增加。Navigara提出将用LLM和规则评估提交所得的自有单位ETV作为分母,但这是一项由该公司定义的专有指标。其公开研究报告也明确指出,分析仅限于公开仓库中的已合并提交,无法观察代码审查、辅导和事故应对等活动,也不估算AI采用与结果之间的因果比例。

因此,无论是ETV还是自定义评分,都不要把单一数字当成真相。DORA同样建议,在评估AI工具时,将建议接受率、模型质量、信任度和审查时间等补充指标与既有交付指标结合使用。 路线图成本表至少应同时具备以下三个维度。

成本
按倡议统计的直接成本和共同成本
结果
是否发布·相对计划的时间
质量
返工·故障·审查负担
置信度
自动关联·估算·未分类的比例

例如,相比“结账流程改造的AI成本为2万美元”,“直接关联1.4万美元、分摊共同成本4000美元、估算2000美元;比计划提前两周发布;发布后有3项返工”是一份更有用的报告。即使要决定削减成本,也可以先查看未分类比例高且返工也多的工作类型,而不是先砍掉最昂贵的模型。

本周制作路线图成本表的步骤

1. 将供应商账单汇入一个总账

Anthropic请以组织级的/v1/organizations/cost_report和用量报告为准,OpenAI请以/v1/organization/costs和Usage API为准。对于API、Claude Enterprise、固定席位等计费方式不同的项目,请设置单独列,并先确认月末合计是否与实际账单一致。

2. 强制将议题键作为所有工作的共同标识

在Jira或Linear中整理倡议→史诗→议题层级,并在智能体提示词、分支、提交和PR中至少两个位置保留议题键。还应创建用于紧急工作的INC、用于维护的MAINT、用于实验的EXP类型,避免路线图之外的合理工作落入未分类项。

3. 区分自动分摊和估算分摊

通过会话ID或专用工作区直接关联的成本标记为“确认”,仅因时间段、用户或仓库匹配而推断的成本标记为“估算”,席位和公共基础设施标记为“共同成本”。当一个会话跨越多个议题时,按变更文件、运行时间等预先商定的标准分摊,并将分摊规则记录在总账中。

4. 在月度评审中只问三个问题

请检查:“哪个目标的单位成本变了?”、“未分类成本为何产生?”、“在节省成本的同时,返工、故障和审查时间是否也减少了?”第一个月应专注于提高直接关联率,而不是计算精确ROI,也不要将个人排名用于绩效考核。

这样建立后,每月15万美元就会从令人恐惧的总额变成可用于决策的组合。比起使用了昂贵模型这一事实,你会开始看清哪些路线图事项值得继续投入,哪些工作流程应先修复关联和质量。

如果想继续深入

Navigara: Connect Your AI Spend Directly to Your Roadmap — 可查看产品说明、创始人的衡量方法,以及有关安全和未关联工作的回答。 producthunt.com

Token Spend Intelligence · Navigara — 展示Navigara如何将模型路由、成本与工作单位之比、路线图关联产品化。 navigara.com

Usage and Cost API - Claude Platform Docs — 可查看查询Anthropic组织用量和成本的范围及端点。 platform.claude.com

Usage | OpenAI API Reference — 按项目等维度查询OpenAI组织用量和成本数据的官方API文档。 developers.openai.com

Choosing measurement frameworks to fit your organizational goals — 说明为何应将AI使用指标与交付成果、质量和开发者体验一同解读。 dora.dev