AI 코딩은 잘 쓰고 있는데, 월 중간에 예산이 바닥난다면

일부 조직에서는 AI 코딩 도구 도입 뒤 병합 PR 같은 산출 지표가 증가했습니다. 그런데 관리자 화면에는 사용자와 모델마다 다른 청구액이 쌓이고, 누가 어떤 업무에 얼마를 썼는지는 설명하기 어렵습니다. 이때 선택지가 ‘계속 허용’과 ‘전면 차단’뿐이라면 유용한 생산성 신호까지 함께 잃기 쉬워요.

먼저 사용량을 보이게 만들고, 실제 업무의 품질 기준을 통과하는 가장 저렴한 모델을 찾은 뒤, 경고·전환·예외 승인 순으로 마찰을 높이는 것이 더 실용적인 해법입니다. 우버는 AI 코딩 도구에 사용자별 한도와 대시보드를 도입했습니다. 별도로 업무별 기본 모델을 조정하고 일부 작업을 저가·오픈웨이트 모델로 옮기며 직원에게 지출 정보를 제공했고, 채택이 늘어나는 동안에도 전체 AI 지출을 대체로 안정적으로 유지했다고 밝혔습니다.

이 사례는 비용을 줄이기 위해 모든 개발자에게 가장 싼 모델을 강제하라는 뜻이 아닙니다. 어떤 생산성 수치를 믿어야 하는지, 어디부터 모델을 바꿔야 하는지 판단하는 순서가 핵심이에요.

마이크로소프트의 24%는 비용 대비 수익률이 아닙니다

마이크로소프트의 초기 2026년 연구에서는 Claude Code 또는 Copilot CLI를 도입한 엔지니어의 병합 PR 수가 사후 115일 동안 합성 대조군보다 엔지니어·일 기준 24.0% 많았습니다. 베이지안 95% 구간은 14.5~33.7%였습니다.

눈에 띄는 증가지만 해석에는 경계가 필요합니다. 무작위 실험이 아니고, Claude Code 단독 효과가 아니라 두 CLI 도구를 합친 도입 효과입니다. 병합된 PR이 많아졌다는 사실도 코드 품질, 고객 가치, 절감된 인건비를 곧바로 뜻하지는 않아요.

연구 관찰이 끝난 직후 마이크로소프트는 대부분의 엔지니어에게 Claude Code 라이선스를 중단하고 Copilot CLI로 전환한다는 내부 방침을 알렸습니다. 하지만 논문은 중단된 라이선스 수를 공개하지 않았고, 비용이 유일하거나 결정적인 이유였다고 밝히지도 않았습니다.

따라서 공개 근거로 말할 수 있는 범위는 여기까지입니다. 마이크로소프트가 도구 전환을 결정한 것은 확인되지만, ‘비용 때문에 5천 명 이상의 라이선스를 껐다’거나 ‘AI 코딩비가 이미 인건비를 추월했다’고 일반화할 자료는 확인되지 않았습니다.

우버는 상한만 건 것이 아니라 기본 경로도 바꿨습니다

우버는 2026년 4월 연간 전체 AI 예산 한도에 이미 도달한 것으로 보도됐습니다. Cursor와 Claude Code 같은 에이전트형 코딩 도구에는 직원 1명·도구 1개당 월 1,500달러 한도를 뒀고, 개인 사용량 대시보드와 한도 초과 승인 절차도 도입했습니다.

별도로 우버가 공식 자료에서 지출 안정의 배경으로 설명한 조치는 업무별 기본 모델 조정입니다. 일부 작업을 더 저렴한 모델과 오픈웨이트 모델로 옮기고 직원에게 지출 정보를 제공했습니다. 공식 2분기 자료에 따르면 최근 수개월간 토큰당 비용이 낮아졌고, 도구 채택이 증가하는 중에도 전체 AI 지출은 대체로 안정적으로 유지됐습니다.

다만 우버는 사용량 증가율, 절감액, 업무별 품질 변화를 공개하지 않았습니다. 사용자별 상한이 지출 안정에 얼마나 기여했는지도 확인되지 않습니다. ‘지출 안정’은 유용한 운영 신호이지만, 같은 품질을 유지했다는 통제 실험 결과로 읽어서는 안 됩니다.

관찰한 신호바로 단정하면 안 되는 결론다음에 확인할 값
병합 PR 24% 증가투자수익률도 24% 증가승인된 결과물당 비용, 결함, 재작업
연간 전체 AI 예산 조기 소진AI 코딩 도구가 경제적으로 실패사용량 증가, 업무별 원가, 대체된 시간
전체 AI 지출 안정품질 손실 없이 절감 성공모델별 통과율, 롤백, 작업 완료율

가장 싼 모델보다 ‘품질 기준을 통과한 가장 싼 모델’

Databricks가 제안하는 기준도 최저가 모델의 일괄 적용이 아닙니다. 공개 코딩 벤치마크가 실제 사내 업무를 제대로 대표하지 못할 수 있으므로, 반복되는 내부 업무로 평가 세트를 만들고 필요한 품질을 충족하는 모델 중 가격 효율이 높은 모델을 선택하라는 접근입니다.

Databricks 내부 결과에서 Smart Router는 작업당 평균 비용을 30% 넘게 줄이면서 비교 대상 중 가장 비싼 모델과 대체로 비슷한 품질을 냈습니다. 불필요한 추론 호출을 줄이고 컨텍스트 압축과 캐시 설정을 조정한 작업은 생성 토큰과 관련 비용을 약 50% 낮췄다고 합니다.

이 수치를 그대로 예산안에 넣으면 안 됩니다. 대상 업무, 기간, 표본, 품질 척도와 원비용이 공개되지 않은 내부 결과이기 때문입니다. 가져올 것은 절감률이 아니라 업무별 평가, 라우팅, 하네스 최적화를 따로 시험하는 구조예요.

오늘은 최근 4주 기록으로 모델 하나만 바꿔보세요

새로운 비용 관리 시스템을 구매하기 전에 관리자 대시보드, 청구 내역, PR·CI 기록을 한 시트에 모아보세요. Claude Enterprise를 사용한다면 관리자 콘솔에서 그룹·사용자·모델별 비용과 Claude Code 사용 지표를 확인할 수 있습니다. 조직 지출 한도의 75%와 90%에서 관리자 알림을 설정할 수도 있습니다.

  1. 비용을 같은 단위로 합칩니다.
    최근 4주 기록을 사용자·팀·도구·모델별로 묶고, 시트 구독료와 종량제 초과 비용을 함께 적으세요. 사용자 식별자가 도구마다 다르면 먼저 사번이나 팀 ID로 연결합니다.
  2. 비용 옆에 결과와 품질을 놓습니다.
    병합 PR이나 승인된 작업 수를 연결하고 CI 통과율, 재작업, 롤백을 나란히 적으세요. 많이 쓴 사람부터 차단하면 어려운 업무를 맡은 사람과 낭비한 사람을 구별할 수 없습니다.
  3. 반복 업무 3~5개를 고릅니다.
    단순 테스트 추가, 문서 수정, 작은 버그 수정처럼 입력과 성공 조건을 맞출 수 있는 업무를 고르세요. 현재 기본 모델과 저가 후보 모델에 같은 테스트와 품질 기준을 적용합니다.
  4. 통과한 업무만 기본 모델을 낮춥니다.
    저가 모델이 같은 품질 기준을 충족한 업무만 기본 경로를 바꾸고, 복잡한 리팩터링과 모호한 장애 분석에는 상위 모델로 올라가는 예외 경로를 남깁니다.
  5. 경고부터 단계적으로 마찰을 높입니다.
    현재 지출 공개, 예산 경고, 사용자 확인, 관리자 승인, 저가 모델 전환, 일시 중단 순으로 정책을 정하세요. Claude Enterprise의 75%·90% 알림은 경고 기능이며 자동으로 저가 모델로 바꾸는 기능과는 구별해야 합니다.
  6. 변경 뒤 작업당 비용을 다시 계산합니다.
    승인된 결과물당 비용이 줄었는지 확인하고, 결함과 재작업이 늘어 절감액을 상쇄했다면 기본 모델을 되돌리거나 적용 업무를 더 좁히세요.

첫 점검의 성공 기준

최소 한 가지 반복 업무에서 모델별 품질 통과율과 승인된 결과물당 비용을 비교할 수 있고, 기본 모델·경고 구간·예외 승인 책임자가 문서화되면 충분합니다. 전사 절감률을 계산하는 일은 그다음이에요.