Claude Code 에이전틱 API 과금 분리와 비용 통제 설계
Claude Agent SDK와 헤드리스 에이전트의 별도 과금 논의를 바탕으로 토큰 예산, 비용 모니터링, API 키 격리와 팀 차지백 설계를 정리한다.
2026-08-14 · 최초 발행 2026-08-02
구독 한도와 에이전트 실행을 분리하려던 배경
Anthropic은 2026년 5월 14일 구독형 Claude 플랜의 에이전틱 사용량을 별도 API 요금으로 청구하는 과금 개편안을 발표했다. Claude Agent SDK, 헤드리스 claude -p, Claude Code GitHub Actions, 서드파티 에이전트 앱을 별도의 Agent SDK Credit Pool로 옮기는 구상이었다. 이 방안은 6월 15일 시행을 앞두고 개발자 커뮤니티의 반발이 이어지며 잠정 보류됐다.
논의의 핵심은 대화형 사용과 자율 실행의 비용 곡선이 다르다는 데 있다. 구독 플랜은 사람이 직접 대화하는 사용을 전제로 하지만, 에이전틱 워크로드는 한 요청에서 수십 개의 서브 에이전트를 병렬로 돌리고 한 태스크에 수백만 토큰을 쓸 수 있다.
기존 구독 한도에 남기는 범주는 Claude.ai 채팅, 터미널 Claude Code, Claude Cowork다. 분리 대상은 Claude Agent SDK, claude -p 헤드리스 모드, GitHub Actions 통합, SDK 인증을 사용하는 서드파티 에이전트 앱이다. 후자의 예로 Zed, OpenClaw Conductor, Jean 등이 언급됐다.
원래 발표된 Agent SDK Credit Pool은 플랜별 월간 크레딧을 표준 API 토큰 요금으로 소진하는 구조였다. 크레딧은 개인별로 배정되고 팀 풀링은 없으며, 결제 주기에 맞춰 월간 갱신된다. 남은 크레딧은 이월되지 않고, 결제 수단을 등록한 경우에는 초과 사용량을 청구할 수 있다.
헤드리스 실행은 비용 예측을 별도로 해야 한다
에이전틱 Claude Code는 단일 프롬프트 세션보다 약 7배 빠르게 토큰을 소비한다고 설명된다. 예시로 단일 프롬프트 세션은 요청당 약 5K 토큰, 에이전틱 루프는 태스크당 약 35K 토큰, 서브 에이전트를 병렬화한 워크플로우는 약 250K 토큰으로 제시된다. Sonnet 4.6의 비용 산정 예시는 $3.75/1M 토큰이다.
한 금융 서비스 팀은 23개 서브 에이전트를 3일 동안 운용해 Claude 비용 $47,000을 기록한 사례로 언급됐다. 이런 종류의 실행은 대화형 사용량을 기준으로 한 월간 한도만으로는 예산을 설명하기 어렵다.
개발자당 월간 추정치는 평균 사용 시 하루 활성 비용 $13, 월 $150~$250이며, 자동화 파이프라인을 포함한 집중 에이전틱 사용은 월 $500~$1,000+로 제시된다. 90th 퍼센타일은 활성일 기준 하루 $30 이내다.
2026년 6월 기준으로 제시된 모델별 API 단가는 다음과 같다.
| 모델 | 입력 ($/1M) | 캐시 히트 | 출력 ($/1M) |
|---|---|---|---|
| Claude Haiku 4.5 | $1.00 | $0.10 | $5.00 |
| Claude Sonnet 4.6 | $3.00 | $0.30 | $15.00 |
| Claude Opus 4.8 | $5.00 | $0.50 | $25.00 |
| Claude Fable 5 | $10.00 | $1.00 | $50.00 |
배치 처리는 전 모델에서 50% 할인으로, 프롬프트 캐싱은 캐시 입력 비용을 90% 줄이는 방식으로 설명된다.
GitHub Actions에서는 토큰과 실행 시간을 함께 제한한다
GitHub는 2026년 4월부터 수백 개의 유지보수·CI 워크플로우를 포함한 자체 에이전틱 워크플로우의 토큰 효율을 최적화하기 시작했다.
여기서 제시된 방법은 인증 분리, 컨텍스트 관리, 출력 압축이다. API 프록시 아키텍처로 인증 토큰을 에이전트에 노출하지 않고, 컨텍스트는 12% 상한과 약 120K/1M 토큰으로 제한한다. Caveman 스킬을 적용한 출력 압축은 6587% 출력 감소로, 이 조합은 토큰을 4060% 절감하고 월 비용을 $300에서 $80으로 낮추는 사례와 함께 제시됐다.
컨텍스트 윈도우의 12%를 넘으면 컨텍스트 로트(rot) 구간에 들어가 품질 하락 대비 비용이 기하급수적으로 늘어난다고 본다. 장황한 응답을 막는 CLAUDE.md 규칙은 평균 65%의 출력 토큰 절감으로 연결된다. 시스템 프롬프트와 코드베이스 컨텍스트처럼 반복되는 문서는 프롬프트 캐시에 등록해 비용을 90% 줄이는 방식이다.
외부 에이전트에는 별도 API 키를 둔다
서드파티 에이전트가 Agent SDK를 통해 사용자 구독으로 인증하는 구조는 비용과 보안 경계를 흐릴 수 있다. 구독 기반 인증에서는 Pro·Team 풀의 사용자 크레딧이 예상 밖으로 소진될 위험이 있다.
별도 결제 계정의 API 키를 서드파티 앱마다 발급하면 비용을 앱 단위로 분리하고 감사 추적을 명확히 할 수 있다. 팀 차원에서는 서드파티에 API 키를 직접 발급하고 Usage & Cost API로 앱별 소비량을 추적하는 구성이 제시된다.
운영 원칙은 다음과 같다.
- 사용자 구독 인증 대신 서드파티 앱별 API 키를 발급한다.
- 키를 앱별로 나눠 비용 격리와 감사 추적을 확보한다.
- 키 로테이션 주기는 30~90일로 두고 만료 전 알림을 자동화한다.
- 소비량 임계값을 넘으면 rate limit과 연동해 키를 자동 비활성화한다.
사용량 대시보드와 Task Budget API
모니터링 도구로는 터미널 실시간 대시보드와 ML 번레이트 예측을 제공하는 ccusage, Cloudflare Workers 기반의 경량 메트릭 수집 도구 ccflare, 요청별 토큰 로깅을 위한 Claude Code Hooks가 제시된다. Torii AI Platform은 직원별·모델별 소비 분석과 청구 예측을, Finout FinOps는 AI 비용 할당과 팀 차지백을 제공하는 유료 도구로 언급된다.
Task Budget API는 에이전틱 루프가 사용할 토큰 예산을 사전에 설정하는 수단이다.
# Task Budget 설정 예시
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-4-6",
max_tokens=8096,
budget_tokens=50000, # 에이전틱 루프 전체 예산 설정
messages=[...]
)
# 모델이 예산 카운트다운을 인식하고 우선순위 기반 작업 완료
이 예시는 budget_tokens로 루프 전체 예산을 지정하고, 모델이 예산 카운트다운을 인식해 우선순위 기반으로 작업을 마치는 흐름을 보여준다.
런어웨이를 막는 실행 정책
비용 런어웨이를 막으려면 태스크 시작 시 budget_tokens를 설정하고, 실행 중 남은 예산을 계속 확인해야 한다. 제시된 정책은 80% 소진 시 결과 요약을 시작하고, 95% 소진 시 중간 결과를 반환하며 강제 종료하는 방식이다. 비용 임계값을 넘으면 Slack 또는 PagerDuty로 알리고, 담당자가 검토한 뒤 수동 재실행 여부를 결정한다.
체크 항목은 다음과 같다.
budget_tokens로 루프당 최대 토큰을 제한한다.- 오버플로우 청구를 비활성화한다.
- Usage & Cost API로 일별 지출 한도 알림을 설정한다.
- GitHub Actions에는
timeout-minutes와 토큰 예산을 함께 둔다. - 서브 에이전트 병렬 수는
max_workers상한으로 제한한다.
개인 실험, CI/CD, 프로덕션을 다른 비용 정책으로 다룬다
팀 플랜의 비용 배분 방식으로는 개인별 크레딧 풀, 프로젝트별 API 키, 부서별 차지백이 제시된다. 개인별 크레딧 풀은 사용자당 월 $20/$100/$200 크레딧과 개인 책임 원칙을 따른다. 프로젝트별 API 키는 프로젝트·팀별로 키를 나누고 Finout 같은 FinOps 도구에서 태그 기반으로 비용을 배분한다. 부서별 차지백은 월간 사용 보고서를 자동 생성해 비용 센터별로 청구한다.
개인 에이전틱 실험은 구독 크레딧 안에서 자율 사용하도록 두되, CI/CD 파이프라인은 별도 API 키와 엄격한 예산 상한을 적용하는 구성이 권장된다. 프로덕션 에이전트에는 월별 예산 승인 절차와 실시간 모니터링을 둔다.
| 플랜 | 월 구독료 | Agent SDK 크레딧 | 초과 요금 | 적합 사용 사례 |
|---|---|---|---|---|
| Pro | $20 | $20 | API 단가 | 개인 개발자, 소규모 자동화 |
| Max 5x | $100 | $100 | API 단가 | 파워 유저, 중규모 에이전트 |
| Max 20x | $200 | $200 | API 단가 | 헤비 유저, 복잡한 멀티 에이전트 |
| Team Standard | $30/seat | $20/seat | API 단가 | 소규모 팀 협업 |
| Team Premium | $100/seat | $100/seat | API 단가 | 중규모 팀 CI/CD 통합 |
| Enterprise | 협의 | 사용량 기반 | 협의 | 대규모 조직, 컴플라이언스 요구 |
Sonnet 4.6 기준 월간 시나리오도 제시된다. 월 5M 토큰의 경량 자동화는 약 $18.75로 Pro의 $20 크레딧 안에서 처리할 수 있다. 월 30M 토큰의 중급 CI/CD는 약 $112로 Max 5x의 $100에 소폭 초과가 더해진다. 월 100M 토큰의 집중 멀티 에이전트는 약 $375로 Max 20x의 $200과 초과 $175가 필요하다.
에이전트 과금 모델이 보여주는 차이
| 항목 | Anthropic Claude | OpenAI Codex | Google Antigravity |
|---|---|---|---|
| 에이전틱 과금 방식 | API 토큰 기반 크레딧 풀 | ChatGPT 플랜 내 크레딧 | 5시간 갱신 컴퓨트 할당량 |
| 투명성 | 높음 (토큰 단가 공개) | 높음 (크레딧→토큰 공개) | 낮음 (전환율 미공개) |
| 인터랙티브/에이전틱 분리 | O (분리 예정→보류) | O (Codex 별도 풀) | 부분적 |
| 헤드리스 모드 | claude -p |
codex -p |
Antigravity CLI |
| 최저 에이전틱 단가 | $1/1M 토큰 (Haiku) | $1.75/1M (gpt-5.3-codex) | 비공개 |
| 과금 예측 가능성 | 높음 | 높음 | 낮음 |
| 팀 풀링 | 미지원 (개인별) | 미지원 | 미지원 |
Anthropic과 OpenAI는 토큰 단가와 크레딧 환산 구조를 공개해 FinOps 통합에 유리한 모델로 평가된다. 반면 Google Antigravity는 컴퓨트 할당량과 비공개 전환율에 기반하므로 비용 계획과 FinOps 통합이 어렵다는 평가를 받는다.
AI 비용 관리를 운영 거버넌스로 연결하기
에이전틱 비용 관리는 ITSM, 비용 최적화, 거버넌스와 맞닿아 있다. 비용 관리에서는 Chargeback·Showback, 예산 계획, 예외 관리를 다루고, 서비스 수준 관리에서는 에이전트 비용 대비 처리량 SLA와 토큰 예산 초과 시 Graceful Degradation 정책을 다룬다.
과금 구조가 바뀔 때는 영향 평가와 테스트가 필요하다. Anthropic의 6월 15일 보류 사례는 변경 관리 관점에서 충분한 검토가 필요하다는 사례다. 리스크 관리의 대상은 비용 런어웨이와 그 재무적 영향이며, FinOps 원칙은 AI API 비용에도 적용된다. 태그 기반 비용 배분, 낭비 제거, 프롬프트 캐싱을 통한 리저브드 용량 활용이 여기에 포함된다.
운영 설계는 모든 에이전틱 호출에 비용 태그를 붙이고 실시간 대시보드를 만드는 것에서 시작한다. 이어 부서·프로젝트별 예산 상한을 자동 집행하고, 월간 사용 패턴 분석을 모델 선택과 캐싱 전략 개선으로 되돌리는 최적화 루프를 둔다.
구독과 에이전틱 사용량을 나누는 방향은 에이전트 경제의 성장과 함께 업계 전반으로 확산되고 있다. 에이전트 전용 과금, 런타임 예산 조절과 서브 에이전트별 예산 분할, 팀·조직 단위 비용 풀링, FinOps 플랫폼의 AI API 비용 통합, 보류된 Agent SDK 크레딧 분리 정책의 재설계 발표가 그 흐름으로 제시된다.
Sources
- Anthropic June 15 Claude subscription billing overhaul: Full interpretation of the 5 key points of the Agent SDK separate billing pool
- The June 15 Claude Billing Change Explained
- Anthropic Ends Subscription Subsidy for Agents June 15: Credit Pool Replaces Flat-Rate Access
- Claude Code Billing in 2026: Subscription Usage vs the Agent Credit Pool
- What Anthropic's New Claude Billing Means for Zed Users
- Claude Code Billing Change June 15, 2026
- Use the Claude Agent SDK with your Claude plan
- Claude Agent SDK Billing Splits June 15: What Teams Must Do
- Claude Credit Overhaul 2026: Anthropic Pauses the June 15 Change
- AI Coding Costs (2026): Claude vs Codex vs Gemini, Real Monthly Spend From Token Math
- What AI Agents Actually Cost: Anthropic's Billing Split
- Anthropic tosses agents into the API billing pool
- Improving token efficiency in GitHub Agentic Workflows
- Claude Code Token Optimization: Stop the $1,600 Bill (2026 Guide)
- Claude Code GitHub Actions - Claude Code Docs
- Claude Code Pricing (2026): $20 vs $100 vs $200 Plans + Exact API Costs
- Anthropic API Pricing in 2026: Complete Guide
- AI Coding Agents 2026: Pricing & Features Compared
- Google AntiGravity Pricing 2026: Free, Pro $20, Ultra $200
- Antigravity vs OpenAI Codex: Which AI Coding Agent to Choose in 2026
- Track cost and usage - Claude Code Docs
- Task budgets - Claude API Docs
- 6 Tools to Track Claude AI Token Usage in 2026