코딩 에이전트 비용과 토큰 예산: 모델 선택, 캐시, 컨텍스트, 세션 수
코딩 에이전트의 토큰 예산은 정해진 사용량이나 비용 안에서 작업을 끝내도록 모델 선택과 캐시 유지, 컨텍스트 정리, 동시에 돌리는 세션 수를 미리 정해 두는 운영 방식입니다. 같은 작업도 이 네 가지에 따라 쓰는 양이 몇 배씩 달라집니다.
같은 말:클로드 코드 비용 절감토큰 예산코딩 에이전트 비용사용량 한도 관리토큰 절약
목차
🤔 같은 작업인데 이번 주에는 한도가 사흘 만에 바닥날 때
코딩 에이전트를 본격적으로 쓰기 시작하면 사용량이 일정하지 않다는 것을 알게 됩니다. 지난주에는 주간 한도의 절반으로 끝낸 분량을 이번 주에는 사흘 만에 다 썼는데, 한 일은 크게 다르지 않습니다. 세션을 여러 개 띄웠는지, 중간에 모델을 바꿨는지, 대화를 얼마나 길게 끌었는지가 달랐을 뿐입니다.
API 요금으로 쓰든 구독 한도로 쓰든 구조는 같습니다. 요청 한 번에 들어가는 토큰이 비용이고, 그 양을 정하는 것은 몇 가지 선택입니다. 캐시의 원리는 프롬프트 캐시에서, 구독과 종량제의 차이는 BYOK와 비용 구조에서 다뤘습니다. 이 편에서는 그 원리를 바탕으로 여러 에이전트를 운영할 때 예산을 짜고 지키는 방법을 정리합니다. 요금과 설정은 2026년 9월 28일 각 공식 문서 기준입니다.
🔑 토큰 예산의 정의
코딩 에이전트의 토큰 예산은 정해진 사용량이나 비용 안에서 작업을 끝내도록 모델 선택과 캐시 유지, 컨텍스트 정리, 동시에 돌리는 세션 수를 미리 정해 두는 운영 방식입니다.
집의 전기 요금을 떠올리면 네 가지가 어떤 역할인지 보입니다. 어떤 가전을 켜는지가 모델 선택이고, 한 번 데운 물을 다시 데우지 않는 것이 캐시이며, 쓰지 않는 방의 불을 끄는 것이 컨텍스트 정리이고, 동시에 켜 둔 가전의 수가 세션 수입니다.
🧠 첫째: 모델을 일에 맞게 고릅니다
모델마다 단가가 크게 다릅니다. 앤트로픽 요금 문서 기준 100만 토큰당 가격은 다음과 같습니다.
| 모델 | 입력 | 출력 |
|---|---|---|
| 클로드 오퍼스 5.5 | 4달러 | 20달러 |
| 클로드 소네트 5 | 2달러 | 10달러 |
| 클로드 하이쿠 4.5 | 1달러 | 5달러 |
클로드 코드 비용 문서는 소네트가 대부분의 코딩 작업을 잘 처리하고 오퍼스보다 싸다고 설명하며, 오퍼스는 복잡한 구조 결정이나 여러 단계의 추론에 남겨 두라고 권합니다. 계획 단계에서만 오퍼스를 쓰고 실행 단계에서는 소네트로 바꾸는 opusplan이라는 모델 설정도 쓸 수 있습니다.
같은 모델 안에서도 조절할 값이 있습니다. 모델이 생각하는 양을 정하는 effort 설정은 오퍼스 5.5에서 기본값이 medium이고, 문서는 low부터 max까지 단계를 둡니다. 설계 판단이 필요한 작업만 올리고 반복 작업은 기본값이나 그 아래로 두면 같은 모델로도 쓰는 양이 줄어듭니다.
멀티 에이전트 구성에서는 역할마다 모델을 다르게 두는 방식이 흔합니다. 앤트로픽 리서치 시스템도 메인은 오퍼스 4, 작업자는 소네트 4로 나눴습니다. 쪼개고 합치는 판단은 상위 모델에, 정해진 범위의 구현과 조사는 싼 모델에 맡깁니다.
♻️ 둘째: 캐시를 깨지 않습니다
에이전트는 한 바퀴를 돌 때마다 대화 전체를 다시 보내므로 캐시가 살아 있는지에 따라 비용이 크게 달라집니다. 여러 에이전트를 운영할 때 특히 알아 둘 조건은 캐시 유효 시간이 요청 종류마다 다르다는 점입니다.
| 요청 | 구독 사용 | 사용 크레딧, API 키 |
|---|---|---|
| 메인 대화 | 1시간 | 5분 |
| 서브에이전트 | 5분 | 5분 |
클로드 코드 프롬프트 캐시 문서 기준으로 구독에서도 서브에이전트는 5분 캐시를 씁니다. 서브에이전트를 띄워 놓고 결과를 한참 뒤에 이어서 쓰면 그 사이에 캐시가 사라집니다. 서브에이전트 작업은 짧게 끝나도록 명세를 좁히는 편이 캐시에도 유리합니다.
세션 도중에 도구 목록이나 지침 파일을 바꾸면 캐시가 통째로 깨집니다. 여러 세션을 돌리는 날에는 MCP 서버 추가나 CLAUDE.md 수정을 작업 시작 전에 몰아서 합니다.
🧹 셋째: 컨텍스트를 가볍게 유지합니다
한 번에 보내는 양 자체를 줄이는 방법입니다. 클로드 코드 비용 문서가 드는 방법을 운영 관점으로 묶으면 이렇습니다.
- 관계없는 일로 넘어갈 때 비웁니다:
/clear로 새로 시작합니다. 나중에 돌아올 대화라면 먼저/rename으로 이름을 붙여 두고/resume으로 다시 엽니다 - 이어 가야 하면 요약합니다:
/compact에 남길 내용을 함께 적어 요약 범위를 정합니다 - 요청을 구체적으로 씁니다: 문서는 "코드베이스를 개선해 줘"처럼 막연한 요청이 넓은 탐색을 부른다고 적었습니다. 작업 명세에 대상 파일을 적는 것이 곧 비용 절감입니다
- 늘 읽히는 것을 줄입니다: CLAUDE.md는 200줄 아래로 두고, 필요할 때만 읽히는 스킬로 절차를 옮기고, 쓰지 않는 MCP 서버는 끕니다
- 긴 출력은 서브에이전트에 맡깁니다: 로그나 검색 결과처럼 긴 출력을 서브에이전트의 컨텍스트에 두고 요약만 돌려받습니다
100만 토큰 컨텍스트를 지원하는 모델에서도 한계는 있습니다. 클로드 코드는 이런 모델에서 기본값으로 약 96만 7천 토큰에 이르면 대화를 요약합니다. 창이 크다고 오래 끌어도 된다는 뜻은 아니어서, 대화가 길수록 한 번의 요청이 무거워집니다.
🔢 넷째: 동시에 돌리는 세션 수를 정합니다
여러 에이전트를 동시에 돌리면 시간은 줄지만 사용량은 그만큼 늘어납니다.
| 구성 | 공식 문서에 적힌 사용량 |
|---|---|
| 서브에이전트 | 메인을 가볍게 하지만 서브에이전트 자신의 요청도 사용량에서 빠짐 |
| 에이전트 팀 | 팀원들이 계획 단계에 있을 때 일반 세션의 약 7배 |
| 앤트로픽 리서치 시스템의 멀티 에이전트 | 일반 채팅의 약 15배 |
구독으로 세션 세 개를 동시에 돌리면 같은 계정의 한도를 세 세션이 함께 씁니다. 오르카 같은 병렬 도구를 쓰다 한도에 일찍 도달했다는 사례가 알려져 있는 것도 이 때문입니다. 세션 수는 나눠서 줄어드는 시간이 늘어나는 사용량을 넘을 때만 늘립니다. 나누는 기준은 멀티 에이전트 작업 설계에서 다뤘습니다.
📏 사용량을 측정하는 방법
예산은 측정에서 시작합니다. 감으로 짠 예산은 대개 첫 주에 무너집니다.
/usage: 클로드 코드 세션 안에서 사용량과 어떤 항목이 많이 썼는지를 나눠 봅니다. 구독 사용자에게 보이는 달러 금액은 추정값이고 청구와 관계없습니다- 비대화형 실행의 비용 출력:
claude -p에--output-format json을 붙이면 결과에 추정 비용이 모델별로 담겨 나옵니다. 자동화 작업마다 비용을 기록할 때 씁니다 - 원격 측정:
CLAUDE_CODE_ENABLE_TELEMETRY=1로 오픈텔레메트리 수집을 켜면 세션 수와 토큰 사용량, 비용 추정치를 팀 단위로 모읍니다. 문서는 이 비용 수치도 근사값이며 공식 청구는 API 제공자 콘솔을 보라고 적었습니다
참고할 기준값도 있습니다. 클로드 코드 비용 문서는 기업 배포 환경에서 개발자 한 명이 실제로 쓴 날 하루 평균 약 13달러, 한 달에 150달러에서 250달러를 쓰고, 사용자의 90%는 하루 30달러 아래라고 밝혔습니다. 앤트로픽이 집계한 기업 평균이라 내 작업 방식과는 다를 수 있으므로, 내 계정의 한 주 기록과 나란히 놓고 봅니다.
🗓️ 주간 예산을 짜는 순서
- 한 주를 평소대로 쓰며 측정합니다: 요일별로 한도가 얼마나 줄었는지
/usage로 기록합니다 - 작업 종류별로 나눕니다: 설계 판단, 구현, 테스트와 로그 확인, 검수처럼 나누고 각각 어느 모델로 돌릴지 정합니다
- 계획은 한도의 3분의 2 정도로 잡습니다: 다시 만드는 작업과 예상 못 한 긴 세션이 늘 생깁니다. 남는 양은 주 후반의 여유분으로 둡니다
- 동시 세션 수의 상한을 정합니다: 평일 낮 몇 개, 밤 자동화 몇 개처럼 정해 두면 한도가 한 번에 무너지지 않습니다
구독 한도는 공지 없이 조정되거나 한시 프로모션으로 바뀌기도 합니다. 클로드 코드의 주간 한도 50% 상향 조치는 2026년 여름 종료일이 세 번 미뤄진 기록이 있어서, 프로모션 기간의 분량을 기준으로 예산을 짜면 종료 뒤에 크게 어긋납니다. 경과는 클로드 코드 주간 한도 상향과 코덱스 한도 경쟁에 정리되어 있습니다.
⚠️ 예산을 운영할 때 자주 하는 실수
- 모든 작업을 가장 비싼 모델로 돌립니다: 반복 작업까지 상위 모델로 돌리면 정작 설계 판단에 쓸 한도가 먼저 바닥납니다
- 서브에이전트는 공짜라고 봅니다: 메인 대화를 가볍게 할 뿐 서브에이전트의 요청도 사용량에서 빠집니다
- 작업 도중에 설정을 바꿉니다: 캐시가 깨져 다음 요청이 처음부터 다시 계산됩니다
- 프로모션 분량을 기준으로 계획합니다: 한시 조치가 끝나면 같은 계획이 주 중반에 막힙니다
❓ 자주 묻는 질문
구독과 API 키 가운데 무엇이 예산 관리에 유리한가요?
구독은 한 달 비용이 정해져 있어 예측하기 쉽고 메인 대화 캐시도 1시간으로 깁니다. API 키는 한도 없이 쓴 만큼 청구되어 자동화처럼 사용량이 들쭉날쭉한 작업에 맞습니다. 두 가지를 섞는다면 대화형 작업은 구독, 밤에 도는 자동화는 지출 한도를 건 API 키로 나누는 방식이 흔합니다.
한도에 걸렸을 때 모델을 바꾸면 이어서 쓸 수 있나요?
한도 메시지가 무엇을 가리키는지에 따라 다릅니다. 모든 모델이 함께 쓰는 세션 한도나 주간 한도에 걸렸다면 모델을 바꿔도 풀리지 않고, 특정 모델의 한도라면 다른 모델로 이어 갈 수 있습니다. 구분 방법은 클로드 코드 플랜과 사용량 한도에서 다뤘습니다.
코딩 에이전트별 요금제는 어디서 비교하나요?
클로드 코드와 코덱스, 제미나이 CLI, 코파일럿의 요금제와 한도는 코딩 에이전트 요금과 한도 비교에 확인일과 함께 정리되어 있습니다. 같은 20배라도 클로드는 세션 기준, 코덱스는 주간 기준이라 숫자만 보고 비교하지 않습니다.
📋 3줄 요약
-
코딩 에이전트의 토큰 예산은 모델 선택과 캐시 유지, 컨텍스트 정리, 동시에 돌리는 세션 수 네 가지를 미리 정해 정해진 사용량 안에서 작업을 끝내게 하는 운영 방식입니다.
-
클로드 코드 문서는 대부분의 코딩에는 소네트, 복잡한 설계에만 오퍼스를 권하고 에이전트 팀이 계획 단계에서 일반 세션의 약 7배를 쓴다고 밝혔으며 구독에서도 서브에이전트 캐시는 5분입니다.
-
예산은 /usage와 비대화형 실행의 비용 출력으로 실제 소진 속도를 먼저 측정한 뒤 주간 한도의 3분의 2 정도로 계획을 잡고 남는 양을 여유분으로 두는 편이 안전합니다.
📚 참고 자료
- 클로드 코드 문서, Manage costs: https://code.claude.com/docs/en/costs
- 클로드 코드 문서, Prompt caching: https://code.claude.com/docs/en/prompt-caching
- 클로드 코드 문서, Model configuration: https://code.claude.com/docs/en/model-config
- 클로드 코드 문서, Monitoring usage: https://code.claude.com/docs/en/monitoring-usage
- 클로드 코드 문서, Headless mode: https://code.claude.com/docs/en/headless
- 앤트로픽 개발자 문서, Pricing: https://platform.claude.com/docs/en/about-claude/pricing

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
클로드 코드 구독으로 긴 조사 작업을 서브에이전트 다섯 개에 나눠 돌렸더니 사용량이 예상보다 빨리 줄었습니다. 공식 문서 기준으로 맞는 설명은 무엇일까요?

