AI 토큰(Token)이란? 글을 읽는 조각이자 한도와 요금의 단위
토큰은 AI 언어 모델이 글을 읽고 쓸 때 쓰는 조각입니다. 영어는 대개 단어 하나, 한국어는 글자 몇 개가 한 토큰이 되며, AI가 한 번에 읽을 수 있는 양과 사용 한도, API 요금이 모두 토큰 수로 계산됩니다.
같은 말:토큰TokenAI 토큰토큰 수
목차
AI 서비스의 요금표나 안내에는 "100만 토큰", "20만 토큰" 같은 말이 자주 나옵니다. 글자 수도 단어 수도 아닌 토큰이 기준이 되는 이유는 AI가 글을 토큰 단위로 처리하기 때문입니다. 토큰을 알아 두면 긴 자료가 왜 잘리는지, 사용 한도가 왜 빨리 차는지도 이해할 수 있습니다.
정의: AI가 글을 읽고 쓰는 조각
토큰(Token)은 AI 언어 모델이 글을 처리하는 단위입니다. 모델은 문장을 그대로 읽지 않고, 토크나이저라는 프로그램으로 먼저 잘게 나눈 다음 그 조각을 읽습니다. 답을 쓸 때도 토큰을 하나씩 골라 이어 붙입니다. 이 과정은 AI는 어떻게 답을 만들까요에서 설명했습니다.
조각의 크기는 언어마다 다릅니다.
- 영어: 자주 쓰는 단어는 대개 단어 하나가 한 토큰입니다. 앤트로픽과 구글은 영어 기준으로 1토큰을 약 4글자로 안내합니다.
- 한국어: 글자 몇 개가 한 토큰이 됩니다. 같은 뜻을 전해도 영어보다 토큰을 더 쓰는 경우가 많습니다.
한국어는 영어보다 토큰을 얼마나 더 쓸까요?
오픈AI, 앤트로픽, 구글 모두 한국어 토큰 수를 공식 수치로 안내하지 않습니다. 그래서 같은 뜻의 업무 요청 네 쌍을 OpenAI가 공개한 토크나이저로 직접 세어 봤습니다. 2026년 10월 9일 tiktoken 0.13.0으로 계산한 값입니다.
| 문장(한국어 / 영어) | o200k_base 한 / 영 | cl100k_base 한 / 영 |
|---|---|---|
| 다음 주 회의 일정을 정리해 주세요. / Please organize next week's meeting schedule. | 12 / 7 | 14 / 8 |
| 이 보고서를 세 줄로 요약해 주세요. / Please summarize this report in three lines. | 11 / 8 | 17 / 8 |
| 올해 사업 성과와 내년 예산 계획을 비교해서 표로 만들어 주세요. / Please compare this year's results with next year's budget plan and make a table. | 19 / 15 | 33 / 17 |
| 고객에게 보낼 감사 편지 초안을 정중한 말투로 써 주세요. / Please write a draft thank-you letter to customers in a polite tone. | 20 / 14 | 35 / 14 |
| 합계 | 62 / 44 (약 1.4배) | 99 / 47 (약 2.1배) |
o200k_base는 OpenAI가 GPT-4o 이후 모델에 쓴 토크나이저이고, cl100k_base는 그 이전 세대(GPT-4)의 토크나이저입니다. 최신 GPT-6 계열이 같은 토크나이저를 쓰는지는 확인하지 못했습니다. 최신 토크나이저에서는 차이가 줄었지만 여전히 한국어가 더 많은 토큰을 씁니다. 위 표는 네 쌍의 예문에서 나온 값이고 문장 길이를 정확히 맞춘 것도 아니므로, 모든 한국어 글이 1.4배라는 뜻으로 읽지 않습니다. 클로드와 제미나이는 토크나이저가 달라 수치가 다를 수 있습니다.
100만 토큰은 어느 정도 분량일까요?
앤트로픽 공식 문서는 최신 클로드 모델 기준으로 100만 토큰을 영어 약 55만 5천 단어로 안내합니다(2026년 10월 6일 확인). 영어판 『해리 포터』 일곱 권을 모두 합치면 약 108만 단어이므로, 100만 토큰에는 일곱 권 가운데 약 3권 반이 들어갑니다.
한국어는 같은 내용에 토큰을 더 쓰므로 100만 토큰에 들어가는 분량이 영어보다 줄어듭니다. 다만 모델마다 토크나이저가 달라 한국어 책 몇 권이라고 정확히 환산하기는 어렵습니다. 구글은 제미나이 도움말에서 100만 토큰을 "최대 1,500쪽 분량의 텍스트"로 설명합니다.
한도와 요금이 모두 토큰으로 정해집니다
토큰이 중요한 이유는 AI 서비스의 여러 숫자가 토큰을 단위로 쓰기 때문입니다.
| 숫자 | 토큰과의 관계 | 이어서 읽을 클래스 |
|---|---|---|
| 한 번에 읽을 수 있는 양 | 지침, 첨부 자료, 대화, 답을 합친 토큰 수의 한도 | 컨텍스트 윈도우 |
| 사용 한도 | 구독 요금제에서 일정 시간 동안 쓸 수 있는 양이 토큰 사용량으로 차오름 | 사용 한도와 새 대화 |
| API 요금 | 입력 토큰 수와 출력 토큰 수에 각각 단가를 곱해 계산 | AI 요금제와 API 요금 |
그래서 긴 PDF를 통째로 넣거나, 길고 자세한 답을 반복해서 받거나, 깊게 생각하는 모드를 켜면 토큰을 그만큼 많이 씁니다. 꼭 필요한 자료만 골라 넣는 습관이 한도와 비용을 함께 아끼는 방법입니다.
직접 확인해 보기
OpenAI는 웹에서 문장을 붙여 넣으면 토큰 수를 보여 주는 토크나이저 페이지를 공개해 두었습니다. 검색창에 "OpenAI tokenizer"를 입력하면 찾을 수 있습니다. 계정 없이 해 볼 수 있는 연습입니다.
- "다음 주 회의 일정을 정리해 주세요."를 붙여 넣고 토큰 수를 확인합니다.
- 같은 뜻의 영어 문장 "Please organize next week's meeting schedule."을 넣고 비교합니다.
- 자주 쓰는 업무 요청 한 문장을 한국어와 영어로 넣어 비율을 직접 계산해 봅니다.
페이지에서 고를 수 있는 토크나이저가 바뀌었거나 숫자가 위 표와 다르다면, 선택한 모델 이름을 함께 적어 둡니다. 토크나이저가 다르면 같은 문장도 토큰 수가 달라지는 것이 정상입니다.
관련 개념
- 컨텍스트 윈도우: AI가 한 번에 함께 처리하는 토큰의 한도입니다.
- AI 요금제와 API 요금: 토큰 수로 계산하는 요금 구조입니다.
- 사용 한도와 새 대화: 토큰 사용량이 구독 한도로 쌓이는 방식입니다.

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
같은 뜻의 요청을 한국어와 영어로 각각 보냈습니다. 토큰 수를 바르게 설명한 것은 무엇일까요?
예제나 확인 질문을 직접 시도한 뒤 완료 표시해요. 더 연습할 내용이 남으면 표시하지 않고 다음 글을 읽어도 됩니다. 완료 버튼은 이해도를 채점하지 않으며 잘못 표시하면 취소할 수 있어요.

