딥시크 V4 프로 정식 출시와 100만 토큰 컨텍스트 가격 정리
딥시크 V4 프로는 딥시크가 2026년 8월 12일 프리뷰를 끝내고 정식 버전으로 전환한 플래그십 모델입니다. 1.6조 파라미터 구조와 100만 토큰 컨텍스트, 압축 어텐션이 비용을 낮추는 방식, 공식 벤치마크의 비교 대상, 그리고 예고된 가격 인상까지 공식 문서 기준으로 정리했습니다.

딥시크 V4 프로(DeepSeek-V4-Pro)는 딥시크가 2026년 8월 12일 프리뷰를 끝내고 정식 버전으로 전환한 플래그십 모델입니다. 공식 가격표에 적힌 모델 버전은 DeepSeek-V4-Pro-0813이고, 100만 토큰 컨텍스트를 100만 토큰당 0.435달러라는 단가로 제공합니다.
딥시크가 낮은 가격으로 모델을 내놓는다는 것은 이제 새로운 소식이 아닙니다. 그런데 이번 발표에서 눈여겨볼 것은 가격표 자체가 아니라 그 가격이 나오는 구조입니다. 긴 문서를 넣을수록 비용이 가파르게 오르는 것이 그동안의 일반적인 조건이었는데, V4 프로는 그 증가 폭을 줄이는 방향으로 구조를 바꿨습니다. 그리고 같은 가격표 아래에 전반적인 인상 계획이 각주로 붙어 있어서, 지금 단가를 그대로 내년 예산에 넣으면 어긋날 수 있습니다.
공식 모델 카드와 API 문서를 근거로 2026년 8월 13일 기준으로 정리하겠습니다. 준이아빠블로그에서 딥시크 V4 플래시의 사양과 가격을 정리했을 때 프로 쪽은 공개된 벤치마크가 없어 판단을 미뤄 뒀는데, 이번 정식 전환으로 그 자료가 함께 나왔습니다.

위 그래프는 딥시크가 공식 모델 카드에 실은 자료입니다. 왼쪽이 항목별 성능이고, 오른쪽이 컨텍스트가 길어질 때의 연산량과 메모리 변화입니다.
정식 전환에서 확인되는 사양
공식 API 문서와 모델 카드에 적힌 내용입니다.
| 항목 | 내용 |
|---|---|
| 모델 이름 | deepseek-v4-pro |
| 모델 버전 | DeepSeek-V4-Pro-0813 |
| 파라미터 | 총 1.6조, 토큰당 활성 490억 |
| 컨텍스트 | 100만 토큰 |
| 최대 출력 | 384K 토큰 |
| 정밀도 | MoE 전문가는 FP4, 나머지 파라미터는 FP8 |
| 추론 모드 | 사고 모드와 비사고 모드 모두 지원, 사고 모드가 기본 |
| API 형식 | OpenAI 형식, Anthropic 형식, Responses API |
| 동시 요청 한도 | 500 |
| 라이선스 | MIT |
전체 1.6조 파라미터 가운데 한 토큰을 처리할 때 실제로 쓰이는 것은 490억뿐입니다. 전문가를 여럿 두고 그때그때 필요한 쪽만 부르는 혼합 전문가(MoE) 구조라, 모델의 크기와 한 번의 응답에 드는 계산량이 따로 움직입니다.
실무에서 바로 달라지는 항목은 API 형식입니다. 플래시만 Responses API를 지원하던 조건이 바뀌어 이제 프로도 지원 목록에 들어 있습니다. 코덱스 형태의 도구에 붙이려면 플래시를 골라야 했던 제약이 사라진 셈입니다.
100만 토큰을 낮은 단가로 파는 구조
KV 캐시라는 말은 컨텍스트 길이보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 모델이 앞서 읽은 내용을 다시 계산하지 않으려고 들고 있는 중간 결과의 저장분입니다. 긴 회의를 하는 동안 책상 위에 참고 서류가 계속 쌓이듯, 컨텍스트가 길어질수록 이 저장분도 함께 불어나고 그만큼 메모리와 연산이 더 듭니다.
V4 프로는 두 가지 어텐션 방식을 섞어 이 문제를 다룹니다. 공식 모델 카드는 압축 희소 어텐션(Compressed Sparse Attention)과 고압축 어텐션(Heavily Compressed Attention)을 결합해 장문 처리 효율을 개선했다고 설명합니다. 서류를 원본 그대로 쌓지 않고 요약본으로 줄여 서랍에 넣는 방식에 가깝습니다.
효과는 앞의 그래프 오른쪽에 수치로 나옵니다. 시퀀스 길이 100만 토큰 지점에서 이전 세대인 V3.2와 비교한 값입니다.
| 항목 | V4 프로 | V4 플래시 |
|---|---|---|
| 토큰당 연산량 (V3.2 대비) | 3.7배 감소 | 9.8배 감소 |
| 누적 KV 캐시 (V3.2 대비) | 9.5배 감소 | 13.7배 감소 |
메모리 사용이 10분의 1 수준으로 내려가면 같은 장비로 훨씬 많은 요청을 처리할 수 있고, 그 여유가 단가에 반영됩니다. 100만 토큰 컨텍스트를 낮은 가격에 내놓을 수 있는 근거가 여기에 있습니다. 다만 이 수치는 딥시크가 자사 모델의 이전 세대와 비교해 측정한 값이므로, 다른 회사 모델과의 효율 비교로 읽을 수는 없습니다.
구조에는 두 가지가 더 들어갔습니다. 계층 사이의 신호 전달을 안정시키는 mHC 방식과 학습 수렴을 앞당기는 Muon 최적화기입니다. 둘 다 학습 단계의 개선이라 쓰는 쪽에서 설정할 항목은 아닙니다.
공식 벤치마크와 비교 대상의 세대
앞 그래프 왼쪽의 항목별 결과입니다. 최고 추론 강도로 설정한 V4-Pro-Max 기준입니다.
| 평가 항목 | V4-Pro-Max | Opus 4.6 Max | GPT-5.4 xHigh | Gemini 3.1 Pro High |
|---|---|---|---|---|
| SimpleQA Verified | 57.9 | 46.2 | 45.3 | 75.6 |
| HLE | 37.7 | 40.0 | 39.8 | 44.4 |
| Apex Shortlist | 90.2 | 85.9 | 78.1 | 89.1 |
| Codeforces (레이팅) | 3206 | 3168 | 3052 | 해당 없음 |
| SWE Verified | 80.6 | 80.8 | 80.6 | 해당 없음 |
| Terminal Bench 2.0 | 67.9 | 65.4 | 75.1 | 68.5 |
| Toolathlon | 51.8 | 47.2 | 54.6 | 48.8 |
전 항목 우위는 아닙니다. 지식을 묻는 SimpleQA에서는 Gemini에, 어려운 문제를 모은 HLE에서는 세 모델 모두에 뒤집니다. 터미널 작업을 재는 Terminal Bench 2.0과 도구 사용을 재는 Toolathlon에서도 GPT-5.4가 앞섭니다. 코드 수정 능력을 보는 SWE Verified는 세 모델이 소수점 차이로 붙어 있어 사실상 같은 수준으로 읽는 편이 맞습니다.
여기서 함께 볼 조건이 비교 대상의 세대입니다. 표에 오른 상대는 Claude Opus 4.6, GPT-5.4, Gemini 3.1인데, 2026년 8월 기준으로 세 회사 모두 그다음 세대를 이미 내놓은 상태입니다.
딥시크 V4 프로의 공식 벤치마크는 한 세대 앞선 모델들과의 비교이므로, Claude Opus 5나 GPT-5.6과의 격차는 이 표로 알 수 없습니다.
외부 평가 기관인 Artificial Analysis의 지능 지수에도 V4 프로는 2026년 8월 13일 기준 아직 올라 있지 않습니다. 같은 지수에서 V4 플래시는 52점을 받았고, 상위권인 Claude Opus 5가 63점, Grok 4.6과 GPT-5.6 Sol이 61점입니다. 프로의 외부 측정치가 나오기 전까지는 자사 발표만으로 위치를 확정하기 어렵습니다.
가격표와 예고된 인상

위 화면은 딥시크 공식 API 문서의 가격표를 2026년 8월에 직접 캡처한 것입니다. 표에 적힌 두 모델의 조건은 다음과 같습니다.
| 항목 | V4 프로 | V4 플래시 |
|---|---|---|
| 입력 100만 토큰 (캐시 미스) | $0.435 | $0.14 |
| 입력 100만 토큰 (캐시 히트) | $0.003625 | $0.0028 |
| 출력 100만 토큰 | $0.87 | $0.28 |
| 동시 요청 한도 | 500 | 2,500 |
컨텍스트 길이와 최대 출력은 두 모델이 같고, 길이에 따른 할증 구간도 없습니다. 100만 토큰을 넣든 1만 토큰을 넣든 같은 단가입니다. 캐시 히트 가격이 캐시 미스의 120분의 1 수준이라, 같은 지시문을 앞에 붙여 반복 호출하는 자동화에서는 입력 비용이 크게 내려갑니다.
다만 이 가격표에는 각주가 하나 붙어 있습니다. 딥시크 API 서비스의 전반적인 가격을 가까운 시일 안에 인상할 계획이고 상당한 폭이 예상된다는 내용입니다. 인상 시점과 폭은 아직 공개되지 않았습니다.
딥시크는 공식 가격표 각주로 전반적인 가격 인상을 예고했으므로, 현재 단가는 장기 예산의 전제가 아니라 시점이 붙은 조건으로 다루는 편이 안전합니다.
플래시와 프로 사이의 선택 기준
두 모델의 차이가 이번 전환으로 좁혀졌습니다. 공개된 조건만으로 판단할 수 있는 항목을 정리하면 이렇습니다.
- 호출 횟수가 많은 자동화는 플래시가 여전히 유리합니다. 출력 가격이 3분의 1 수준이고 동시 요청 한도가 5배입니다. 분류나 요약처럼 같은 작업을 대량으로 돌리는 쪽이라면 단가 차이가 그대로 총액 차이가 됩니다.
- 어려운 추론과 코딩이 섞인 작업은 프로 쪽을 시험해 볼 근거가 생겼습니다. 이번에 공개된 벤치마크가 프로 기준이고, Codeforces 레이팅과 Apex Shortlist에서 비교 대상을 앞섰습니다.
- 컨텍스트 길이는 선택 기준이 되지 않습니다. 두 모델 모두 100만 토큰이고 할증 구간도 두지 않았습니다. 긴 문서를 넣으려고 프로를 고를 이유는 없습니다.
- API 형식은 이제 제약이 아닙니다. 프로도 Responses API와 Anthropic 형식을 지원하므로, 쓰던 도구에 맞추느라 모델을 정하던 조건이 사라졌습니다.
업무 데이터를 넣을 계획이라면 도입 전에 확인할 것이 하나 더 남습니다. 데이터 보관과 처리 조건은 가격이나 성능과 별개의 문제라, 약관을 직접 읽고 판단할 영역입니다. 고객 정보나 사내 문서가 들어가는 작업이라면 특히 그렇습니다.
최상위 모델을 대체할 수 있나요?
작업 종류에 따라 다르다고 보는 편이 정확합니다. 공식 벤치마크에서 V4 프로는 Claude Opus 4.6, GPT-5.4와 코드 수정 능력에서 거의 같은 점수를 냈고 알고리즘 문제에서는 앞섰습니다. 그런데 그 비교 대상이 현행 최신 세대가 아니고, 어려운 문제를 모은 HLE와 도구 사용 평가에서는 뒤집니다. 가격이 10분의 1 수준이라는 점을 감안하면 비용 대비 성능은 분명한 강점이지만, 최상위 모델을 그대로 대체한다고 말하기는 이릅니다. 실패 비용이 작은 작업부터 옮겨 결과를 비교하는 순서가 현실적입니다.
100만 토큰을 다 넣으면 비용이 얼마나 드나요?
입력 기준으로는 0.435달러입니다. 컨텍스트 길이에 따른 할증 구간이 없어서 100만 토큰을 채워 넣어도 단가가 그대로이기 때문입니다. 다만 실제 비용은 여기서 끝나지 않습니다. 긴 문서를 넣는 작업은 대개 여러 번 주고받게 되고, 매 요청마다 앞선 내용이 다시 입력으로 들어갑니다. 같은 앞부분이 반복된다면 캐시 히트 단가가 적용되므로, 요청을 설계할 때 고정된 지시문과 자료를 앞쪽에 모아 두는 방식이 비용에 직접 영향을 줍니다.
3줄 요약:
- 딥시크 V4 프로는 2026년 8월 12일 정식 전환된 플래그십 모델입니다. 총 1.6조 파라미터에 토큰당 490억이 활성화되는 MoE 구조이고, 100만 토큰 컨텍스트를 할증 없이 제공합니다.
- 압축 어텐션 두 가지를 결합해 100만 토큰 지점에서 이전 세대 대비 연산량을 3.7배, KV 캐시를 9.5배 줄였습니다. 낮은 단가가 나오는 근거가 이 구조입니다.
- 공식 벤치마크의 비교 대상이 Claude Opus 4.6과 GPT-5.4 같은 한 세대 앞선 모델이고, 공식 가격표에 인상 계획이 각주로 붙어 있습니다. 성능 위치와 가격 모두 시점을 붙여 읽어야 합니다.
Sources:
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
디지털마케터 뉴스레터
GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.
다음으로 읽어볼 글

OpenAI가 2026년 8월 10일 사이버보안 이니셔티브 Daybreak를 Blue와 Red 두 티어로 확장하고, 인가된 방어팀 전용 모델 GPT-5.6-Cyber를 공개했습니다. 두 티어의 차이와 접근 조건, 안전장치를 정리합니다.
2026. 8. 11.
RAG는 모델이 답하기 전에 학습 데이터 밖의 자료를 찾아 참고하게 만드는 방식이고, 파인튜닝은 예시를 학습시켜 모델이 답하는 방식을 바꾸는 작업입니다. 두 방식이 각각 무엇을 바꾸는지와 고르는 기준을 공식 문서 기준으로 정리합니다.
2026. 8. 8.
플라우드 노트와 젠스파크 세컨드브레인 노트, Omi는 대화를 녹음해 요약과 할 일로 바꿔 주는 AI 기록 기기입니다. 하드웨어 사양, 요금제, 각 제품이 노리는 지점을 2026년 8월 기준 공식 자료로 정리합니다.
2026. 8. 8.
프롬프트 캐시는 AI에 이미 보낸 앞부분의 계산 결과를 서버가 보관했다가 다음 요청에서 재사용하는 기능입니다. 캐시가 유지되는 조건과 깨지는 조건, 실제 비용 차이를 계산으로 정리했습니다.
2026. 8. 8.딥시크 V4 프로의 공식 벤치마크 표를 읽을 때 함께 확인해야 할 것은 무엇일까요?