AI & Tech

Grok 4.6 벤치마크 점수와 가격 구간 정리

그록 4.6은 SpaceXAI가 2026년 8월 12일 공개한 언어 모델로, 오래 돌아가는 에이전트 작업과 코딩에 초점을 맞춘 그록 4.5의 후속판입니다. 공식 발표와 외부 평가 기관의 측정치를 기준으로 벤치마크 위치, 200K 토큰을 넘으면 달라지는 요금 구간, 실무 도입 판단 순서를 정리했습니다.

Share
Grok 4.6 벤치마크 점수와 가격 구간 정리 대표 이미지

그록 4.6(Grok 4.6)은 SpaceXAI가 2026년 8월 12일 공개한 언어 모델로, 오래 돌아가는 에이전트 작업과 코딩, 지식 작업에 초점을 맞춘 그록 4.5의 후속판입니다. 회사 이름이 낯설게 보일 수 있는데, 스페이스X가 xAI를 인수한 뒤 2026년 7월 합병 법인의 이름을 SpaceXAI로 바꿨습니다. 모델을 만드는 조직과 API 주소는 그대로이고 간판만 달라졌습니다.

새 모델이 나올 때마다 성능이 올랐다는 발표가 따라붙는다는 것은 이제 익숙한 이야기입니다. 그런데 이번 발표에서 실무자가 실제로 확인해야 할 것은 두 가지로 좁혀집니다. 61점이라는 점수가 지금 라인업에서 어느 자리인지, 그리고 그록 4.5와 가격이 같다는 설명이 어느 조건까지 참인지입니다. 특히 요금은 구간이 나뉘어 있어서, 표시 단가만 보고 예산을 잡으면 긴 문서를 다루는 작업에서 계산이 어긋납니다.

공식 문서와 외부 평가 기관인 Artificial Analysis의 측정치를 근거로, 2026년 8월 13일 기준으로 정리하겠습니다.

Artificial Analysis 지능 지수 막대 그래프. Claude Opus 5가 63점으로 1위, Claude Fable 5가 62점, GPT-5.6 Sol과 Grok 4.6이 나란히 61점, Kimi K3가 60점으로 이어지고 이전 세대인 Grok 4.5는 56점에 있다

위 그래프는 Artificial Analysis가 그록 4.6 출시에 맞춰 공개한 지능 지수 비교입니다. 화살표는 그록 4.5의 56점에서 4.6의 61점으로 옮겨간 자리를 표시한 것입니다.

그록 4.6 발표에서 확인되는 사양

공식 모델 문서와 발표문에 적힌 사양입니다.

항목내용
API 모델 IDgrok-4.6
컨텍스트500,000 토큰
지식 컷오프2026년 2월 1일
입출력텍스트와 이미지 입력, 텍스트 출력
추론 강도 설정low, medium, high(기본값), xhigh
API 형식Responses API, Chat Completions
기본 요금100만 토큰당 입력 $2, 출력 $6
쓸 수 있는 곳xAI API, Grok Build, Cursor, OpenRouter, Vercel, Cloudflare

구조를 새로 짠 모델은 아닙니다. 발표문은 오래 돌아가는 에이전트와 시각 작업에서의 첫 결과물 품질, 그리고 모델이 스스로 자기 결과를 검증하는 능력을 개선 지점으로 들고 있습니다. 컨텍스트 길이도 그록 4.5와 같은 50만 토큰으로 유지됐습니다.

출시와 함께 Grok Build와 Cursor에서 첫 주 동안 포함 사용량을 2배로 제공한다는 안내도 함께 나왔습니다. 도입을 검토 중이라면 이 기간에 실제 작업을 돌려 보는 편이 비용 부담이 적습니다.

지능 지수 61점이 놓인 자리

Artificial Analysis의 지능 지수는 GDPval-AA v2, Terminal-Bench v2.1, GPQA Diamond를 포함한 9개 평가를 묶어 하나의 점수로 낸 지표입니다. 여러 평가를 합산한 값이라 모델의 대략적인 위치를 보는 데 쓰고, 특정 작업의 성능을 그대로 대변하지는 않습니다.

2026년 8월 기준 상위권은 이렇게 정리됩니다.

모델지능 지수입력 / 출력 (100만 토큰당)
Claude Opus 563$5 / $25
Claude Fable 562$10 / $50
GPT-5.6 Sol61$5 / $30
Grok 4.661$2 / $6
Grok 4.556$2 / $6

한 달여 만에 5점을 올려 상위권으로 돌아왔고, 같은 61점인 GPT-5.6 Sol과 비교하면 입력은 5분의 2, 출력은 5분의 1 수준의 단가입니다. 다만 1위는 아닙니다. Claude Opus 5가 63점, Fable 5가 62점으로 앞에 있으므로 "GPT-5.6 Sol과 같은 자리"까지가 정확한 서술이고, 전체 1위라는 표현은 성립하지 않습니다.

점수 사이의 간격도 그대로 받아들이기는 어렵습니다. 61점과 63점의 차이는 2점이지만 이 지수는 9개 평가의 가중 평균이라, 특정 작업에서는 순위가 뒤집힐 수 있습니다. 실제로 아래에서 볼 항목별 결과에서도 모델마다 잘하는 영역이 달라집니다.

항목별로 달라지는 강점

공식 발표문이 함께 공개한 항목별 결과입니다. 같은 조건에서 상위 모델과 나란히 잰 수치입니다.

평가 항목Grok 4.6GPT-5.6 Sol MaxFable 5 Max
GDPval-AA v2 (Elo)175317281741
CursorBench v3.269.9%67.2%70.5%
FrontierCode v1.161.3%60.6%63.6%
DeepSWE v1.165.9%73%70%

네 항목 가운데 셋에서 GPT-5.6 Sol을 앞서지만, 코드 수정 능력을 재는 DeepSWE에서는 두 모델에 모두 뒤집니다. 발표자가 직접 고른 항목들인데도 전 항목 우위가 아니라는 점은 그대로 읽는 편이 낫습니다. 저장소를 읽고 코드를 고치는 작업이 주 용도라면 이 항목의 격차를 먼저 확인할 일입니다.

AA-Briefcase Elo 막대 그래프. Claude Opus 5가 1715로 1위, Grok 4.6이 1577로 2위, Claude Fable 5가 1574, Kimi K3가 1541, GPT-5.6 Sol이 1502로 이어지고 이전 세대인 Grok 4.5는 1313에 있다

에이전트 형태의 지식 작업을 재는 AA-Briefcase에서는 위 그래프처럼 1577점으로 Claude Opus 5 다음 자리에 올랐습니다. 이 평가는 채점 기준 통과율과 분석 품질, 결과물의 표현까지 묶어 점수를 냅니다. 보고서를 만들거나 자료를 정리해 결과물로 내놓는 작업이라면 참고할 만한 지표입니다.

가격이 같다는 말이 성립하는 조건

이 글에서 가장 중요한 대목입니다. 요금이 그록 4.5와 같다는 설명은 사실이지만, 그 단가가 적용되는 구간이 정해져 있습니다.

공식 가격 안내 기준으로 200K 토큰을 넘는 요청에는 장문 구간 단가가 붙어 입력 $4, 출력 $12가 됩니다. 캐시된 입력도 $0.50에서 $1로 함께 오릅니다. 여기서 놓치기 쉬운 조건은 적용 범위입니다. 초과한 부분에만 2배가 붙는 것이 아니라 그 요청에 담긴 모든 토큰에 장문 구간 단가가 적용됩니다.

그록 4.6의 200K 초과 요금은 초과분이 아니라 요청 전체에 적용되므로, 20만 토큰을 조금만 넘겨도 앞의 20만 토큰까지 2배 단가로 계산됩니다.

구간을 하나 넘는 순간 이미 지나온 거리까지 비싼 요금으로 다시 매기는 유료도로처럼, 경계를 살짝 넘긴 요청이 가장 손해가 큽니다. 코드베이스 전체를 넣거나 긴 문서를 통째로 붙이는 작업이라면 처음부터 $4/$12를 기준으로 예산을 잡는 편이 안전합니다.

경계에 걸리는 요청이 잦다면 두 가지 방법이 있습니다. 넣는 자료를 추려 20만 토큰 아래로 유지하거나, 아예 장문 구간을 전제로 계산하고 대신 캐싱을 적극적으로 쓰는 방식입니다. 공식 문서도 반복되는 앞부분에 캐시 키를 지정할 것을 권하고 있습니다.

태스크당 비용으로 본 그록 4.6의 자리

Artificial Analysis 산점도. 가로축은 작업 하나당 비용(로그 눈금), 세로축은 지능 지수. Grok 4.6은 지수 61에 작업당 0.84달러 부근이고, GPT-5.6 Sol은 같은 61에 1.2달러대, Claude Opus 5는 63에 2.4달러대, Claude Fable 5는 62에 3달러대에 있다

위 산점도는 같은 평가를 끝내는 데 든 실제 비용을 가로축에, 지능 지수를 세로축에 놓은 것입니다. 표시 단가가 아니라 작업 하나를 끝낸 금액이라 모델 비교에는 이쪽이 더 정확합니다. 그록 4.6은 작업당 0.84달러 부근에 찍혀 있고, 같은 점수인 GPT-5.6 Sol이나 위쪽의 Claude 모델들보다 왼쪽에 있습니다.

단가만으로는 설명되지 않는 부분이 여기서 드러납니다. Artificial Analysis의 측정에서 그록 4.6은 장시간 작업을 평균 53턴, 입력 5억 토큰 규모로 끝냈고 Claude Opus 5는 같은 작업을 103턴, 20억 토큰으로 처리했습니다. 같은 목적지를 절반의 왕복으로 다녀오는 셈이라, 단가 차이에 사용량 차이가 겹쳐 총액이 벌어집니다.

다만 이 수치는 Artificial Analysis의 평가 과제 기준입니다. 우리 작업의 턴 수와 토큰 사용량은 프롬프트 구성과 도구 설정에 따라 달라지므로, 실제 판단은 자기 작업을 돌려 본 결과로 하는 것이 맞겠습니다.

도입을 판단하는 순서

  • 첫 주 2배 사용량 기간에 실제 작업을 돌립니다. Grok Build와 Cursor에서 제공되는 기간이라 비교 비용이 적게 듭니다. 평소 쓰던 작업 두세 개를 같은 조건으로 넣어 결과물과 걸린 시간을 봅니다.
  • 요청의 토큰 길이 분포부터 확인합니다. 200K 경계에 걸치는 요청이 많다면 장문 구간 단가가 실질 단가가 됩니다. 예산 계산의 출발점이 $2/$6인지 $4/$12인지가 여기서 정해집니다.
  • 용도에 맞는 항목을 골라 봅니다. 저장소를 고치는 코딩 작업이라면 DeepSWE 쪽 격차를, 자료 정리와 보고서 작성이라면 AA-Briefcase 쪽 순위를 기준으로 삼는 편이 지능 지수 총점보다 실용적입니다.
  • 바꾸기 전에 실패 비용이 작은 작업부터 옮깁니다. 결과를 눈으로 바로 확인할 수 있는 작업으로 시작하고, 배포나 고객 응대에 직접 연결된 작업은 나중으로 미룹니다.

그록 4.6이 지금 가장 똑똑한 모델인가요?

아닙니다. Artificial Analysis 지능 지수 기준으로 Claude Opus 5가 63점, Claude Fable 5가 62점으로 앞에 있고, 그록 4.6은 61점으로 GPT-5.6 Sol과 같은 자리입니다. 정확한 서술은 "상위권에 다시 올랐고, 같은 점수대에서 단가가 가장 낮다"입니다. 비용을 함께 놓고 보면 위치가 달라져서, 같은 평가를 끝내는 데 든 금액은 GPT-5.6 Sol보다 낮게 측정됐습니다. 점수만 보거나 가격만 보면 어느 쪽으로든 한쪽으로 기울게 됩니다.

그록 4.5를 쓰던 작업을 그대로 옮겨도 되나요?

모델 ID를 grok-4.6으로 바꾸면 되고 컨텍스트 길이와 기본 단가도 같아서, 요청 형식을 바꿔야 할 부분은 없습니다. 다만 옮긴 뒤에 두 가지를 확인하는 편이 좋습니다. 추론 강도가 high로 기본 설정되어 있어 이전보다 출력 토큰이 늘어날 수 있고, 출력 토큰은 입력의 3배 단가라 총액에 미치는 영향이 큽니다. 작업 성격에 따라 low나 medium으로 낮춰도 결과가 유지되는지 함께 재 보면 비용을 줄일 여지가 생깁니다.

3줄 요약:

  • 그록 4.6은 SpaceXAI가 2026년 8월 12일 공개한 모델로, Artificial Analysis 지능 지수 61점을 받아 GPT-5.6 Sol과 같은 자리에 올랐습니다. 앞에는 Claude Opus 5(63점)와 Fable 5(62점)가 있습니다.
  • 기본 요금은 그록 4.5와 같은 입력 $2, 출력 $6이지만 200K 토큰을 넘는 요청에는 $4/$12가 요청 전체에 적용됩니다. 긴 문서를 다루는 작업은 처음부터 이 단가로 예산을 잡아야 합니다.
  • 에이전트 지식 작업 평가에서 Claude Opus 5 다음 자리이고, 같은 작업을 더 적은 턴으로 끝내 태스크당 비용이 낮게 측정됐습니다. 코드 수정을 재는 DeepSWE에서는 경쟁 모델에 뒤지므로 용도별로 확인이 필요합니다.

Sources:

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

디지털마케터 뉴스레터

GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.

다음으로 읽어볼 글

클로드 소네트 5 API 가격 정리: 2달러 확정과 실제 비용 계산 썸네일
AI & Tech클로드 소네트 5 API 가격 정리: 2달러 확정과 실제 비용 계산

앤트로픽이 2026년 8월 10일 Claude Sonnet 5의 도입 요금(입력 100만 토큰당 2달러, 출력 10달러)을 표준 가격으로 확정했습니다. 9월 1일로 예정됐던 인상은 시행되지 않습니다. 요금 체계와 모델별 비교, 표시가와 실제 청구액이 다를 수 있는 토크나이저 변수까지 정리했습니다.

2026. 8. 12.
미니맥스 H3 정리: 스펙, 요금, 한국 제외 라이선스 쟁점 썸네일
AI & Tech미니맥스 H3 정리: 스펙, 요금, 한국 제외 라이선스 쟁점

미니맥스 H3는 텍스트, 이미지, 영상, 오디오를 한 컨텍스트로 읽어 최대 15초 영상을 스테레오 음향과 함께 생성하는 옴니모달 영상 생성 모델입니다. 스펙과 2단계 2K 구조, API 요금, 그리고 오픈 웨이트 라이선스가 한국을 제외 지역으로 명시한 쟁점까지 원문 기준으로 정리했습니다.

2026. 8. 12.
딥시크 V4 프로 정식 출시와 100만 토큰 컨텍스트 가격 정리 썸네일
AI & Tech딥시크 V4 프로 정식 출시와 100만 토큰 컨텍스트 가격 정리

딥시크 V4 프로는 딥시크가 2026년 8월 12일 프리뷰를 끝내고 정식 버전으로 전환한 플래그십 모델입니다. 1.6조 파라미터 구조와 100만 토큰 컨텍스트, 압축 어텐션이 비용을 낮추는 방식, 공식 벤치마크의 비교 대상, 그리고 예고된 가격 인상까지 공식 문서 기준으로 정리했습니다.

2026. 8. 13.
챗GPT 무료로 어디까지 되는지, 무제한 개방의 정확한 범위 썸네일
AI & Tech챗GPT 무료로 어디까지 되는지, 무제한 개방의 정확한 범위

오픈AI가 2026년 8월 6일 무료와 Go 요금제 이용자에게 GPT-5.6 루나를 기본 모델로 제공하고 일상 텍스트 대화를 무제한으로 열었습니다. 무제한의 정확한 범위, 루나 모델의 위치, 한국에서 진행 중인 시범 광고의 형태까지 정리했습니다.

2026. 8. 12.
퀴즈

그록 4.6의 API 요금을 실무 예산으로 잡을 때 반드시 함께 확인해야 할 조건은 무엇일까요?

같은 주제 글

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기