Grok 4.7 출시: 가격과 벤치마크, 같은 지표에 다른 숫자가 나온 이유
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
Grok 4.7은 SpaceXAI가 2026년 9월 21일 공개한 모델이고 값은 입력 100만 토큰당 2달러, 출력 6달러입니다. 그런데 같은 Terminal-Bench 4.0 지표에 회사 발표는 38.0%, 독립 평가 기관 측정은 26%로 서로 다른 숫자가 나왔습니다. 두 숫자가 달라진 까닭과 값을 앞세운 구성을 공식 발표 기준으로 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
Grok 4.7은 SpaceXAI가 2026년 9월 21일 공개한 언어 모델이고, 값은 프롬프트 20만 토큰 미만 기준으로 입력 100만 토큰에 2달러, 출력에 6달러입니다. 회사는 코딩과 지식 작업에서 자사 최고 모델이라고 소개하면서 견줄 만한 모델의 절반 값에 두 배 빠르다고 내세웠습니다.
새 모델 발표에 벤치마크 표가 따라붙는 것은 이제 익숙한 광경입니다. 점수 몇 개를 보고 기존 모델을 바꿀지 정하는 흐름도 굳어졌습니다.
그런데 이번에는 같은 벤치마크 이름에 서로 다른 숫자가 돌아다닙니다. Terminal-Bench 4.0에서 회사 발표는 38.0%, 독립 평가 기관 측정은 26%입니다. 어느 쪽을 보고 도구와 예산을 정할지 헷갈리는 상황이라, 공식 발표문과 독립 평가 자료를 나란히 놓고 2026년 9월 22일 시점에서 정리했습니다.
Grok 4.7에서 달라진 세 가지
회사가 밝힌 변경점은 세 가지입니다.
- 기반 모델: Grok 4.6보다 크고 새로운 기반 모델을 썼습니다
- 학습 방식: 더 어려운 작업 묶음으로 강화학습을 길게 돌렸고, 몇 시간씩 걸리는 작업에 가중치를 두었습니다
- 작업 방식: 자기 결과를 검증하고 긴 맥락을 관리하는 쪽이 나아졌다고 적었습니다
값은 Grok 4.6과 같습니다. 출력 속도를 두 배로 올린 변형도 있는데 값도 두 배입니다.
값에는 계층이 하나 더 있습니다. 프롬프트가 20만 토큰을 넘으면 입력 4달러, 출력 12달러로 오르고 그 요청의 모든 토큰에 높은 값이 적용됩니다. 캐시된 입력은 0.5달러, 20만 토큰을 넘으면 1달러입니다.
쓸 수 있는 곳은 Grok API와 Grok Build, Cursor, 서드파티 코딩 도구, 모델 라우터와 클라우드 플랫폼입니다.
여기서 하나 구분해 둘 것이 있습니다. 파라미터 2.1조라는 숫자가 일부 블로그에 실렸는데 공식 발표문에도 API 문서에도 파라미터 수는 나오지 않습니다. 회사가 적은 것은 "더 크고 새로운 기반 모델"까지입니다. 컨텍스트는 발표문에 없지만 공식 API 문서에 50만 토큰으로 적혀 있습니다.
회사가 낸 벤치마크 표
공식 발표문에 실린 비교표입니다. Grok 4.7은 xHigh 설정, 다른 모델은 각각 High와 Max 설정 기준입니다.
숫자로 옮기면 이렇습니다.
| 항목 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| 입력 100만 토큰 | $2 | $2 | $4 | $10 |
| 출력 100만 토큰 | $6 | $6 | $20 | $50 |
| 코딩 (CursorBench 4.0) | 46.3% | 40.4% | 41.7% | 51.8% |
| 코딩 (DeepSWE v1.1) | 71.0% | 65.2% | 72.7% | 70.0% |
| 전기공학 (EEBench) | 64.0% | 53.0% | 39.4% | 56.4% |
| 장시간 사무 (AA Briefcase v1.1) | 1,657 | 1,546 | 1,487 | 1,678 |
| 장시간 터미널 (Terminal-Bench 4.0) | 38.0% | 20.3% | 37.3% | 57.9% |
| 법률 (Harvey Legal Agent) | 19.6% | 15.8% | 2.5% | 6.7% |
| 임상 추론 (HealthBench Professional) | 56.7% | 48.5% | 60.5% | 62.1% |
직전 모델인 Grok 4.6과 견주면 모든 항목이 올랐습니다. 특히 Terminal-Bench 4.0은 20.3%에서 38.0%로 거의 두 배가 됐고, 전기공학과 법률 항목은 표에 오른 네 모델 가운데 가장 높습니다. 반면 CursorBench와 임상 추론, 장시간 사무와 장시간 터미널은 Fable 5.1이 앞서고 DeepSWE는 GPT-5.6 Sol이 1위입니다.
같은 벤치마크에 다른 숫자가 나온 이유
한 독립 평가 기관이 낸 Terminal-Bench 4.0 수치는 26%입니다. 회사 발표의 38.0%와 12퍼센트포인트 차이가 납니다.
설정 차이로 설명되지는 않습니다. 회사 표에는 모델 이름 옆에 xHigh라는 표시가 붙어 있는데, 추론에 힘을 더 쓰는 설정입니다. 그런데 독립 평가 기관도 자기 모델 페이지 제목에 xhigh를 적어 두어 같은 설정으로 쟀다고 밝히고 있습니다. 같은 설정에서 12퍼센트포인트가 벌어진 것이라, 남는 원인은 문제를 돌리는 평가 환경과 채점 방식의 차이입니다.
자동차 공인 연비가 같은 차라도 측정 절차에 따라 다르게 나오듯, 벤치마크도 누가 어떤 환경에서 돌렸는지에 따라 값이 달라집니다.
비교 대상도 다릅니다.
| 구분 | 회사 발표 | 독립 평가 |
|---|---|---|
| 겨룬 오픈AI 모델 | GPT-5.6 Sol Max | GPT-6 Astra |
| Terminal-Bench 4.0 Grok 4.7 점수 | 38.0% | 26% |
| 같은 지표 오픈AI 모델 점수 | 37.3% | 59.6% |
| 결과 | Grok 4.7이 앞섬 | Grok 4.7이 크게 뒤짐 |
GPT-5.6 Sol은 한 세대 이전 모델이고 GPT-6 Astra가 현행 최신입니다. 어느 쪽을 표에 올리느냐로 승패가 바뀝니다.
벤치마크 열 개를 묶은 Artificial Analysis Intelligence Index(v4.3.2)에서 Grok 4.7은 46점이고, Claude Fable 5.1과 GPT-6이 각각 53점입니다. 종합 지표로 보면 중위권입니다.
같은 평가에서 함께 나온 숫자가 하나 더 있습니다. 과제 하나를 푸는 데 든 비용이 Grok 4.7 xHigh 기준 3.74달러로, 토큰 단가가 두 배인 GPT-5.6 Sol Max의 1.99달러보다 높았습니다. 토큰 단가가 싸도 답을 내기까지 토큰을 많이 쓰면 실제 청구액은 뒤집힐 수 있습니다.
두 숫자 가운데 하나가 거짓이라는 뜻은 아닙니다. 회사는 자기 환경에서 재고, 독립 기관은 여러 모델에 같은 평가 절차와 채점 기준을 적용합니다. 업무에 넣을 모델을 고를 때는 뒤쪽이 실제 체감에 가깝다고 볼 수 있습니다.
CursorBench를 만든 Cursor가 SpaceXAI 자회사라는 점
공식 발표문이 가장 먼저 보여 주는 것은 CursorBench 4.0 기준 가격 대비 성능 차트입니다. 값이 쌀수록 오른쪽에 놓이는데 Grok 4.7 곡선이 오른쪽 위를 지납니다.
이 차트에도 GPT-6 Astra는 올라와 있지 않습니다. 앞에서 본 비교 대상 문제가 차트에서도 그대로 이어집니다.
여기서 짚어 둘 이해관계가 있습니다. CursorBench를 만든 Cursor는 SpaceX가 600억 달러에 인수해 2026년 8월 절차를 마친 자회사이고 SpaceXAI 산하로 들어갔습니다. 2026년 2월 SpaceX가 xAI를 인수했고 7월에 SpaceXAI로 이름을 바꾸는 사이에 벌어진 일입니다.
자사가 소유한 평가표에서 자사 모델이 좋게 나왔다는 사실이 점수를 틀리게 만들지는 않습니다. 다만 여러 평가표 가운데 무엇을 앞세울지 정할 때 이해관계가 없다고 보기는 어렵습니다. 코딩 도구를 고를 때는 CursorBench 하나보다 독립 지표를 함께 보는 편이 안전합니다.
Grok 4.7의 안전 관련 발표
회사는 새 안전 장치를 처음부터 다시 만들어 넣었고 거부와 탈옥 저항에서 자사 모델 가운데 가장 강하다고 밝혔습니다. 숫자로 공개한 것은 둘입니다.
- 생물안전: LatchBio 평가에서 62.4%로 가장 높았다고 적었습니다
- 사이버 보안: HackerBench v0.3에서 위험한 이중용도 요청 가운데 3.3%만 통과시켰다고 밝혔습니다
두 수치 모두 회사 자체 발표이고 외부 검증 결과는 함께 공개되지 않았습니다. 사이버 보안 연구용으로 일부 협력사에 레드팀 기능을 초대 방식으로 열었다는 내용도 있습니다.
Grok 4.7이 쓸 만한 작업
값과 지표를 함께 놓으면 쓰임이 달라집니다.
| 작업 성격 | 판단 |
|---|---|
| 정확도가 결과를 좌우하는 코딩 에이전트 | 종합 지표와 Terminal-Bench 차이가 그대로 드러납니다 |
| 호출이 많고 난이도가 고른 분류나 요약 | 입력 2달러와 출력 6달러의 값 차이가 비용으로 돌아옵니다 |
| 전기공학이나 법률 문서 작업 | 회사 표에서 강세를 보인 항목이라 시험해 볼 만합니다 |
발표문의 "Grok 4.6보다 나아졌다"는 자사 이전 모델과 견준 말이고, 다른 회사 최신 모델과 견준 말이 아닙니다. 두 문장을 섞어 읽지 않는 편이 낫습니다.
자주 묻는 질문
Grok 4.7의 컨텍스트 길이는 얼마인가요?
50만 토큰입니다. 발표문에는 없지만 공식 API 문서에 적혀 있습니다. 다만 프롬프트가 20만 토큰을 넘으면 그 요청의 모든 토큰이 두 배 값으로 청구되므로 긴 맥락을 쓸 때는 비용을 함께 봐야 합니다.
xAI가 아니라 SpaceXAI라고 적는 이유는 무엇인가요?
2026년 2월 SpaceX가 xAI를 인수했고 7월에 AI 부문 이름을 SpaceXAI로 바꿨습니다. 발표 페이지 제목과 저작권 표기도 SpaceXAI로 되어 있습니다.
출력 속도가 두 배인 변형은 언제 쓰나요?
회사는 같은 모델의 빠른 변형을 값 두 배에 제공한다고 밝혔습니다. 응답을 기다리는 시간이 사용자 경험을 좌우하는 곳이라면 검토할 만하고, 일괄 처리에는 이점이 크지 않습니다.
회사 발표 점수와 독립 측정 가운데 무엇을 믿어야 하나요?
둘 다 봅니다. 회사 표는 그 모델이 가장 잘하는 조건을 보여 주고, 독립 평가는 같은 조건에서 여러 모델을 줄 세웁니다. 실제 업무에 넣을 때는 자기 작업으로 직접 재 보는 편이 확실합니다.
정리
| 항목 | 내용 |
|---|---|
| 공개일 | 2026년 9월 21일 |
| 만든 곳 | SpaceXAI (2026년 2월 SpaceX가 xAI 인수, 7월 이름 변경) |
| 값 | 20만 토큰 미만 입력 2달러와 출력 6달러, 넘으면 4달러와 12달러 |
| 회사 발표 강세 | 전기공학 64.0%, 법률 19.6%로 비교한 네 모델 가운데 1위 |
| 회사 발표 약세 | CursorBench 46.3%, 임상 추론 56.7%, 장시간 터미널 38.0%로 Fable 5.1에 뒤짐 |
| 독립 종합 지표 | Artificial Analysis 46점, Fable 5.1과 GPT-6은 53점 |
| 공개되지 않은 것 | 파라미터 수 |
| 이해관계 | CursorBench를 만든 Cursor는 SpaceXAI 자회사 |
경쟁 모델의 절반 값으로 같은 구간에서 겨루겠다는 구성으로 보입니다. 다만 토큰 단가가 절반이라는 사실과 과제를 푸는 데 드는 비용이 절반이라는 사실은 다르고, 독립 평가에서는 뒤쪽이 오히려 비쌌습니다. 종합 지표가 중위권이라는 점까지 함께 놓고 작업 성격에 맞춰 판단할 일입니다.
3줄 요약:
- Grok 4.7은 SpaceXAI가 2026년 9월 21일 공개한 모델이고 값은 입력 100만 토큰당 2달러, 출력 6달러입니다.
- Terminal-Bench 4.0에서 회사 발표는 38.0%인데 독립 평가 기관 측정은 26%로 설정과 비교 대상에 따라 숫자가 달라졌습니다.
- 회사가 앞세운 CursorBench는 SpaceXAI가 2026년 8월 인수한 Cursor의 평가표라 자사 소유 지표입니다.
Sources
- Introducing Grok 4.7 (SpaceXAI 공식 발표)
- xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6 (The Decoder)
- Grok 4.7 모델 문서 (SpaceXAI 공식 API 문서)
- Grok 4.7 (Artificial Analysis)
- Musk's xAI, SpaceX combo is the biggest merger of all time, valued at $1.25 trillion (CNBC)
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
모델 발표문의 벤치마크 점수를 업무 판단에 쓸 때 가장 먼저 확인할 것은 무엇일까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
클로드 Opus 5.5 출시설 확인: 가격과 컨텍스트 창, 코드네임 정리 (2026년 9월 21일 기준)
클로드 Opus 5.5(오푸스 5.5)는 2026년 9월 21일 기준으로 앤트로픽이 공개한 적 없는 모델 이름입니다. 화요일에 출시되고 가격이 20% 내려간다고 적은 정리글이 퍼졌는데, 비교 기준으로 삼은 Opus 5.1부터 출시된 적이 없습니다. 가격과 캐시 배율, 컨텍스트 창 숫자를 공식 모델 문서와 가격 문서에 하나씩 맞춰 보고, 모델 출시설을 직접 확인하는 순서를 정리했습니다.
같이 보면 좋은 글

GPT-6 아스트라는 OpenAI가 2026년 9월 3일 공개한 모델입니다. 컴퓨터를 사람처럼 직접 조작하는 작업을 겨냥했습니다. 구독 중인데도 모델 목록에 아스트라가 없는 경우가 많은데, 대부분은 계정 문제가 아니라 요금제마다 쓸 수 있는 화면이 다르기 때문입니다. 요금제별 제공 범위, 확인 순서, 회사 계정의 관리자 설정, API 요금 계산을 공식 문서로 확인해 정리했습니다.
2026. 9. 14.
프롬프트 캐시는 AI에 이미 보낸 앞부분의 계산 결과를 서버가 보관했다가 다음 요청에서 재사용하는 기능입니다. 캐시가 유지되는 조건과 깨지는 조건, 실제 비용 차이를 계산으로 정리했습니다.
2026. 8. 8.
실행형 AI는 앱과 파일을 직접 열어 여러 단계를 처리하고 문서나 슬라이드 같은 결과물까지 내놓는 AI입니다. 2026년 9월 16일 클로드 코워크 통합 소식을 전한 국내 언론이 오픈AI 코덱스, 구글 제미나이, 그록과 묶어 경쟁 구도로 부르면서 쓴 표현입니다. 네 회사 제품이 어디서 실행되고, 앱에 어떻게 로그인하고, 사용량이 어디서 빠지는지를 공식 자료와 실제 계정 화면으로 비교했습니다.
2026. 9. 21.
Qwen-Image-2.1은 알리바바 Qwen 팀이 2026년 9월 20일 공개한 이미지 생성 편집 통합 모델입니다. 시각 생성부가 7B인데 알리바바 자체 벤치마크에서 나노바나나 2.0을 0.46점 앞섰고, 프롬프트만으로 투명 이미지를 만듭니다. 다만 직전 모델까지 Apache 2.0이던 라이선스가 비상업 연구용으로 바뀌어 오픈소스라고 부르기는 어렵습니다.
2026. 9. 21.ADVERTISEMENT