GPT-5.6 모델 정리: 정의와 성능, GPT-5.5와 달라진 점
홍승협(준이아빠) / 데이터 분석, AI 실무 교육
GPT-5.6은 OpenAI가 2026년 7월 9일 정식 출시한 AI 모델 세대입니다. 이름 규칙과 토큰 효율 중심의 설계, 공식 발표에 실린 벤치마크 수치, 새로 생긴 max와 ultra 설정을 GPT-5.5와 나란히 놓고 정리했습니다.

3줄 요약
이번 방문에서 한 편은 바로 볼 수 있습니다.
GPT-5.6은 OpenAI가 2026년 7월 9일 정식 출시한 AI 모델 세대의 이름입니다. 성능 등급이 다른 Sol과 Terra, Luna 세 모델이 이 세대 안에 함께 묶여 있고, 출시 발표가 가장 앞세운 기준은 성능 그 자체가 아니라 같은 답을 얼마나 적은 토큰으로 내는지였습니다.
이름이 셋으로 나뉘어 있다는 것은 이미 널리 알려져 있습니다. 검색창에 GPT-5.6을 쳐 보는 분들이 정작 궁금해하는 것은 그다음입니다. 5.6이라는 숫자와 Sol이라는 이름이 서로 어떤 관계인지, 그리고 GPT-5.5에서 실제로 무엇이 달라졌는지가 그렇습니다.
이 구분을 건너뛰면 모델 선택이 같이 틀어집니다. 등급 이름만 보고 최상위를 고르면 쓰지 않아도 될 비용이 붙고, 반대로 세대만 보고 옮기면 점수가 오히려 내려간 항목을 그대로 떠안게 됩니다. 이 글에는 2026년 9월 15일에 OpenAI 공식 발표 페이지에서 다시 확인한 수치만 담았고, 확인되지 않은 항목은 적지 않았습니다. 세 등급의 가격과 등급 간 비교는 GPT-5.6 Sol, Terra, Luna 차이와 가격 비교에서 따로 다룹니다.
GPT-5.6 이름 규칙: 세대 번호와 성능 등급
자동차 이름에 연식과 트림 등급이 나란히 붙듯, GPT-5.6이라는 이름에도 서로 다른 두 가지 정보가 들어 있습니다. OpenAI가 이번 세대부터 새로 적용한 표기 방식입니다.
- 숫자 5.6: 모델의 세대를 가리킵니다. 한 세대는 새로 학습을 마친 모델 묶음 하나를 뜻합니다.
- Sol, Terra, Luna: 성능 등급을 가리킵니다. 세대와 별개로 각자의 주기에 맞춰 발전한다고 설명되어 있습니다.
쉽게 말해 GPT-5.6은 개별 모델 하나의 이름이 아니라, 성능 등급이 다른 세 모델을 묶은 세대의 이름입니다. 그래서 GPT-5.6의 가격이나 점수를 하나의 숫자로 말하기 어렵고, 항상 어느 등급인지를 함께 적어야 합니다.
두 가지가 어떻게 나뉘는지 나란히 놓아 보겠습니다.
| 구분 | 숫자 5.6 | Sol, Terra, Luna |
|---|---|---|
| 가리키는 것 | 모델 세대 | 성능 등급 |
| 바뀌는 시점 | 새 세대가 나올 때 | 등급마다 따로 |
| 실무에서 보는 값 | 언제 학습을 마친 묶음인지 | 성능과 단가의 높낮이 |
| 예 | GPT-5.5에서 GPT-5.6으로 | 같은 세대 안의 Sol과 Luna |
등급이 세대와 별개로 이어진다는 점이 실무에서는 더 중요합니다. 다음 세대가 나와도 Sol이라는 등급 이름은 그대로 남을 가능성이 크므로, 지금 등급별로 작업을 나눠 두면 세대가 바뀔 때 숫자만 바꿔 끼우면 됩니다.
GPT-5.6에서 달라진 것: 토큰당 성능
토큰(token)은 모델이 글을 잘게 나눠 세는 조각 단위입니다. API 사용료는 이 조각이 몇 개인지로 매겨지고, 응답이 길어질수록 그 개수도 늘어납니다.
같은 거리를 가면서 기름을 덜 쓰는 차를 연비가 좋다고 하듯, OpenAI가 이번 세대에서 기준으로 삼은 것도 같은 결과를 더 적은 토큰으로 내는 쪽이었습니다. OpenAI는 이를 지출 대비 성능이라는 말로 정리합니다.
위 차트는 OpenAI가 출시 발표와 함께 공개한 Agents' Last Exam 결과입니다. 55개 전문 분야에서 오래 걸리는 업무를 맡겨 보는 평가이고, 가로축이 API 비용, 세로축이 점수입니다. 왼쪽 위로 갈수록 적은 비용에 높은 점수라는 뜻인데, GPT-5.6 세 등급이 모두 그 구역에 몰려 있습니다.
토큰을 아낀 정도는 개별 평가에서 더 구체적으로 나옵니다. 발표 자료에 적힌 내용을 옮기면 이렇습니다.
- 컴퓨터 조작 작업: Sol은 OSWorld 2.0에서 Claude Opus 4.8을 앞서면서 출력 토큰을 85% 적게 썼습니다.
- 코딩 에이전트 작업: Sol을 max 수준으로 돌렸을 때 Artificial Analysis 코딩 에이전트 지수가 80점으로 이 표에서 가장 높았습니다. 다음으로 높은 Claude Fable 5보다 출력 토큰은 절반 이하, 걸린 시간도 절반 이하였습니다.
- 보안 평가: Sol은 ExploitBench에서 73.5%를 기록했습니다. 비슷한 출력 토큰 예산에서 GPT-5.5가 받은 47.9%와 견준 값입니다.
요금이 매겨지는 방식도 함께 바뀌었습니다. 캐싱은 매번 같은 앞부분을 다시 읽지 않고 저장해 둔 것을 꺼내 쓰는 방식인데, GPT-5.6부터는 캐시를 끊을 지점을 직접 지정할 수 있고 그렇게 저장한 캐시는 최소 30분 동안 유지됩니다. 캐시에 저장할 때는 캐시를 거치지 않은 입력 단가의 1.25배가 붙고, 캐시에서 읽어 올 때는 이전 세대와 같이 입력 단가의 90%가 할인됩니다. 긴 지시문을 앞에 붙여 반복 호출하는 자동화라면 이 조건에 따라 실제 청구액이 크게 달라집니다.
GPT-5.6 성능 벤치마크 수치
공식 발표에는 분야별로 나뉜 평가표가 여러 개 실려 있습니다. 그중 GPT-5.5와 직접 견줄 수 있는 항목만 뽑아 한 표로 옮기면 다음과 같습니다. 모두 OpenAI가 공개한 값입니다.
| 평가 항목 | Sol | Terra | Luna | GPT-5.5 |
|---|---|---|---|---|
| Agents' Last Exam | 52.7% | 50.4% | 50.3% | 46.9% |
| Artificial Analysis 지능 지수 v4.1 | 58.9 | 55 | 51.2 | 54.8 |
| Artificial Analysis 코딩 에이전트 지수 v1.1 | 80 | 77.4 | 74.6 | 76.4 |
| Terminal-Bench 2.1 | 88.8% | 87.4% | 84.7% | 85.6% |
| SWE-Bench Pro | 64.6% | 63.4% | 62.7% | 59.4% |
| BrowseComp | 90.4% | 87.5% | 83.3% | 84.4% |
| OSWorld 2.0 | 62.6% | 50.2% | 45.6% | 47.5% |
| GPQA Diamond | 94.6% | 92.9% | 92.3% | 93.6% |
위 차트는 OpenAI 발표 페이지에 함께 실린 코딩 지수 결과입니다. 같은 비용대에서 GPT-5.6 곡선이 GPT-5.5 곡선 위를 지나는데, 같은 돈을 쓰고 더 높은 점수를 받았다는 뜻입니다.
표를 읽을 때 확인해 둘 부분이 하나 있습니다. 세대가 올랐다고 모든 항목이 함께 오르지는 않았습니다. 학술형 문제를 내는 GPQA Diamond에서 Terra는 92.9%, Luna는 92.3%로 GPT-5.5의 93.6%보다 낮고, 지능 지수에서도 Luna는 51.2로 54.8인 GPT-5.5에 못 미칩니다. 반대로 상승 폭이 큰 항목은 OSWorld 2.0이나 Agents' Last Exam처럼 도구를 쓰고 단계를 여럿 거치는 평가에 몰려 있습니다.
경쟁 모델과의 관계도 항목마다 다릅니다. 저장소 수준의 코드 수정 품질을 보는 SWE-Bench Pro에서는 Claude Fable 5가 80%로 Sol의 64.6%보다 높다고 같은 코딩 평가표에 적혀 있습니다. 터미널에서 단계를 이어 수행하는 작업과 코드 자체의 품질을 보는 작업에서 앞서는 모델이 서로 다른 셈입니다.
max와 ultra, 새로 생긴 두 가지 조절 방식
추론 수준(reasoning effort)은 모델이 답을 내기 전에 얼마나 오래 따져 보게 할지 정하는 값입니다. 오래 들여다볼수록 답이 나아지는 시험처럼, 수준을 올리면 정확도가 올라가는 대신 시간과 토큰이 늘어납니다. GPT-5.6에서는 여기에 두 가지가 추가됐습니다.
- max: 그 전까지 가장 높았던 xhigh보다 더 오래 따져 보게 하는 설정입니다. 모델이 대안을 여러 개 떠올리고 스스로 검토한 뒤 접근 방법을 다시 잡습니다.
- ultra: 에이전트 여러 개를 동시에 돌리는 설정으로, 기본값이 4개입니다. 토큰을 더 쓰는 대신 어려운 작업을 더 빨리 끝냅니다.
짐을 트럭 한 대에 싣고 나르던 것을 네 대에 나눠 싣고 함께 출발시키듯, ultra는 순서대로 하나씩 풀던 작업을 여러 개로 쪼개 동시에 진행합니다. 실제 점수 차이는 OpenAI가 공개한 평가표에 ultra 열로 함께 실려 있습니다.
| 평가 항목 | Sol | Sol ultra |
|---|---|---|
| Terminal-Bench 2.1 | 88.8% | 91.9% |
| BrowseComp | 90.4% | 92.2% |
| SEC-Bench Pro | 71.2% | 74.3% |
세 항목에서 1.8%포인트부터 3.1%포인트까지 올랐습니다. 상승 폭이 크지는 않고 토큰은 더 쓰므로, 기본값으로 켜 두기보다 오래 걸리는 작업에만 켜는 편이 맞습니다.
쓸 수 있는 범위도 요금제에 따라 나뉩니다. OpenAI가 안내한 기준은 이렇습니다.
- ChatGPT 대화: Plus와 Pro, Business, Enterprise에서는 미디엄 이상 수준으로 Sol을 씁니다. Pro와 Enterprise에서는 GPT-5.6 Sol Pro도 고를 수 있습니다.
- ChatGPT Work와 Codex: 무료와 Go에서는 Terra를 쓰고, Plus 이상에서는 세 등급을 골라 수준을 따로 정합니다.
- max와 ultra: max는 ChatGPT Work와 Codex에서 GPT-5.6을 쓰는 모든 사용자가 설정에서 켤 수 있습니다. ultra는 ChatGPT Work에서는 Pro와 Enterprise, Codex에서는 Plus 이상에서 열립니다.
API 쪽에는 프로그램 방식 도구 호출(Programmatic Tool Calling)이 함께 들어왔습니다. 모델이 도구를 하나 부를 때마다 결과를 통째로 받아 다시 판단하는 대신, 자바스크립트 코드를 직접 짜서 중간 결과를 걸러 내고 필요한 것만 남기는 방식입니다. 도구를 많이 쓰는 작업에서 왕복 횟수와 토큰이 함께 줄어듭니다.
실무에서 GPT-5.6으로 옮길 작업과 미룰 작업
위 수치를 실무 기준으로 바꿔 놓으면 판단이 단순해집니다. 반복 업무 자동화를 예로 들어 정리해 보겠습니다.
- 단계를 여럿 거치는 자동화: 자료를 모으고 걸러 낸 뒤 문서로 정리하는 작업이라면 옮길 근거가 분명합니다. 점수가 크게 오른 항목이 대부분 이 유형입니다.
- 컴퓨터 화면을 직접 조작하는 작업: OSWorld 2.0에서 Sol이 62.6%로 GPT-5.5의 47.5%보다 15.1%포인트 높습니다.
- 저장소 수준의 코드 수정: SWE-Bench Pro 수치를 보고 Claude 계열과 나란히 비교한 뒤 정하는 편이 안전합니다.
- 단순 질의응답과 학술형 문제: 서둘러 옮길 이유가 크지 않습니다. GPQA Diamond에서 Terra와 Luna는 GPT-5.5보다 낮습니다.
- 호출 횟수가 많은 분류와 추출: 등급을 Luna로 내리는 쪽이 비용에 유리합니다. 등급별 단가는 앞서 연결한 비교 글에 정리되어 있습니다.
구체적인 상황을 하나 놓고 보겠습니다. 상품 리뷰를 모아 감성을 분류하고, 자주 나오는 불만을 뽑아 주간 보고서를 만드는 자동화입니다. 리뷰 수천 건을 분류하는 앞단은 호출이 잦으니 Luna가 맞고, 불만을 묶어 문장으로 정리하는 중간 단계는 Terra로 충분합니다. 여러 자료를 한데 놓고 원인을 따지는 마지막 단계에만 Sol을 배정하면, 전체를 Sol로 돌릴 때보다 비용이 크게 줄어듭니다. 이때 앞단에 붙는 분류 지시문은 매번 같으므로 캐시 지점을 그 뒤에 두면 입력 비용이 한 번 더 내려갑니다.
자주 묻는 질문
GPT-5.6은 GPT-5.5에서 무엇이 달라졌나요?
가장 크게 달라진 것은 같은 결과를 내는 데 드는 토큰의 양입니다. OpenAI는 Sol이 OSWorld 2.0에서 Claude Opus 4.8을 앞서면서 출력 토큰을 85% 적게 썼다고 밝히고 있습니다. 이름 규칙도 함께 바뀌어서, 숫자가 세대를 가리키고 Sol과 Terra, Luna가 성능 등급을 가리키는 표기가 GPT-5.6부터 적용됐습니다.
GPT-5.6 성능은 모든 항목에서 올랐나요?
그렇지 않습니다. 도구를 쓰고 여러 단계를 이어 가는 평가에서는 크게 올랐지만, 학술형 문제를 내는 GPQA Diamond에서는 Terra가 92.9%, Luna가 92.3%로 GPT-5.5의 93.6%보다 낮습니다. Artificial Analysis 지능 지수에서도 Luna는 51.2로 GPT-5.5의 54.8에 못 미칩니다.
Sol과 Terra, Luna 가운데 무엇을 골라야 하나요?
작업 유형으로 정하는 편이 단순합니다. 대량 분류와 추출은 Luna, 문서 요약과 초안 작성은 Terra, 여러 단계를 거치는 추론과 까다로운 코드 수정은 Sol이 어울립니다. 세 등급의 단가와 요금제별 사용 범위는 GPT-5.6 Sol, Terra, Luna 차이와 가격 비교에 따로 정리되어 있습니다.
ultra 설정은 항상 켜 두는 편이 좋나요?
그렇게 보기는 어렵습니다. 평가표에서 ultra가 올린 점수는 Terminal-Bench 2.1이 88.8%에서 91.9%로 3.1%포인트, BrowseComp가 90.4%에서 92.2%로 1.8%포인트입니다. 에이전트를 여러 개 돌리는 만큼 토큰을 더 쓰므로, 오래 걸리고 결과가 중요한 작업에만 켜는 쪽이 비용 대비 효율이 좋습니다.
벤치마크 점수가 높으면 실무에서도 그만큼 잘하나요?
그대로 이어진다고 보기는 어렵습니다. 여기 실린 수치는 대부분 모델을 만든 쪽이 측정해 공개한 값이고, 정답을 기계로 채점할 수 있는 작업에서 나온 결과입니다. 요구사항이 모호한 실제 업무는 조건이 다르므로, 쓰던 작업 두세 개를 같은 조건으로 돌려 보고 판단하는 순서가 안전합니다.
3줄 요약
- GPT-5.6은 OpenAI가 2026년 7월 9일 정식 출시한 모델 세대이고 숫자는 세대를, Sol과 Terra, Luna는 성능 등급을 가리킵니다.
- 발표가 앞세운 기준은 점수보다 토큰 효율이고 Sol은 OSWorld 2.0에서 62.6%로 Claude Opus 4.8을 넘으면서 출력 토큰을 85% 적게 썼습니다.
- GPQA Diamond는 Terra가 92.9%로 GPT-5.5의 93.6%보다 낮아 세대 교체가 모든 항목의 상승을 뜻하지는 않습니다.
Sources
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
GPT-5.6이라는 이름에서 숫자 5.6이 가리키는 것은 무엇일까요?
이 글이 도움이 되었나요?
다음 단계
이어서 읽기 좋은 글
딥시크(DeepSeek) 정리: 무료 사용 범위와 데이터 처리, 고르는 기준
딥시크(DeepSeek)는 중국 항저우의 AI 기업 딥시크가 만든 대화형 AI 서비스이자 그 회사가 공개하는 언어모델의 이름입니다. 무료로 쓸 수 있는 범위와 API 요금, 공식 개인정보처리방침에 적힌 데이터 처리 조건, 챗지피티나 클로드 대신 고를 기준을 2026년 9월 15일 자료로 정리했습니다.
같이 보면 좋은 글

GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 2026년 9월 기준 현행 모델 네 가지의 규모와 가격, 라이선스를 나란히 놓고 웹 화면과 API, 코딩 구독, 가중치 내려받기까지 쓰는 방법을 공식 자료로 정리했습니다.
2026. 9. 15.
GPT-6 아스트라는 OpenAI가 2026년 9월 3일 공개한 모델이고, 컴퓨터를 사람처럼 직접 조작하는 작업에 초점을 두고 있습니다. 구독 중인데도 모델 목록에 아스트라가 없는 경우가 많은데, 대부분은 계정 문제가 아니라 요금제마다 열리는 화면이 다르기 때문입니다. 요금제별 제공 범위, 확인 순서, 회사 계정의 관리자 설정, API 요금 계산을 공식 문서로 확인해 정리했습니다.
2026. 9. 14.
프론티어 속도 조절(pacing the frontier)은 AI 기업이 모델 능력을 올리는 속도를 안전 검증이 따라올 수 있는 수준으로 늦추는 것을 뜻합니다. 2026년 9월 12일 앤트로픽 CEO 다리오 아모데이가 올린 3,800단어 에세이의 내용, 근거로 든 두 가지 사건, 3단계 계획, 올트먼과 머스크의 동의와 반대편 반론까지 정리했습니다.
2026. 9. 13.
컴퓨터 유즈는 AI가 화면을 직접 보고 마우스와 키보드를 움직여 사람이 쓰던 프로그램을 대신 조작하는 방식입니다. 짧은 과제 성공률은 80%를 넘겼는데 한 시간짜리 업무에서는 31%에 그치는 이유를 공개 벤치마크와 공식 문서로 정리했습니다.
2026. 9. 11.ADVERTISEMENT