AI & Tech

제미나이 3.7 플래시와 GPT-5.6 울트라패스트, AI 속도 발표 4건 정리

/ 데이터 분석, AI 실무 교육

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 나온 네 건의 발표를 놓고 각각이 속도를 어디서 얻는지, 발표된 배수가 실제 작업 시간에서 어떻게 줄어드는지를 공식 자료 기준으로 정리했습니다.

2026. 8. 14.20
Share
제미나이 3.7 플래시와 GPT-5.6 울트라패스트, AI 속도 발표 4건 정리 대표 이미지

3줄 요약

이번 방문에서 한 편은 바로 볼 수 있습니다.

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 이 속도를 끌어올렸다는 발표가 나흘 사이에 네 건 나왔습니다. OpenAI의 Ultrafast, 구글의 Gemini 3.7 Flash, 앤트로픽의 Fast mode, 메타의 Muse Glimmer입니다.

모델이 빨라졌다는 발표가 자주 나온다는 것은 이제 익숙한 이야기입니다. 그런데 이 네 건은 빨라진 방식이 서로 다릅니다. 어떤 것은 칩을 바꿔서, 어떤 것은 모델을 가볍게 만들어서, 어떤 것은 같은 모델의 실행 설정을 바꿔서 속도를 얻습니다. 방식이 다르면 쓸 수 있는 조건도 가격도 달라지는데, 발표문에는 배수만 크게 적히다 보니 조건이 다른 것끼리 같은 줄에 놓고 비교하게 되기 쉽습니다.

공식 발표문과 기술 문서를 근거로, 2026년 8월 14일 기준으로 정리하겠습니다.

위 그래프는 Cerebras가 Ultrafast 발표에 맞춰 공개한 등급별 속도 비교입니다. 같은 모델이라도 어느 등급으로 요청하느냐에 따라 출력 속도가 달라진다는 것을 보여줍니다.

나흘 사이에 나온 발표 네 건

먼저 네 건을 한자리에 놓겠습니다. 발표일과 핵심 수치만 추린 것입니다.

발표시점속도에 관한 수치지금 쓸 수 있는 조건
OpenAI Ultrafast8월 13일표준 대비 최대 14배, 초당 750토큰OpenAI API 제한 프리뷰
Gemini 3.7 Flash8월 13일속도 배수 대신 성능과 단가로 발표Gemini API, AI Studio 등 일반 공개
Claude Opus Fast mode8월 14일 문서 확인초당 출력 토큰 최대 2.5배리서치 프리뷰, 접근 신청 필요
Meta Muse Glimmer8월 10일RTX 5090에서 3.1배Hugging Face 공개, Apache 2.0

네 건 가운데 Gemini 3.7 Flash만 성격이 조금 다릅니다. 나머지 셋이 실행 속도를 앞세운 반면, 이쪽은 같은 값으로 더 많은 일을 하게 만드는 데 가깝습니다. 그래도 Flash 계열 자체가 빠르고 저렴한 쪽을 맡는 모델이라 같은 흐름에 놓고 봐도 무리가 없습니다.

속도를 얻는 방법이 서로 다릅니다

같은 짐을 더 빨리 옮기는 방법은 하나가 아닙니다. 전용 도로를 새로 깔 수도 있고, 짐을 줄여 가벼운 차로 바꿀 수도 있고, 같은 차의 속도 제한을 풀 수도 있습니다. 네 건이 고른 방법이 각각 다릅니다.

  • Ultrafast는 도로를 바꿉니다. 모델은 그대로 두고 실행하는 하드웨어를 Cerebras의 전용 칩으로 옮겼습니다.
  • Gemini 3.7 Flash는 차를 바꿉니다. 큰 모델 대신 가볍고 저렴한 계열의 모델을 새로 내놓았습니다.
  • Fast mode는 같은 차의 제한을 풉니다. 모델 가중치는 그대로이고 추론 설정만 빠른 쪽으로 바꿉니다.
  • Muse Glimmer는 앞차를 먼저 보냅니다. 가벼운 보조 모델이 다음에 올 토큰을 미리 제안하고 본 모델이 한꺼번에 확인합니다.

어느 방법을 골랐는지에 따라 도입할 때 걸리는 조건이 달라집니다. 도로를 바꾸는 쪽은 그 도로에 들어갈 권한이 필요하고, 차를 바꾸는 쪽은 짐을 다시 실어야 합니다.

OpenAI Ultrafast, 전용 칩으로 얻은 초당 750토큰

Ultrafast는 OpenAI가 2026년 8월 13일 공개한 GPT-5.6 Sol의 서비스 등급입니다. 모델을 새로 만든 것이 아니라 같은 모델을 다른 하드웨어에서 돌리는 방식이고, Cerebras의 Wafer-Scale Engine이 그 하드웨어입니다. 이 칩은 44GB의 SRAM을 안에 담고 있어서 모델 가중치를 바깥 메모리에서 불러오는 시간을 줄입니다.

발표된 수치는 최대 초당 750개의 출력 토큰이고, 표준 등급 대비 최대 14배입니다. 등급은 표준과 Priority, Ultrafast 세 가지이고 표준이 가장 느립니다. 중간인 Priority가 2.5배이므로 14배는 가장 느린 등급과 가장 빠른 등급을 견준 값입니다.

OpenAI는 활용 사례로 장애 대응, 고객 응대, 금융 시장 분석, 이커머스를 들었습니다. Cerebras 쪽 발표문은 법률 문서 작성과 보안 위협 대응을 함께 적었습니다. 사람이 결과를 기다리고 있는 작업이 공통점입니다.

지금은 OpenAI API에서 선별된 고객에게만 열린 프리뷰입니다. 용량이 늘어나면 대상을 넓히겠다고 OpenAI가 안내하고 있습니다.

14배가 실제 작업에서 5.6배가 되는 이유

이 글에서 가장 중요한 대목입니다. Cerebras가 함께 공개한 측정치를 보면 14배라는 숫자가 실제 작업에서 어떻게 달라지는지 드러납니다.

위 그래프는 GDP-Val 평가의 6개 작업을 같은 품질 기준으로 맞춰 놓고, 작업이 끝날 때까지 걸린 시간을 잰 것입니다. 주황색은 모델이 토큰을 만드는 시간이고 회색은 그 밖의 시간입니다.

속도 배수는 모델이 토큰을 만드는 구간에만 적용되므로, 도구 호출과 대기가 섞인 실제 작업에서는 배수가 줄어듭니다.

표준 등급은 모델 요청에 7.5분, 그 밖의 처리에 14.2초를 써서 전체 7.7분이 걸렸습니다. Ultrafast는 모델 요청이 68.1초로 줄었지만 그 밖의 처리에는 14.9초가 거의 그대로 들어 전체 83초가 됐습니다. 전체 시간을 기준으로 하면 배수는 5.6배입니다.

차가 아무리 빨라져도 짐을 싣고 내리는 시간은 줄지 않듯, 모델이 토큰을 만들지 않는 구간은 속도 등급을 올려도 그대로 남습니다. 도구를 여러 번 부르거나 외부 API를 기다리는 에이전트 작업일수록 이 구간의 비중이 커집니다.

일정과 예산을 계산할 때는 발표된 배수를 그대로 넣지 말고, 우리 작업에서 모델이 실제로 토큰을 만드는 시간이 몇 퍼센트인지부터 재 보는 편이 안전합니다.

Gemini 3.7 Flash, 성능 향상과 절반으로 내려온 도입가

Gemini 3.7 Flash는 구글이 2026년 8월 13일 공개한 코딩과 에이전트 작업용 모델입니다. 이전 판인 3.6 Flash와 비교하면 코딩과 웹 개발, 지식 작업 점수가 올랐습니다.

공식 발표문에 함께 실린 비교표입니다. 3.6 Flash보다 오른 항목을 추리면 이렇습니다.

평가 항목3.7 Flash3.6 Flash
FrontierCode 1.1 Main43.6%34.4%
DeepSWE v1.165.3%48.6%
Code Arena (Elo)15881538
AutomationBench30.4%17.0%

가격에는 짚고 넘어갈 부분이 있습니다. 100만 토큰당 입력 $0.75, 출력 $3.75인데, 3.6 Flash가 나왔을 때의 입력 $1.50, 출력 $7.50에서 절반으로 내려온 값입니다.

다만 이 단가는 2026년 12월 31일까지 적용되는 도입가입니다. 표 아래 각주를 보면 3.6 Flash에도 같은 도입가가 걸려 있어 지금은 두 모델의 단가가 같고, 2027년 1월 1일부터는 둘 다 입력 $1.50, 출력 $7.50이 됩니다.

절반이라는 것은 3.6 Flash가 나왔을 때와 견준 값이고, 내년부터는 그 수준으로 돌아갑니다. 지금 예산을 세운다면 이 시점을 함께 넣어야 계산이 어긋나지 않습니다.

쓸 수 있는 곳은 Google AI Studio와 Gemini API, Android Studio, Google Antigravity, Gemini Enterprise Agent Platform입니다.

2026년 9월 2일에는 같은 가격의 후속 판인 3.8 플래시가 나왔습니다. 달라진 점과 토큰 사용량 주의점은 제미나이 3.8 플래시와 3.8 플래시 사이버 정리에 있습니다.

Claude Opus Fast mode, 같은 모델의 실행 설정 변경

Fast mode는 앤트로픽이 Claude Opus 계열에 제공하는 실행 옵션입니다. 공식 문서 기준으로 초당 출력 토큰이 최대 2.5배가 되고, 모델 가중치와 동작은 그대로입니다.

문서에 적힌 조건 가운데 실무에서 걸릴 만한 것을 추리면 이렇습니다.

  • 지원 모델이 좁습니다. Claude Opus 5와 Opus 4.8만 해당합니다. Opus 4.7은 오류를 돌려주지만 Opus 4.6은 오류 없이 표준 속도로 처리됩니다. 빨라졌다고 잘못 알기 쉬운 부분입니다.
  • 빨라지는 구간이 정해져 있습니다. 초당 출력 토큰이 빨라지고, 첫 응답까지 걸리는 시간은 개선 대상이 아니라고 문서가 명시합니다.
  • 가격이 표준의 두 배입니다. 100만 토큰당 입력 $10, 출력 $50이고 컨텍스트 전체에 적용됩니다. Opus 5의 표준 단가가 $5와 $25이므로 정확히 두 배입니다.
  • 함께 못 쓰는 기능이 있습니다. Batch API와 Priority Tier에서 쓸 수 없고, Amazon Bedrock과 Google Cloud, Microsoft Foundry에서도 제공되지 않습니다.

캐시를 쓰고 있다면 하나 더 확인할 것이 있습니다. 빠른 속도와 표준 속도는 캐시를 공유하지 않아서, 둘을 오가면 프롬프트 캐시가 다시 채워집니다. 속도를 얻는 대신 캐시로 아끼던 비용이 사라질 수 있습니다.

현재 리서치 프리뷰라 담당자를 통하거나 대기자 명단에 이름을 올려야 합니다.

Meta Muse Glimmer, 로컬에서 돌리는 예측 디코딩

Muse Glimmer는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 에이전트 모델입니다. Apache 2.0 라이선스로 가중치가 공개되어 있고 Hugging Face에서 받을 수 있습니다. 전문가 혼합(Mixture of Experts) 방식이 아니라 전체 파라미터가 매번 모두 동작합니다.

속도의 근거는 DFlash라는 기법입니다. 가벼운 보조 모델이 16개 토큰 묶음을 한 번에 예측하면 본 모델이 그것을 한꺼번에 검증하는 방식이라, 한 토큰씩 차례로 만들 때보다 빨라집니다. 결과물의 품질은 같다고 발표문이 설명합니다.

측정된 속도 향상은 하드웨어마다 다릅니다. RTX 5090에서 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배입니다. 메타가 배수 하나로 뭉뚱그리지 않고 기기별로 적어 둔 점은 참고할 만합니다.

이 모델을 돌리는 데 필요한 메모리도 공개되어 있습니다. 32GB 환경에서는 성능 저하가 0.2% 수준인 압축본을, 24GB 환경에서는 1.0% 수준인 압축본을 쓰고, 압축하지 않은 상태로는 64GB가 필요합니다. 노트북에서 돌려 보려면 이 조건부터 확인하는 것이 순서입니다.

속도 배수를 볼 때 확인할 조건

네 건을 함께 놓고 보면 발표 수치를 읽는 방법이 정리됩니다.

  • 어느 구간을 잰 값인지 확인합니다. 초당 출력 토큰인지 작업 완료까지의 시간인지에 따라 같은 모드의 배수가 두 배 넘게 벌어집니다. Ultrafast의 14배와 5.6배가 그 예입니다.
  • 첫 응답 시간과 출력 속도를 구분합니다. 대화형 화면에서 체감을 좌우하는 것은 첫 글자가 나오기까지의 시간인데, Fast mode 문서는 그 구간이 개선 대상이 아니라고 적고 있습니다.
  • 가격이 붙는 범위를 봅니다. Fast mode는 프리미엄 단가가 컨텍스트 전체에 적용되고, Gemini 3.7 Flash의 도입가는 2026년 12월 31일까지입니다.
  • 지금 신청할 수 있는지 확인합니다. Ultrafast와 Fast mode는 승인이 필요한 프리뷰이므로, 계획을 세워도 바로 시험하지 못할 수 있습니다.
  • 같은 작업으로 직접 재 봅니다. 평소 쓰는 작업 두세 개를 같은 조건으로 넣고 전체 소요 시간과 토큰 사용량을 함께 기록하면, 발표 수치보다 정확한 판단 근거가 생깁니다.

속도가 빨라지면 비용도 줄어드나요?

그렇지 않습니다. 네 건 가운데 속도와 비용이 함께 내려가는 것은 Gemini 3.7 Flash와 Muse Glimmer뿐이고, 이 둘은 애초에 모델을 바꾸는 방식입니다.

Ultrafast와 Fast mode는 같은 모델을 빨리 돌리는 대신 더 비싼 단가를 받습니다. Fast mode는 공식 문서 기준으로 표준의 두 배이고, 속도를 오가면 프롬프트 캐시까지 다시 채워집니다. 캐시로 아끼던 금액이 함께 사라질 수 있으므로, 빨라진 시간으로 얻는 것이 추가 비용보다 큰 작업에만 쓰는 편이 맞겠습니다.

어떤 방식을 먼저 시험해 보면 좋을까요?

승인 없이 지금 바로 확인할 수 있는 쪽부터 보는 것이 순서입니다. Gemini 3.7 Flash는 일반 공개되어 있어 평소 작업을 그대로 넣어 볼 수 있고, Muse Glimmer는 가중치가 공개되어 있어 GPU 조건만 맞으면 로컬에서 돌려 볼 수 있습니다.

Ultrafast와 Fast mode는 접근 신청이 필요합니다. 신청과 함께 지금 쓰는 모델의 작업 시간부터 재 두면 좋습니다. 그 가운데 모델이 토큰을 만드는 구간이 몇 퍼센트인지 알아 두면, 승인이 났을 때 비교할 기준이 이미 준비된 상태가 됩니다.

Sources:

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

퀴즈

모델 제공사가 발표하는 속도 배수를 실무 예산과 일정에 반영할 때 가장 먼저 확인해야 할 것은 무엇일까요?

이 글이 도움이 되었나요?

다음 단계

이어서 읽기 좋은 글

딥시크(DeepSeek) 정리: 무료 사용 범위와 데이터 처리, 고르는 기준

딥시크(DeepSeek)는 중국 항저우의 AI 기업 딥시크가 만든 대화형 AI 서비스이자 그 회사가 공개하는 언어모델의 이름입니다. 무료로 쓸 수 있는 범위와 API 요금, 공식 개인정보처리방침에 적힌 데이터 처리 조건, 챗지피티나 클로드 대신 고를 기준을 2026년 9월 15일 자료로 정리했습니다.

다음 글 읽기

같이 보면 좋은 글

GPT-5.6 모델 정리: 정의와 성능, GPT-5.5와 달라진 점 썸네일
AI & TechGPT-5.6 모델 정리: 정의와 성능, GPT-5.5와 달라진 점

GPT-5.6은 OpenAI가 2026년 7월 9일 정식 출시한 AI 모델 세대입니다. 이름 규칙과 토큰 효율 중심의 설계, 공식 발표에 실린 벤치마크 수치, 새로 생긴 max와 ultra 설정을 GPT-5.5와 나란히 놓고 정리했습니다.

2026. 9. 15.
GLM 모델 정리: Z.ai 버전별 차이와 쓰는 방법 4가지 썸네일
AI & TechGLM 모델 정리: Z.ai 버전별 차이와 쓰는 방법 4가지

GLM은 중국 AI 기업 Z.ai가 만드는 오픈 웨이트 언어 모델 계열입니다. 2026년 9월 기준 현행 모델 네 가지의 규모와 가격, 라이선스를 나란히 놓고 웹 화면과 API, 코딩 구독, 가중치 내려받기까지 쓰는 방법을 공식 자료로 정리했습니다.

2026. 9. 15.
재귀적 자기개선(RSI) 뜻과 구글 딥마인드 루머 정리 썸네일
AI & Tech재귀적 자기개선(RSI) 뜻과 구글 딥마인드 루머 정리

재귀적 자기개선은 AI가 자기 코드와 학습 절차를 스스로 고쳐 다음 판을 더 낫게 만드는 상태입니다. 트윗 한 줄에서 시작해 API 유출과 구글의 키 회수로 번진 2026년 9월 루머를 시간 순서로 정리하고, 확인된 사실과 추측의 경계를 나눴습니다.

2026. 9. 15.
GPT-6 아스트라 사용법: 요금제별 제공 범위와 모델 확인 순서 썸네일
AI & TechGPT-6 아스트라 사용법: 요금제별 제공 범위와 모델 확인 순서

GPT-6 아스트라는 OpenAI가 2026년 9월 3일 공개한 모델이고, 컴퓨터를 사람처럼 직접 조작하는 작업에 초점을 두고 있습니다. 구독 중인데도 모델 목록에 아스트라가 없는 경우가 많은데, 대부분은 계정 문제가 아니라 요금제마다 열리는 화면이 다르기 때문입니다. 요금제별 제공 범위, 확인 순서, 회사 계정의 관리자 설정, API 요금 계산을 공식 문서로 확인해 정리했습니다.

2026. 9. 14.

ADVERTISEMENT

이 글의 학습 경로

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기