AI & Tech

제미나이 3.7 플래시와 GPT-5.6 울트라패스트, AI 속도 발표 4건 정리

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 나온 네 건의 발표를 놓고 각각이 속도를 어디서 얻는지, 발표된 배수가 실제 작업 시간에서 어떻게 줄어드는지를 공식 자료 기준으로 정리했습니다.

2026. 8. 14.
Share
제미나이 3.7 플래시와 GPT-5.6 울트라패스트, AI 속도 발표 4건 정리 대표 이미지

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 이 속도를 끌어올렸다는 발표가 나흘 사이에 네 건 나왔습니다. OpenAI의 Ultrafast, 구글의 Gemini 3.7 Flash, 앤트로픽의 Fast mode, 메타의 Muse Glimmer입니다.

모델이 빨라졌다는 발표가 자주 나온다는 것은 이제 익숙한 이야기입니다. 그런데 이 네 건은 빨라진 방식이 서로 다릅니다. 어떤 것은 칩을 바꿔서, 어떤 것은 모델을 가볍게 만들어서, 어떤 것은 같은 모델의 실행 설정을 바꿔서 속도를 얻습니다. 방식이 다르면 쓸 수 있는 조건도 가격도 달라지는데, 발표문에는 배수만 크게 적히다 보니 조건이 다른 것끼리 같은 줄에 놓고 비교하게 되기 쉽습니다.

공식 발표문과 기술 문서를 근거로, 2026년 8월 14일 기준으로 정리하겠습니다.

GPT-5.6 Sol의 서비스 등급별 속도 비교 막대 그래프. Ultrafast가 14배, Priority가 2.5배, Standard가 1배로 표시되어 있다

위 그래프는 Cerebras가 Ultrafast 발표에 맞춰 공개한 등급별 속도 비교입니다. 같은 모델이라도 어느 등급으로 요청하느냐에 따라 출력 속도가 달라진다는 것을 보여줍니다.

나흘 사이에 나온 발표 네 건

먼저 네 건을 한자리에 놓겠습니다. 발표일과 핵심 수치만 추린 것입니다.

발표시점속도에 관한 수치지금 쓸 수 있는 조건
OpenAI Ultrafast8월 13일표준 대비 최대 14배, 초당 750토큰OpenAI API 제한 프리뷰
Gemini 3.7 Flash8월 13일속도 배수 대신 성능과 단가로 발표Gemini API, AI Studio 등 일반 공개
Claude Opus Fast mode8월 14일 문서 확인초당 출력 토큰 최대 2.5배리서치 프리뷰, 접근 신청 필요
Meta Muse Glimmer8월 10일RTX 5090에서 3.1배Hugging Face 공개, Apache 2.0

네 건 가운데 Gemini 3.7 Flash만 성격이 조금 다릅니다. 나머지 셋이 실행 속도를 앞세운 반면, 이쪽은 같은 값으로 더 많은 일을 하게 만드는 데 가깝습니다. 그래도 Flash 계열 자체가 빠르고 저렴한 쪽을 맡는 모델이라 같은 흐름에 놓고 봐도 무리가 없습니다.

속도를 얻는 방법이 서로 다릅니다

같은 짐을 더 빨리 옮기는 방법은 하나가 아닙니다. 전용 도로를 새로 깔 수도 있고, 짐을 줄여 가벼운 차로 바꿀 수도 있고, 같은 차의 속도 제한을 풀 수도 있습니다. 네 건이 고른 방법이 각각 다릅니다.

  • Ultrafast는 도로를 바꿉니다. 모델은 그대로 두고 실행하는 하드웨어를 Cerebras의 전용 칩으로 옮겼습니다.
  • Gemini 3.7 Flash는 차를 바꿉니다. 큰 모델 대신 가볍고 저렴한 계열의 모델을 새로 내놓았습니다.
  • Fast mode는 같은 차의 제한을 풉니다. 모델 가중치는 그대로이고 추론 설정만 빠른 쪽으로 바꿉니다.
  • Muse Glimmer는 앞차를 먼저 보냅니다. 가벼운 보조 모델이 다음에 올 토큰을 미리 제안하고 본 모델이 한꺼번에 확인합니다.

어느 방법을 골랐는지에 따라 도입할 때 걸리는 조건이 달라집니다. 도로를 바꾸는 쪽은 그 도로에 들어갈 권한이 필요하고, 차를 바꾸는 쪽은 짐을 다시 실어야 합니다.

OpenAI Ultrafast, 전용 칩으로 얻은 초당 750토큰

Ultrafast는 OpenAI가 2026년 8월 13일 공개한 GPT-5.6 Sol의 서비스 등급입니다. 모델을 새로 만든 것이 아니라 같은 모델을 다른 하드웨어에서 돌리는 방식이고, Cerebras의 Wafer-Scale Engine이 그 하드웨어입니다. 이 칩은 44GB의 SRAM을 안에 담고 있어서 모델 가중치를 바깥 메모리에서 불러오는 시간을 줄입니다.

발표된 수치는 최대 초당 750개의 출력 토큰이고, 표준 등급 대비 최대 14배입니다. 등급은 표준과 Priority, Ultrafast 세 가지이고 표준이 가장 느립니다. 중간인 Priority가 2.5배이므로 14배는 가장 느린 등급과 가장 빠른 등급을 견준 값입니다.

OpenAI는 활용 사례로 장애 대응, 고객 응대, 금융 시장 분석, 이커머스를 들었습니다. Cerebras 쪽 발표문은 법률 문서 작성과 보안 위협 대응을 함께 적었습니다. 사람이 결과를 기다리고 있는 작업이 공통점입니다.

지금은 OpenAI API에서 선별된 고객에게만 열린 프리뷰입니다. 용량이 늘어나면 대상을 넓히겠다고 OpenAI가 안내하고 있습니다.

14배가 실제 작업에서 5.6배가 되는 이유

이 글에서 가장 중요한 대목입니다. Cerebras가 함께 공개한 측정치를 보면 14배라는 숫자가 실제 작업에서 어떻게 달라지는지 드러납니다.

GDP-Val 6개 작업의 평균 소요 시간 비교. Ultrafast는 모델 요청 68.1초와 비추론 14.9초를 더해 83초, 표준은 모델 요청 7.5분과 비추론 14.2초를 더해 7.7분이며 전체로는 5.6배 차이로 표시되어 있다

위 그래프는 GDP-Val 평가의 6개 작업을 같은 품질 기준으로 맞춰 놓고, 작업이 끝날 때까지 걸린 시간을 잰 것입니다. 주황색은 모델이 토큰을 만드는 시간이고 회색은 그 밖의 시간입니다.

속도 배수는 모델이 토큰을 만드는 구간에만 적용되므로, 도구 호출과 대기가 섞인 실제 작업에서는 배수가 줄어듭니다.

표준 등급은 모델 요청에 7.5분, 그 밖의 처리에 14.2초를 써서 전체 7.7분이 걸렸습니다. Ultrafast는 모델 요청이 68.1초로 줄었지만 그 밖의 처리에는 14.9초가 거의 그대로 들어 전체 83초가 됐습니다. 전체 시간을 기준으로 하면 배수는 5.6배입니다.

차가 아무리 빨라져도 짐을 싣고 내리는 시간은 줄지 않듯, 모델이 토큰을 만들지 않는 구간은 속도 등급을 올려도 그대로 남습니다. 도구를 여러 번 부르거나 외부 API를 기다리는 에이전트 작업일수록 이 구간의 비중이 커집니다.

일정과 예산을 계산할 때는 발표된 배수를 그대로 넣지 말고, 우리 작업에서 모델이 실제로 토큰을 만드는 시간이 몇 퍼센트인지부터 재 보는 편이 안전합니다.

Gemini 3.7 Flash, 성능 향상과 절반으로 내려온 도입가

Gemini 3.7 Flash는 구글이 2026년 8월 13일 공개한 코딩과 에이전트 작업용 모델입니다. 이전 판인 3.6 Flash와 견주면 코딩과 웹 개발, 지식 작업 점수가 올랐습니다.

Gemini 3.7 Flash와 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra, Muse Spark 1.2의 벤치마크 비교표. 입력 단가는 3.7과 3.6 모두 100만 토큰당 0.75달러로 같고, 표 아래에 2026년 12월 31일 이후 단가가 오른다는 각주가 있다

공식 발표문에 함께 실린 비교표입니다. 3.6 Flash보다 오른 항목을 추리면 이렇습니다.

평가 항목3.7 Flash3.6 Flash
FrontierCode 1.1 Main43.6%34.4%
DeepSWE v1.165.3%48.6%
Code Arena (Elo)15881538
AutomationBench30.4%17.0%

가격에는 짚고 넘어갈 부분이 있습니다. 100만 토큰당 입력 $0.75, 출력 $3.75인데, 3.6 Flash가 나왔을 때의 입력 $1.50, 출력 $7.50에서 절반으로 내려온 값입니다.

다만 이 단가는 2026년 12월 31일까지 적용되는 도입가입니다. 표 아래 각주를 보면 3.6 Flash에도 같은 도입가가 걸려 있어 지금은 두 모델의 단가가 같고, 2027년 1월 1일부터는 둘 다 입력 $1.50, 출력 $7.50이 됩니다.

절반이라는 것은 3.6 Flash가 나왔을 때와 견준 값이고, 내년부터는 그 수준으로 돌아갑니다. 지금 예산을 세운다면 이 시점을 함께 넣어야 계산이 어긋나지 않습니다.

쓸 수 있는 곳은 Google AI Studio와 Gemini API, Android Studio, Google Antigravity, Gemini Enterprise Agent Platform입니다.

Claude Opus Fast mode, 같은 모델의 실행 설정 변경

Fast mode는 앤트로픽이 Claude Opus 계열에 제공하는 실행 옵션입니다. 공식 문서 기준으로 초당 출력 토큰이 최대 2.5배가 되고, 모델 가중치와 동작은 그대로입니다.

문서에 적힌 조건 가운데 실무에서 걸릴 만한 것을 추리면 이렇습니다.

  • 지원 모델이 좁습니다. Claude Opus 5와 Opus 4.8만 해당합니다. Opus 4.7은 오류를 돌려주지만 Opus 4.6은 오류 없이 표준 속도로 처리됩니다. 빨라졌다고 잘못 알기 쉬운 부분입니다.
  • 빨라지는 구간이 정해져 있습니다. 초당 출력 토큰이 빨라지고, 첫 응답까지 걸리는 시간은 개선 대상이 아니라고 문서가 명시합니다.
  • 가격이 표준의 두 배입니다. 100만 토큰당 입력 $10, 출력 $50이고 컨텍스트 전체에 적용됩니다. Opus 5의 표준 단가가 $5와 $25이므로 정확히 두 배입니다.
  • 함께 못 쓰는 기능이 있습니다. Batch API와 Priority Tier에서 쓸 수 없고, Amazon Bedrock과 Google Cloud, Microsoft Foundry에서도 제공되지 않습니다.

캐시를 쓰고 있다면 하나 더 확인할 것이 있습니다. 빠른 속도와 표준 속도는 캐시를 공유하지 않아서, 둘을 오가면 프롬프트 캐시가 다시 채워집니다. 속도를 얻는 대신 캐시로 아끼던 비용이 사라질 수 있습니다.

현재 리서치 프리뷰라 담당자를 통하거나 대기자 명단에 이름을 올려야 합니다.

Meta Muse Glimmer, 로컬에서 돌리는 예측 디코딩

Muse Glimmer는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 에이전트 모델입니다. Apache 2.0 라이선스로 가중치가 공개되어 있고 Hugging Face에서 받을 수 있습니다. 전문가 혼합(Mixture of Experts) 방식이 아니라 전체 파라미터가 매번 모두 동작합니다.

속도의 근거는 DFlash라는 기법입니다. 가벼운 보조 모델이 16개 토큰 묶음을 한 번에 예측하면 본 모델이 그것을 한꺼번에 검증하는 방식이라, 한 토큰씩 차례로 만들 때보다 빨라집니다. 결과물의 품질은 같다고 발표문이 설명합니다.

측정된 속도 향상은 하드웨어마다 다릅니다. RTX 5090에서 3.1배, M5 Max에서 1.8배, M4 Max에서 1.5배입니다. 메타가 배수 하나로 뭉뚱그리지 않고 기기별로 적어 둔 점은 참고할 만합니다.

이 모델을 돌리는 데 필요한 메모리도 공개되어 있습니다. 32GB 환경에서는 성능 저하가 0.2% 수준인 압축본을, 24GB 환경에서는 1.0% 수준인 압축본을 쓰고, 압축하지 않은 상태로는 64GB가 필요합니다. 노트북에서 돌려 보려면 이 조건부터 확인하는 것이 순서입니다.

속도 배수를 볼 때 확인할 조건

네 건을 함께 놓고 보면 발표 수치를 읽는 방법이 정리됩니다.

  • 어느 구간을 잰 값인지 확인합니다. 초당 출력 토큰인지 작업 완료까지의 시간인지에 따라 같은 모드의 배수가 두 배 넘게 벌어집니다. Ultrafast의 14배와 5.6배가 그 예입니다.
  • 첫 응답 시간과 출력 속도를 구분합니다. 대화형 화면에서 체감을 좌우하는 것은 첫 글자가 나오기까지의 시간인데, Fast mode 문서는 그 구간이 개선 대상이 아니라고 적고 있습니다.
  • 가격이 붙는 범위를 봅니다. Fast mode는 프리미엄 단가가 컨텍스트 전체에 적용되고, Gemini 3.7 Flash의 도입가는 2026년 12월 31일까지입니다.
  • 지금 신청할 수 있는지 확인합니다. Ultrafast와 Fast mode는 승인이 필요한 프리뷰이므로, 계획을 세워도 바로 시험하지 못할 수 있습니다.
  • 같은 작업으로 직접 재 봅니다. 평소 쓰는 작업 두세 개를 같은 조건으로 넣고 전체 소요 시간과 토큰 사용량을 함께 기록하면, 발표 수치보다 정확한 판단 근거가 생깁니다.

속도가 빨라지면 비용도 줄어드나요?

그렇지 않습니다. 네 건 가운데 속도와 비용이 함께 내려가는 것은 Gemini 3.7 Flash와 Muse Glimmer뿐이고, 이 둘은 애초에 모델을 바꾸는 방식입니다.

Ultrafast와 Fast mode는 같은 모델을 빨리 돌리는 대신 더 비싼 단가를 받습니다. Fast mode는 공식 문서 기준으로 표준의 두 배이고, 속도를 오가면 프롬프트 캐시까지 다시 채워집니다. 캐시로 아끼던 금액이 함께 사라질 수 있으므로, 빨라진 시간으로 얻는 것이 추가 비용보다 큰 작업에만 쓰는 편이 맞겠습니다.

어떤 방식을 먼저 시험해 보면 좋을까요?

승인 없이 지금 바로 확인할 수 있는 쪽부터 보는 것이 순서입니다. Gemini 3.7 Flash는 일반 공개되어 있어 평소 작업을 그대로 넣어 볼 수 있고, Muse Glimmer는 가중치가 공개되어 있어 GPU 조건만 맞으면 로컬에서 돌려 볼 수 있습니다.

Ultrafast와 Fast mode는 접근 신청이 필요합니다. 신청과 함께 지금 쓰는 모델의 작업 시간부터 재 두면 좋습니다. 그 가운데 모델이 토큰을 만드는 구간이 몇 퍼센트인지 알아 두면, 승인이 났을 때 비교할 기준이 이미 준비된 상태가 됩니다.

3줄 요약:

  • 2026년 8월 둘째 주에 나온 네 건은 모두 속도를 다루지만 방법이 다릅니다. Ultrafast는 Cerebras 칩으로, Gemini 3.7 Flash는 가벼운 모델로, Fast mode는 실행 설정으로, Muse Glimmer는 예측 디코딩으로 속도를 얻습니다.
  • 발표된 배수는 토큰을 만드는 구간만의 값입니다. GDP-Val 측정에서 Ultrafast는 토큰 생성 기준 최대 14배였지만 작업 전체 시간으로는 5.6배였습니다.
  • Gemini 3.7 Flash의 100만 토큰당 $0.75와 $3.75는 3.6 Flash가 나왔을 때의 절반이지만, 2026년 12월 31일까지만 적용되는 도입가입니다. 2027년부터 두 배가 되므로 예산에 함께 넣어야 합니다.

Sources:

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

디지털마케터 뉴스레터

GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.

다음으로 읽어볼 글

메타 뮤즈 글리머 로컬 실행 조건과 벤치마크 정리 썸네일
AI & Tech메타 뮤즈 글리머 로컬 실행 조건과 벤치마크 정리

뮤즈 글리머(Muse Glimmer)는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 오픈 웨이트 에이전트 모델입니다. 개인 컴퓨터 한 대에서 돌리는 것을 목표로 만들어졌고, 필요한 메모리와 실제 초당 토큰 수, 앞서는 항목과 뒤지는 항목을 공식 자료 기준으로 정리했습니다.

2026. 8. 14.
딥시크 V4 프로 정식 출시와 100만 토큰 컨텍스트 가격 정리 썸네일
AI & Tech딥시크 V4 프로 정식 출시와 100만 토큰 컨텍스트 가격 정리

딥시크 V4 프로는 딥시크가 2026년 8월 12일 프리뷰를 끝내고 정식 버전으로 전환한 플래그십 모델입니다. 1.6조 파라미터 구조와 100만 토큰 컨텍스트, 압축 어텐션이 비용을 낮추는 방식, 공식 벤치마크의 비교 대상, 그리고 예고된 가격 인상까지 공식 문서 기준으로 정리했습니다.

2026. 8. 13.
OpenAI 사이버보안 이니셔티브 Daybreak 확장과 GPT-5.6-Cyber 공개 정리 썸네일
AI & TechOpenAI 사이버보안 이니셔티브 Daybreak 확장과 GPT-5.6-Cyber 공개 정리

OpenAI가 2026년 8월 10일 사이버보안 이니셔티브 Daybreak를 Blue와 Red 두 티어로 확장하고, 인가된 방어팀 전용 모델 GPT-5.6-Cyber를 공개했습니다. 두 티어의 차이와 접근 조건, 안전장치를 정리합니다.

2026. 8. 11.
RAG와 파인튜닝 차이: 고르는 기준 다섯 가지와 GraphRAG 썸네일
AI & TechRAG와 파인튜닝 차이: 고르는 기준 다섯 가지와 GraphRAG

RAG는 모델이 답하기 전에 학습 데이터 밖의 자료를 찾아 참고하게 만드는 방식이고, 파인튜닝은 예시를 학습시켜 모델이 답하는 방식을 바꾸는 작업입니다. 두 방식이 각각 무엇을 바꾸는지와 고르는 기준을 공식 문서 기준으로 정리합니다.

2026. 8. 8.
퀴즈

모델 제공사가 발표하는 속도 배수를 실무 예산과 일정에 반영할 때 가장 먼저 확인해야 할 것은 무엇일까요?

같은 주제 글

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기