AI & Tech

제미나이 3.8 플래시와 3.8 플래시 사이버 공개, 달라진 점과 가격 정리

제미나이 3.8 플래시(Gemini 3.8 Flash)는 구글이 2026년 9월 2일 공개한 코딩과 에이전트 작업용 모델입니다. 3.7 플래시와 같은 가격에 벤치마크가 얼마나 올랐는지, 토큰을 더 쓰는 설계가 비용에 무엇을 뜻하는지, 보안 전용 3.8 플래시 사이버는 누가 쓸 수 있는지를 공식 자료 기준으로 정리했습니다.

2026. 9. 3.22
Share
제미나이 3.8 플래시와 3.8 플래시 사이버 공개, 달라진 점과 가격 정리 대표 이미지

3줄 요약

이번 방문에서 한 편은 바로 볼 수 있습니다.

제미나이 3.8 플래시(Gemini 3.8 Flash)는 구글이 2026년 9월 2일 공개한 코딩과 에이전트 작업용 모델입니다. 3주 전에 나온 3.7 플래시의 다음 판이고, 6주 사이에 세 번째로 나온 플래시입니다. 같은 날 보안 작업 전용으로 안전장치를 다르게 건 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)도 함께 나왔습니다.

플래시라는 이름부터 풀고 가겠습니다. 구글은 제미나이 모델을 크기와 용도로 나눠 내놓는데, 플래시는 그 가운데 빠르고 싼 등급입니다. 가장 큰 프로 등급보다 답이 빨리 나오고 단가가 낮아서, 같은 일을 하루에 수백 번 돌리는 자동화 작업에 주로 쓰입니다. 그래서 플래시 판이 바뀌면 성능만이 아니라 그 작업의 월 청구액이 함께 바뀝니다.

플래시 모델이 자주 바뀐다는 것은 이제 익숙한 이야기입니다. 그런데 이번 판은 가격표가 그대로인 대신 모델이 일하는 방식이 달라졌습니다. 구글은 발표문에서 3.8 플래시가 어려운 작업에서 추론 단계를 더 밟고 도구를 더 자주 부르며, 그만큼 토큰을 더 쓸 수 있다고 적었습니다. 단가만 보고 옮기면 청구액이 예상과 어긋날 수 있는 대목입니다.

지금부터 공식 발표문과 함께 실린 비교표를 근거로 무엇이 달라졌는지, 비용은 어떻게 계산해야 하는지, 사이버 모델은 누가 쓸 수 있는지 정리하겠습니다. 3.7 플래시가 나왔을 때의 내용은 준이아빠블로그의 제미나이 3.7 플래시와 GPT-5.6 울트라패스트 정리에 있습니다. 2026년 9월 3일 기준입니다.

한눈에 보는 변경 사항

항목내용
공개일2026년 9월 2일
변형3.8 플래시(범용), 3.8 플래시 사이버(보안 전용)
가격100만 토큰당 입력 0.75달러, 출력 3.75달러. 3.7 플래시와 동일
도입가 기한2026년 12월 31일까지. 2027년 1월 1일부터 입력 1.50달러, 출력 7.50달러
3.7 플래시계속 지원. 효율이 우선인 작업용으로 남김
쓸 수 있는 곳Gemini API(AI Studio), Android Studio, Antigravity, Stitch, Gemini Enterprise, 제미나이 앱(Pro와 Ultra 구독), 검색 AI 모드, 구글 시트
사이버 모델 접근페어윈드(Fairwind) 프로그램 신청을 거친 기관만

가격 줄은 3.7 플래시 글에서 짚었던 조건이 그대로 이어집니다. 지금 단가는 도입가이고 내년부터 두 배가 됩니다. 두 모델의 도입가 기한이 같으므로, 2027년 예산은 어느 쪽을 쓰든 정가 기준으로 잡아야 계산이 맞습니다.

벤치마크로 본 3.7 플래시와의 차이

벤치마크 이름은 모델 이름보다 상대적으로 낯설 수 있습니다. 쉽게 말하면 벤치마크는 모델에게 같은 시험지를 주고 채점한 결과이고, 시험마다 재는 능력이 다릅니다. 표에 나오는 이름을 먼저 풀면 다음과 같습니다.

  • DeepSWE: 실제 코드 저장소에서 버그 수정 같은 과제를 받아 혼자 끝까지 해내는지 봅니다.
  • Terminal-bench: 터미널 명령으로 일을 처리하는 능력입니다. 2.1은 코딩 위주, 4.0은 더 넓은 범위의 작업입니다.
  • OSWorld: 컴퓨터 화면을 직접 보고 클릭하며 일을 끝내는 능력입니다.
  • HLE-Verified: 여러 분야 전문가가 낸 어려운 문제 모음입니다.
  • Vals Finance, Harvey's Legal: 재무 분석과 법률 업무를 흉내 낸 과제입니다.
  • GDPVal-AA: 지식 업무 결과물을 사람이 비교해 매긴 점수(Elo)입니다. 점수가 높을수록 비교에서 더 자주 이긴 쪽입니다.

발표문에 실린 비교표에서 3.7 플래시 대비 변화가 큰 항목만 옮겼습니다. 비교 대상으로 함께 실린 클로드 오퍼스 5와 GPT-5.6 Sol 값도 넣었습니다. 전부 구글이 직접 낸 수치이고, 측정 방법은 딥마인드 평가 방법론 페이지에 있습니다.

평가 항목3.8 플래시3.7 플래시클로드 오퍼스 5GPT-5.6 Sol
DeepSWE v1.1 (장기 소프트웨어 엔지니어링)73.7%65.3%74.0%72.7%
Terminal-bench 2.1 (에이전트 터미널 코딩)89.4%85.8%89.1%88.8%
Terminal-bench 4.0 (범용 에이전트 능력)19.1%11.2%51.8%37.3%
OSWorld-2.0 (컴퓨터 사용)59.0%50.6%75.4%62.6%
HLE-Verified (다분야 전문가 추론)54.9%53.6%54.4%54.5%
Vals Finance Agent v2 (재무 분석)61.4%59.0%58.6%53.8%
Harvey's Legal Agent Benchmark (법률 업무)10.0%8.8%6.7%2.5%
GDPVal-AA v2 (지식 업무, Elo)1545148218241710

표에서 볼 것은 세 가지입니다.

  • 코딩과 재무, 법률 업무에서 상위 모델과 같은 줄에 섰습니다. DeepSWE는 오퍼스 5와 0.3%포인트 차이이고, 재무와 법률 벤치마크는 비교 대상을 모두 앞섰습니다. 단가가 오퍼스 5의 7분의 1 수준이라는 점을 감안하면 이 줄이 이번 발표의 핵심입니다.
  • 범용 에이전트와 컴퓨터 사용에서는 격차가 남아 있습니다. Terminal-bench 4.0은 오퍼스 5의 절반 밑이고, OSWorld-2.0도 16%포인트 뒤집니다. 화면을 직접 다루는 작업까지 맡기려면 아직 상위 모델 쪽입니다.
  • 지식 업무 Elo는 올랐지만 순위가 바뀌지는 않았습니다. 1482에서 1545로 올랐어도 오퍼스 5와 GPT-5.6 Sol이 여전히 앞에 있습니다.

제미나이 3.8 플래시는 3.7 플래시와 같은 단가에서 DeepSWE v1.1 점수를 65.3%에서 73.7%로 올려 클로드 오퍼스 5의 74.0%에 근접했습니다.

Q. 3.7 플래시를 쓰던 API 코드는 바꿔야 하나요? A. 바꾸지 않아도 됩니다. 구글은 3.7 플래시를 효율 우선 작업용으로 계속 지원한다고 밝혔습니다. 3.8로 옮길 때는 모델 이름만 바꾸면 되지만, 아래에서 설명하는 토큰 사용량 차이를 먼저 확인하는 편이 안전합니다.

같은 단가에서 토큰을 더 쓰는 설계

이번 발표에서 가격표보다 눈여겨볼 대목은 성능이 어디서 왔는지 설명한 문장입니다. 구글은 3.8 플래시가 "더 열심히 일한다"고 표현했습니다. 복잡한 작업에서 추론 단계를 추가로 밟고 도구를 반복해서 호출하며, 특히 effort를 높게 두면 토큰을 더 쓸 수 있다고 적었습니다.

여기서 두 단어를 풀어 두겠습니다. 토큰은 모델이 글을 읽고 쓸 때 세는 단위로, 한국어 한 글자나 영어 단어 하나가 토큰 한두 개쯤입니다. API 요금은 이 토큰 수에 단가를 곱해 청구됩니다. effort는 모델이 답을 내기 전에 얼마나 오래 생각할지 정하는 설정값이고, 높일수록 답이 꼼꼼해지는 대신 토큰을 더 씁니다.

시간당 요금이 같은 사람에게 일을 맡겼는데 전보다 오래 붙잡고 꼼꼼히 한다면 청구서는 길어지듯, 단가가 같아도 작업당 토큰이 늘면 청구액은 오릅니다. 그래서 구글도 같은 문단에서 두 가지 대안을 함께 안내했습니다.

  • effort를 낮춥니다. 계산 효율이 우선인 작업은 낮은 effort로 돌려 토큰 부담을 줄입니다.
  • 3.7 플래시를 그대로 씁니다. 효율 우선 작업용으로 3.7 플래시 지원이 이어집니다.

숫자로 보면 판단이 쉬워집니다. 한 번에 입력 5만 토큰, 출력 8천 토큰이 나가는 코드 수정 작업을 하루 200회 돌린다고 가정하겠습니다.

조건입력 비용출력 비용하루 합계
3.7 플래시1,000만 토큰 × 0.75달러 = 7.5달러160만 토큰 × 3.75달러 = 6달러13.5달러
3.8 플래시, 출력 토큰이 30% 늘 때7.5달러208만 토큰 × 3.75달러 = 7.8달러15.3달러
3.8 플래시, 2027년 정가15달러208만 토큰 × 7.50달러 = 15.6달러30.6달러

30%는 설명용 가정이고 실제 증가 폭은 작업마다 다릅니다. 이 표에서 볼 것은 두 가지입니다. 같은 단가에서도 토큰이 늘면 청구액이 따라 오르고, 내년 정가 전환이 그 위에 곱해집니다. 옮기기 전에 같은 작업 20건쯤을 두 모델로 돌려 청구 토큰을 나란히 놓아 보는 순서가 맞습니다.

3.8 플래시의 청구액 차이는 단가가 아니라 작업당 토큰 사용량에서 나옵니다. 구글은 효율이 우선이면 effort를 낮추거나 3.7 플래시를 쓰라고 안내합니다.

3.8 플래시 사이버, 취약점 탐지와 패치 생성 전용

3.8 플래시 사이버는 같은 기반 모델에 사이버보안 안전장치를 다르게 건 판입니다. 안전장치는 모델이 위험한 요청을 거절하도록 걸어 둔 제한을 말하는데, 범용 판은 해킹에 쓰일 만한 요청을 넓게 거절하고 사이버 판은 보안 담당자가 쓸 수 있도록 그 제한을 일부 풉니다. 구글은 공격보다 방어를 앞세워, 취약점을 찾는 능력과 함께 고치는 능력에 먼저 투자했다고 밝혔습니다.

공개된 수치는 다음과 같습니다.

  • 취약점 발견: C와 C++ 코드베이스를 대상으로 하는 CyberGym에서 86.2%를 기록했습니다. 직전 보안 모델인 3.5 플래시 사이버의 77.5%, GPT-5.5-Cyber의 85.6%, 미토스 5의 83.8%보다 높습니다.
  • 20개 언어 내부 평가: C 계열에 한정된 CyberGym을 보완하려고 구글이 만든 내부 벤치마크에서 성공률 70%를 넘었다고 밝혔습니다. 내부 평가라 제3자가 재현한 값은 아닙니다.
  • 패치 생성: 외부 벤치마크 CWE-Bench에서 pass@1 47.2%로, 선두 모델의 47.8%에 근접하면서 실행당 비용은 훨씬 낮습니다. pass@1은 한 번 시도해서 맞힌 비율입니다.

위 산점도는 정확도와 비용을 함께 놓은 그래프입니다. 페이블 5가 정확도는 조금 앞서지만 실행당 비용이 10달러 부근이고, 3.8 플래시 사이버는 3달러대에서 거의 같은 정확도를 냅니다. 보안 팀이 취약점 후보 수백 건을 돌리는 작업이라면 이 차이가 곧 예산입니다.

구글 내부와 파트너가 밝힌 사례도 있습니다. 크롬 보안팀은 크롬 취약점에서 훨씬 큰 상용 모델보다 2.6배 많은 정상 패치를 만들었다고 했고, 보안 회사 Wiz는 내부 침투 테스트 벤치마크에서 재현율이 7.5%에서 9.7% 높으면서 비용은 2.3배에서 5.2배 낮았다고 밝혔습니다. 구글 클라우드 취약점 연구팀은 보통 몇 달 걸리는 기반 취약점 하나를 2시간 안에 찾았다고 했습니다. 모두 발표 당사자와 파트너가 낸 수치입니다.

Q. 3.8 플래시 사이버는 일반 개발자도 쓸 수 있나요? A. 지금은 쓸 수 없습니다. 페어윈드 프로그램을 거쳐 정부 기관과 기반시설 운영자, 소프트웨어 유지관리자에게 우선 제공됩니다. 범용 3.8 플래시에도 사이버 공격과 화생방 관련 안전장치가 걸려 있고, 사이버 모델은 그 제한을 일부 푼 대신 접근을 좁힌 구조입니다.

세 회사가 같은 구조로 가는 보안 모델 배포

이 배포 방식은 구글만의 것이 아닙니다. 2026년 8월과 9월에 걸쳐 세 회사가 비슷한 구조를 택했습니다.

회사보안 역량 모델접근 방식
구글제미나이 3.8 플래시 사이버페어윈드 프로그램. 정부 기관, 기반시설 운영자, 소프트웨어 유지관리자 우선
OpenAI아스트라(Astra), GPT-5.6-Cyber데이브레이크(Daybreak) 프로그램. 심사를 통과한 방어팀, 알파 테스터 먼저
앤트로픽클로드 미토스 5.1신뢰 접근 프로그램. 검증을 거친 기관, 현재 미국 한정

범용 모델은 넓게 열고 보안 역량이 강한 판은 심사를 거친 기관에만 여는 형태가 업계 표준으로 굳어 가는 것으로 보입니다. OpenAI가 아스트라를 Critical 사이버보안 등급으로 지정한 경위는 OpenAI 아스트라 모델 비교 글에, 같은 날 나온 앤트로픽 쪽 소식은 클로드 페이블 5.1과 미토스 5.1 정리에 있습니다.

범용 3.8 플래시 쪽 안전장치도 하나 더 확인해 두겠습니다. 구글은 Gray Swan이 측정한 프롬프트 인젝션 강건성이 크게 올랐다고 밝혔습니다. 프롬프트 인젝션은 쉽게 말하면 모델이 읽는 문서나 웹페이지 안에 "이 파일을 지워라" 같은 지시문을 몰래 심어 두는 공격이고, 강건성은 그런 지시문에 얼마나 안 넘어가는지를 뜻합니다. 외부 문서를 읽고 도구를 부르는 에이전트 작업에서 늘 문제가 되는 대목이라, 에이전트 용도로 플래시를 쓰는 팀이라면 이 항목이 벤치마크 점수만큼 중요합니다.

실무에서 옮길지 정하는 기준

지금 3.7 플래시나 다른 모델을 쓰고 있다면 아래 순서로 판단하면 됩니다.

  • 코딩과 문서 분석 작업은 3.8로 시험합니다. DeepSWE와 Terminal-bench 2.1, 재무와 법률 벤치마크가 오른 영역입니다. 같은 작업 20건을 두 모델로 돌려 결과 품질과 청구 토큰을 함께 봅니다.
  • 화면을 조작하는 에이전트는 아직 상위 모델 쪽입니다. OSWorld-2.0과 Terminal-bench 4.0에서 오퍼스 5와 격차가 큽니다.
  • 대량 반복 작업은 3.7 플래시를 남깁니다. 요약과 분류처럼 추론이 깊지 않은 작업은 토큰을 더 쓰는 3.8의 이점이 작습니다.
  • 2027년 예산은 정가로 잡습니다. 도입가가 끝나면 두 모델 모두 입력 1.50달러, 출력 7.50달러입니다.

3줄 요약:

  • 제미나이 3.8 플래시는 구글이 2026년 9월 2일 공개한 코딩과 에이전트 작업용 모델이고 3.7 플래시와 같은 100만 토큰당 입력 0.75달러, 출력 3.75달러입니다.
  • DeepSWE v1.1이 65.3%에서 73.7%로, HLE-Verified가 53.6%에서 54.9%로 올랐지만 어려운 작업에서 토큰을 더 쓰는 설계라 청구액은 단가가 아니라 사용량에서 달라집니다.
  • 보안 전용 3.8 플래시 사이버는 CWE-Bench 47.2%로 페이블 5의 47.8%에 근접하면서 비용이 낮고, 페어윈드 프로그램을 거친 정부 기관과 기반시설 운영자, 소프트웨어 유지관리자에게만 열립니다.

Sources

이 글이 도움이 되셨다면 공유해 주세요

메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Author

Written by

데이터로 설명하는 마케터

퀴즈

제미나이 3.8 플래시를 3.7 플래시 대신 쓰기로 할 때 비용에서 먼저 확인할 것은 무엇일까요?

이 글이 도움이 되었나요?

다음 단계

이어서 읽기 좋은 글

제미나이 3.7 플래시와 GPT-5.6 울트라패스트, AI 속도 발표 4건 정리

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 나온 네 건의 발표를 놓고 각각이 속도를 어디서 얻는지, 발표된 배수가 실제 작업 시간에서 어떻게 줄어드는지를 공식 자료 기준으로 정리했습니다.

다음 글 읽기

같이 보면 좋은 글

클로드 페이블 5.1과 미토스 5.1 공개, 달라진 점 정리 썸네일
AI & Tech클로드 페이블 5.1과 미토스 5.1 공개, 달라진 점 정리

클로드 페이블 5.1은 앤트로픽이 2026년 9월 1일 공개한 코딩과 지식 업무용 상위 모델입니다. 벤치마크 변화와 캐시 읽기 75% 인하, 안전장치 완화, 플랜별 이용 조건, 클로드 코드에서 바꾸는 방법을 공식 자료 기준으로 정리했습니다.

2026. 9. 2.
OpenAI의 야심작, 아스트라(Astra) 얼마나 뛰어난 걸까? 다른 모델과의 비교 썸네일
AI & TechOpenAI의 야심작, 아스트라(Astra) 얼마나 뛰어난 걸까? 다른 모델과의 비교

아스트라(Astra)는 OpenAI가 다음 주요 모델 계열로 예고한 이름입니다. 2026년 8월 1일 공개된 수학 난제 10건과 2026년 9월 1일 나온 Critical 사이버보안 임계 판정까지, 확인된 사실만 추려 지금 쓸 수 있는 모델들과 무엇이 다른지 정리했습니다.

2026. 8. 3.
Aside는 Playwright MCP, 클로드 인 크롬과 뭐가 다를까요? 썸네일
AI & TechAside는 Playwright MCP, 클로드 인 크롬과 뭐가 다를까요?

Aside는 크로미움 엔진을 직접 고쳐 에이전트를 브라우저 안에 넣은 AI 브라우저입니다. CDP로 바깥에서 붙는 Playwright MCP와 chrome-devtools-mcp, 크롬 확장인 Claude in Chrome과 무엇이 다른지 자동화 탐지와 화면 읽는 시점, 자격 증명 처리로 나눠 정리했습니다.

2026. 8. 31.
클로드 코드 CLAUDE.md 세팅, 알려진 노하우들과 공식 문서 업데이트 정리 썸네일
AI & Tech클로드 코드 CLAUDE.md 세팅, 알려진 노하우들과 공식 문서 업데이트 정리

CLAUDE.md는 클로드 코드가 세션마다 읽는 지시 파일입니다. 권장 길이 300줄, 절대 금지 섹션, 9월 모델 가격 인상처럼 널리 도는 이야기를 앤트로픽 공식 문서와 하나씩 맞춰 정리했습니다. 2026년 8월 28일 기준입니다.

2026. 8. 28.

ADVERTISEMENT

이 글의 학습 경로

글 전체 보기

관련 개념

무료 셀프 교육으로 배워보세요

코스 전체 보기