2026년 8월 13일 GA로 풀린 구글 신형 모델의 실제 단가·벤치마크·API 변경점을 공식 문서와 대조했습니다. 발표문의 ‘반값’과 ‘가장 똑똑한’이 어디까지 사실인지, 갈아탈 때 깨지는 설정은 무엇인지 정리합니다.
Gemini 3.7 Flash 개요

구글이 2026년 8월 13일 Gemini 3.7 Flash를 GA(정식 출시)로 공개했습니다. 모델 ID는 gemini-3.7-flash, 같은 날 Gemini API 릴리즈 노트에 정식 등재됐습니다. 눈에 띄는 건 직전 모델인 3.6 Flash가 2026년 7월 21일에 나왔다는 점입니다. 두 모델의 출시 간격이 불과 3주입니다.
이 짧은 간격의 답은 구글이 직접 쓴 모델카드에 있습니다. DeepMind 모델카드는 3.7 Flash를 Gemini 3 제품군의 다음 반복이며 “추론 기반부의 알고리즘 개선”이 특징이라고 적었습니다. 처음부터 새로 사전학습한 모델이 아니라, 기존 기반 위에서 추론 방식을 손본 개선판이라는 뜻입니다. 3주 만에 새 번호가 붙은 배경이 여기 있습니다.
문제는 발표문과 실제 문서 사이의 간극입니다. 구글은 “3.6 Flash 원가의 절반”과 “가장 지능적인 워크호스 모델”을 내세웠지만, 2026년 8월 17일 확인 시점에 공식 가격표를 열어보면 3.6 Flash도 단가가 같습니다. 이 글에서는 공식 문서와 제3자 측정치를 대조해, 실제로 달라진 것과 마케팅 표현을 구분합니다. 특히 API를 직접 쓰는 개발자가 마이그레이션 때 반드시 확인해야 할 파괴적 변경(breaking change) 한 가지를 짚습니다.
1. 스펙과 API 변경점: 이 사라졌다

먼저 기본 사양입니다. 입력 토큰 한도는 1,048,576개(약 100만), 출력 토큰 한도는 65,536개입니다. 지식 컷오프는 2026년 3월, 다만 모델카드는 일부 도메인은 2025년 1월까지로 제한된다고 명시합니다. 최신 정보가 필요한 작업이라면 Search grounding 병행이 사실상 필수입니다.
가장 중요한 변경은 추론 강도 제어 방식입니다.
| 항목 | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|
| 추론 강도 제어 | thinking_budget (숫자) |
thinking_level (문자열 enum) |
| 지원 단계 | minimal 포함 | low / medium / high 3단계만 |
| 기본값 | — | medium |
| temperature / top_p / top_k | 사용 | 생성 설정에서 제거 대상 |
thinking_level: minimal은 3.7 Flash에서 지원되지 않습니다. 3.6에서 minimal로 돌리던 요청을 그대로 3.7에 넘기면 깨집니다. 이번 마이그레이션에서 유일하게 명확한 파괴적 변경입니다. 실시간 채팅 응답, 인시던트 자동 대응처럼 지연 예산이 빡빡한 파이프라인이 minimal에 의존해왔다면, low 단계로 내려도 목표 지연을 맞추는지 먼저 재봐야 합니다.
여기에 더해 구글 공식 마이그레이션 문서는 ·top_p·top_k를 생성 설정에서 제거하라고 안내합니다. 기본값 medium은 문서상 “대부분의 작업에 최적 품질”로 설명되므로, 별도 튜닝 없이 전환하면 medium으로 동작합니다.
지원 기능도 확인이 필요합니다. 캐싱·코드 실행·File search·Function calling·Google Maps grounding·Search grounding·Structured outputs·URL context·Batch API·Flex·Priority 추론이 지원되고, Computer use는 Preview 단계입니다. 반면 오디오 생성, 이미지 생성, Live API는 미지원입니다. 음성 대화형 서비스를 구상 중이라면 이 세 가지가 빠졌다는 점을 설계 초기에 반영해야 합니다.
2. 가격: “절반”은 반쯤만 맞는 말입니다

이번 발표에서 가장 오해를 부르는 지점입니다. 아래는 2026년 8월 17일 공식 가격 페이지 확인 시점 수치입니다.
| 구분 | 도입가 (~2026.12.31) | 2027.01.01 이후 |
|---|---|---|
| 입력 100만 토큰 | $0.75 | $1.50 |
| 출력 100만 토큰 | $3.75 | $7.50 |
| 컨텍스트 캐싱 | $0.075 | $0.15 |
| Gemini 3.6 Flash 입력 | $0.75 (동일) | — |
| Gemini 3.6 Flash 출력 | $3.75 (동일) | — |
핵심은 마지막 두 줄입니다. 같은 가격표에서 Gemini 3.6 Flash도 입력 $0.75 / 출력 $3.75로 표기돼 있습니다(2026년 8월 17일 기준, 서로 다른 두 차례 조회에서 같은 결과 확인). 3.6 Flash도 같은 도입 가격으로 내려온 상태입니다.
2026년 8월 17일 기준으로 3.6에서 3.7로 갈아타도 토큰 단가상의 이득은 0입니다. “원가의 절반”이라는 표현은 3.6 Flash의 출시 당시 가격이었던 $1.50 / $7.50과 비교할 때만 성립합니다. 3.6 Flash는 2026년 7월 21일 발표 당시 입력 100만 토큰당 $1.50, 출력 $7.50으로 공지됐습니다.
예산 계획에서 더 중요한 건 도입가 종료 시점입니다. 2026년 12월 31일에 프로모션이 끝나고 2027년 1월 1일부터 정확히 두 배가 됩니다. 연간 예산을 짠다면 12월까지 $0.75/$3.75, 1월부터 $1.50/$7.50 두 구간으로 나눠 계산해야 합니다. 해커뉴스에는 “다섯 달 뒤에도 이 모델을 쓰고 있을 사람이 있겠나”는 냉소적 반응도 나왔습니다(2026년 8월 17일 확인, 커뮤니티 의견이며 공식 확인 자료가 아닙니다).
부가 항목도 정리합니다. Search grounding은 Gemini 3.x 전체 공유로 월 5,000회 무료, 초과분은 1,000회당 $14입니다. 배치 처리는 입출력 모두 50% 할인됩니다. 대량 비동기 작업이라면 배치 경로를 먼저 검토하는 편이 유리합니다.
미확인 사항이 하나 있습니다. Cursor 공식 문서는 출력 단가를 $3.50으로 표기해 구글 공식가 $3.75와 다릅니다(2026년 8월 17일, 2회 교차 조회에서 동일). 오기인지 재판매 단가 차이인지는 이번 조사에서 확인하지 못했습니다.
3. 벤치마크: 자사 수치와 제3자 지수가 갈립니다

구글이 발표문에 실은 자사 벤치마크는 개선폭이 큽니다.
| 벤치마크 | 3.7 Flash | 3.6 Flash | 차이 |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2%p |
| DeepSWE v1.1 | 65.3% | 49.0% | +16.3%p |
| WebDev Arena (Elo) | 1588 | 1538 | +50 |
| GDP.pdf | 34.0% | 22.0% | +12.0%p |
| AutomationBench | 30.4% | 17.0% | +13.4%p |
모델카드에는 Terminal-bench 2.1 85.8%, GDM-MRCR v2(128k) 97.0%, Harvey LAB-AA 90.7% 수치도 추가로 실렸습니다.
다만 이 표를 그대로 믿기 어려운 이유가 있습니다. GDP.pdf·AutomationBench·FrontierCode 1.1이 공개 표준 벤치마크인지 구글 내부 평가인지를 공식 자료에서 확인하지 못했습니다.
제3자 측정으로 넘어가면 그림이 달라집니다. Artificial Analysis Intelligence Index v4.1.1 기준, 3.7 Flash(high)는 56점으로 3.6 Flash보다 4점 올랐습니다(medium 53, low 51). 그러나 같은 지수에서 GPT-5.6 Terra(max) 57점, Muse Spark 1.2(xhigh) 57점에 1점 차로 뒤진 3위권입니다.
“가장 지능적인 워크호스 모델”이라는 표현은 구글 자사 제품군 내부 순위일 때만 성립합니다. 대신 3.7 Flash가 확실히 앞서는 축이 있습니다. 평균 Time per Task 1.7분으로 GPT-5.6 Terra(max)보다 40% 빠르고, 출력 속도는 약 340 tok/s로 Terra 및 GLM-5.2의 약 3배입니다. 지수 1과제당 비용은 $0.40으로 3.6 Flash보다 30% 저렴합니다. 단가가 같은데도 과제당 비용이 줄었다는 건 같은 결과를 더 적은 토큰으로 낸다는 뜻입니다.
WebDev Arena Elo 1588도 주의가 필요합니다. 발표 시점 예비(preliminary) 집계이며 표본 2,544표 수준으로 보고됐습니다. 아레나 점수는 투표가 쌓이며 움직입니다(원 리더보드 페이지는 직접 대조하지 못했습니다).
4. “오늘부터 사용 가능”의 실제 조건

발표문의 GA 표기를 배포 계획의 근거로 삼으면 곤란합니다. 채널별 실제 조건은 다음과 같습니다.
| 채널 | 실제 조건 |
|---|---|
| 개발자 | Google AI Studio, Android Studio, Google Antigravity |
| 기업(웹) | global·us·eu 리전 한정 + 관리자 토글 필수 |
| 기업(모바일) | 8/13 “미제공”으로 정정 → 8/14 GA |
| 개인 | Gemini 앱 Spark 기능 + AI Pro/Ultra 구독자, 160개국 이상 |
| 검색 AI Mode | 영어 + AI Pro/Ultra 구독자 한정 |
Gemini Enterprise 릴리즈 노트에는 정정 항목이 남아 있습니다. 8월 13일자로 “Gemini 3.7 Flash는 Gemini Enterprise 모바일 앱에서 사용할 수 없다”로 정정됐고, 하루 뒤인 8월 14일에야 모바일 앱 GA가 별도 공지됐습니다(역시 관리자 토글 필요). 웹 역시 관리자가 “Gemini 3.7 Flash” 기능 토글을 켜야 사용자에게 노출되며, 워크플로 에이전트 반영에는 최대 1일의 전파 지연이 있습니다.
개인 사용자 쪽도 오해하기 쉽습니다. 제미나이 앱에서 3.7 Flash를 쓰려면 Spark 기능 안에서, 유료 AI Pro 또는 Ultra 구독자여야 하고, 8월 13일 시점에는 순차 롤아웃 상태였습니다. 무료 사용자는 대상이 아닙니다. 8월 14일부터는 구글 검색 AI Mode에도 투입됐지만 영어·유료 구독자 한정이며 “Ask anything” 바의 모델 메뉴에서 고르는 방식입니다(다만 이 발표의 1차 근거인 구글 검색 제품 VP의 게시물 원문은 대조하지 못했습니다).
안전성 쪽은 Frontier Safety 평가에서 CBRN·사이버보안·유해 조작·ML R&D 영역 모두 임계 역량 수준에 도달하지 않았다고 적혀 있습니다. 반면 모델카드가 스스로 밝힌 한계에는 “간헐적인 속도 저하 또는 타임아웃 문제”가 들어 있습니다.
5. 갈아탈까 말까: 상황별 판단과 FAQ

Q. 지금 3.6에서 3.7로 옮겨야 합니까?
가격만 보면 옮길 이유가 없고, 성능만 보면 옮길 이유가 있습니다. 2026년 8월 17일 기준 단가가 같으므로 판단은 순수하게 품질 대비 전환 비용 문제입니다. 독립 지수 +4점, 자사 DeepSWE +16.3%p, 과제당 비용 30% 감소를 얻는 대신 파라미터 정리 작업이 듭니다. 대부분의 워크로드에서는 사실상 무료 업그레이드입니다.
Q. 옮기지 말아야 할 경우는 언제입니까?
thinking_level: minimal에 의존하는 저지연 파이프라인입니다. 3.7은 이 단계를 지원하지 않으니, low로도 지연 예산을 못 맞춘다면 3.6 유지가 합리적입니다. 다만 3.6 Flash의 지원 종료(deprecation) 일정은 공식 공지가 없어 확인하지 못했습니다. 무기한 유지를 전제로 설계하는 건 위험합니다.
Q. GPT-5.6 Terra와 비교하면 어떻습니까?
종합 지수는 57 대 56으로 Terra가 근소 우위이나, 3.7 Flash는 과제당 시간이 40% 짧고 출력 속도가 약 3배입니다. 지능 최상단이 필요하면 Terra, 처리량·응답시간이 지배적이면 3.7 Flash가 맞습니다. 다만 OpenAI 측 공식 가격은 이번 조사에서 확인하지 못해 비용 비교는 하지 않습니다.
Q. 커뮤니티 실사용 반응은 어떻습니까?
2026년 8월 17일 확인 기준이며 공식 확인 자료가 아닌 개인 의견임을 전제로 정리하면, 비전·이미지→HTML 변환 작업에서 가격 대비 기대 이상이라는 평가가 있는 반면, UI 생성은 여전히 Claude Opus 5가 낫다는 비교가 반복됩니다. API 키 발급과 온보딩 마찰(계정 플래그 지연, AI Studio와 GCP 콘솔 분리)을 두고 나온 불만도 많았습니다. 실서비스 운영 중 계정이 자동 다운그레이드·업그레이드되며 장애가 났다는 개별 사례도 있었으나 소수 보고입니다.
Q. 왜 3주 만에 새 버전이 나왔습니까?
공식적으로는 추론 기반부의 알고리즘 개선입니다. 배경 맥락으로 플래그십 Gemini 3.5 Pro가 코딩 성능 문제로 지연되고 있다는 블룸버그 취재 보도가 있습니다. I/O 2026(5월)에서 6월 출시를 예고했으나 미출시 상태이며, 6월 말 학습 데이터를 갱신했지만 결과가 실망스러웠다는 내용입니다. 다만 3.5 Pro의 현재 상태를 명시한 구글 공식 문서는 찾지 못했고, 3.7 Flash 조기 출시와의 인과관계는 추정일 뿐입니다.
정리
이번 발표에서 실제로 달라진 건 가격이 아니라 성능입니다. 2026년 8월 17일 확인 기준 3.6 Flash도 같은 $0.75/$3.75로 내려왔으므로 비용을 이유로 마이그레이션할 근거는 없고, 파라미터 정리라는 전환 비용은 실재합니다. 그럼에도 독립 지수 +4점, 과제당 비용 30% 감소, 출력 속도 약 3배라는 성능 이득은 충분히 옮길 만합니다.
확인할 건 thinking_level: minimal 의존 여부 하나입니다. 여기에 걸리지 않는다면 전환을 미룰 이유가 없습니다. 마지막으로 2027년 1월 1일부터 단가가 정확히 두 배가 된다는 점을 지금 재무 모델에 반영해두시기 바랍니다.
함께 보면 좋은 글
참고 자료
조사 기준일: 2026년 08월 17일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (원문 대조 완료)
– Introducing Gemini 3.7 Flash — https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ (확인 2026-08-17)
– 제미나이 3.7 플래시를 소개합니다 (한국어판) — https://blog.google/intl/ko-kr/company-news/technology/introducing-gemini-3-7-flash-kr/ (확인 2026-08-17)
– Gemini 3.7 Flash 모델카드 — https://deepmind.google/models/model-cards/gemini-3-7-flash/ (published 2026-08-13, 확인 2026-08-17)
– Gemini 3.7 Flash 모델 페이지 — https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash (확인 2026-08-17)
– What’s new in Gemini 3.7 Flash — https://ai.google.dev/gemini-api/docs/latest-model (확인 2026-08-17)
– Gemini API Pricing — https://ai.google.dev/gemini-api/docs/pricing (확인 2026-08-17, 2회 교차 조회)
– Gemini API Release notes — https://ai.google.dev/gemini-api/docs/changelog (확인 2026-08-17)
– Gemini Enterprise release notes — https://docs.cloud.google.com/gemini/enterprise/docs/release-notes (확인 2026-08-17)
– Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ (2026-07-21, 확인 2026-08-17)
– Gemini 3.6 Flash 모델 페이지 — https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash (확인 2026-08-17)
Tier 2 (원문 대조 완료)
– Artificial Analysis — Gemini 3.7 Flash (high) — https://artificialanalysis.ai/models/gemini-3-7-flash (확인 2026-08-17)
– Artificial Analysis — “On the Intelligence vs. Time per Task Pareto frontier” — https://artificialanalysis.ai/articles/gemini-3-7-time-frontier (확인 2026-08-17)
– 9to5Google — Gemini 3.7 Flash launch — https://9to5google.com/2026/08/13/gemini-3-7-flash-launch/ (확인 2026-08-17)
– 9to5Google — Gemini 3.5 Pro delays (블룸버그 인용) — https://9to5google.com/2026/07/16/gemini-3-5-pro-delays/ (확인 2026-08-17)
– Search Engine Journal — Google Brings Gemini 3.7 Flash To AI Mode In Search — https://www.searchenginejournal.com/google-brings-gemini-3-7-flash-to-ai-mode-in-search/585923/ (확인 2026-08-17)
– Cursor Docs — Gemini 3.7 Flash — https://cursor.com/docs/models/gemini-3-7-flash (확인 2026-08-17, 2회 교차 조회)
Tier 2 (접근 실패 — 인용하지 않음)
– VentureBeat — 50% introductory price cut — https://venturebeat.com/technology/googles-gemini-3-7-flash-targets-coding-and-agents-with-a-50-introductory-price-cut (HTTP 429)
– Axios — Google’s Gemini 3.7 Flash arrives before Gemini 3.5 Pro — https://www.axios.com/2026/08/13/google-gemini-37-flash (HTTP 403)
– Northeast Times — leadership shakeup — https://northeasttimes.com/2026/08/14/google-launches-gemini-3-7-flash-amid-ai-leadership-shakeup/ (HTTP 403)
Tier 3 (수치 근거 아님)
– Hacker News — Gemini 3.7 Flash — https://news.ycombinator.com/item?id=49289112 (확인 2026-08-17)
– Hacker News — Gemini 3.6 Flash — https://news.ycombinator.com/item?id=48993130 (확인 2026-08-17)

답글 남기기