하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

Gemini 3.8 Flash 무엇이 달라졌나, 도입가 종료 전 체크할 것

Gemini 3.8 Flash 무엇이 달라졌나, 도입가 종료 전 체크할 것

작성자

카테고리:

약 15분 소요

2026년 9월 2일 공개된 Gemini 3.8 Flash의 변화를 가격·성능·제약 세 축으로 정리했습니다. 단가는 동결이지만 태스크당 비용은 약 40% 증가했고, 도입가는 2026년 12월 31일 종료됩니다.

Gemini 3.8 Flash 시작 전 확인할 것

Gemini 3.8 Flash 시작 전 확인할 것

Gemini 3.8 Flash에서 실제로 달라진 것은 성능보다 비용 구조입니다. 표시 단가는 100만 입력 토큰당 $0.75, 출력 $3.75로 직전 모델인 3.7 Flash와 같습니다(2026년 9월 8일 기준 Gemini API 가격 문서). 그런데 독립 측정 기관 Artificial Analysis는 인덱스 태스크 1건당 비용이 $0.40에서 $0.58로 약 40% 올랐다고 보고했습니다. 같은 일을 시켜도 모델이 생각을 더 오래 하기 때문입니다. 이 글은 2026년 9월 2일 발표된 Gemini 3.8 Flash가 무엇이 달라졌는지를 가격·벤치마크·제약 세 항목으로 정리했습니다. 경쟁 모델의 공식 가격표는 이번 정리에서 직접 확인하지 못했습니다.

먼저 알아둬야 할 전제가 셋 있습니다. 첫째, 이 모델은 프리뷰나 대기자 명단 없이 곧바로 GA(정식 출시)로 등재됐습니다. Gemini API 변경 이력에 2026년 9월 2일자로 gemini-3.8-flash가 정식 등재된 것이 확인됩니다. 둘째, 함께 발표된 3.8 Flash Cyber 변종은 일반 API로 제공되지 않습니다. 셋째, 지금 보이는 가격은 2026년 12월 31일까지만 유효한 도입가입니다.

일반 사용자라면 API를 직접 쓰지 않아도 이미 이 모델을 접하고 있을 가능성이 큽니다. 배포처가 Google AI Studio, Android Studio, Gemini API, Gemini Enterprise, Gemini 앱, Google 검색 AI 모드, Google 스프레드시트, Antigravity로 넓게 잡혀 있어서입니다. 유료 구독자에게 먼저 열렸다는 보도가 있으나(9to5Google, 2026년 9월 2일), 구독 등급별 순차 적용의 구체적 일정은 공식 확인 자료로 대조하지 못했습니다.

용어 풀이
1. GA(General Availability) — 시험 단계를 끝내고 누구나 정식으로 쓸 수 있게 공개된 상태를 뜻한다.
2. 토큰 — AI가 글을 처리하는 최소 단위로, 한국어는 대략 한 글자가 1개 안팎이며 요금이 이 단위로 매겨진다.
3. 추론(thinking) — 모델이 답을 내기 전에 내부적으로 생각을 정리하는 과정으로, 오래 할수록 정확해지지만 토큰을 더 쓴다.


준비물·필요 서류

준비물·필요 서류

가격과 제약을 먼저 표로 보면 판단이 빠릅니다. 아래 수치는 모두 2026년 9월 8일 기준입니다.

항목 2026년 (도입가) 2027년 1월 1일부터
입력 100만 토큰 $0.75 $1.50
출력 100만 토큰 $3.75 $7.50
컨텍스트 캐싱 $0.075 $0.15
캐시 스토리지(시간당 100만 토큰) $0.50 $1.00
배치 API(50% 할인) $0.375 / $1.875 미고지

검색 그라운딩은 Gemini 3.x 계열이 공유하는 월 5,000회까지 무료이고, 초과분은 1,000회당 $14입니다. 참고로 같은 가격표에서 Gemini 3.7 Flash도 $0.75 / $3.75로 같고, Gemini 3.5 Flash는 할인 없이 $1.50 / $9.00입니다. 3.8 Flash는 직전 모델 대비 인하가 아니라 동결입니다.

기술 사양과 제약은 다음과 같습니다.

사양 내용
입력 컨텍스트 1,048,576 토큰
출력 한도 65,536 토큰
입력 형식 텍스트·이미지·영상·오디오·PDF
출력 형식 텍스트 전용
추론 수준 low·medium·high (minimal 미지원)
지원 도구 코드 실행·함수 호출·file search
computer use 프리뷰 단계
미지원 오디오 생성·이미지 생성·Live API
지식 컷오프 2026년 3월 (일부 도메인 2025년 1월)

도입을 검토한다면 사내에서 준비할 것은 서류가 아니라 숫자입니다. 지난 분기 API 사용량의 입력·출력 토큰 분리 집계, 태스크 1건당 평균 출력 토큰, 응답 지연이 사용자 경험에 미치는 임계값. 이 셋을 미리 뽑아두면 이후 계산이 그대로 굴러갑니다.


단계별 진행 순서

단계별 진행 순서

1단계: 지금 쓰는 모델의 토큰 구조부터 뽑는다 (소요 30분~1시간)
단가가 같으니 요금표만 봐서는 차이가 보이지 않습니다. Artificial Analysis 측정에서 3.8 Flash의 태스크당 출력 토큰은 약 48k로 3.7 대비 30% 늘었습니다. 비교의 기준은 단가가 아니라 “우리 작업 1건이 출력 토큰을 몇 개 쓰는가”라는 뜻입니다. 요약·분류처럼 추론 이득이 작은 작업일수록 이 증가분이 그대로 손해로 남으니 주의해야 합니다.

2단계: 추론 수준을 정하고 지연 시간을 잰다 (소요 1~2시간)
high 설정에서는 태스크당 약 2.5분이 걸리고, 첫 토큰까지 시간(TTFT)은 모델 페이지 기준 16.25초입니다. 반면 low 설정에서는 첫 답변 토큰까지 0.78초로 떨어집니다. 출력 속도는 릴리즈 분석이 초당 약 300토큰, 모델 페이지가 280.8 tok/s로 서로 다르게 적혀 있어 정확한 값은 확인 필요 상태입니다. 챗봇처럼 응답 대기가 곧 이탈인 서비스라면 이 단계에서 low를 기본값으로 잡으십시오.

3단계: 실제 성능 이득이 우리 작업에 해당하는지 본다 (소요 반나절)
Artificial Analysis 릴리즈 분석 기준 Intelligence Index는 high 설정에서 59점으로 3.7 Flash(56점)보다 3점 높습니다. 다만 같은 사이트의 v4.3 리더보드는 41점(202개 중 29위)으로 표시하고 있어 지수 버전 차이로 보이나, 전환 시점을 명시한 문장은 찾지 못했습니다(확인 필요). 상승분 대부분은 에이전트 계열에 몰려 있고, 도구 사용 벤치마크인 τ³-Banking에서 45%로 +12점이 최대 상승폭이었습니다.

4단계: 벤치마크를 항목별로 갈라 읽는다 (소요 1~2시간)
구글 발표 표를 제3자가 재정리한 수치는 아래와 같습니다.

벤치마크 3.8 Flash Opus 5 GPT-5.6 Sol
Terminal-Bench 2.1 89.4% 89.1% 88.8%
DeepSWE v1.1 73.7% 74.0% 72.7%
Terminal-Bench 4.0 19.1% 51.8% 37.3%
OSWorld-2.0 59.0% 75.4% 62.6%
Vals Finance Agent v2 61.4% 58.6% 53.8%
Harvey Legal Agent 10.0% 6.7% 2.5%

코딩과 금융·법률 문서 계열은 프론티어급에 붙었지만, 범용 에이전트와 컴퓨터 조작 항목은 크게 뒤집니다. HLE-Verified는 54.9%로 발표됐습니다.

5단계: 예산을 2027년 기준으로 다시 짠다 (소요 1시간)
도입가가 2026년 12월 31일에 끝나고 다음 날부터 정확히 2배가 됩니다. 여기에 태스크당 비용 증가 약 40%가 겹칩니다. 3.7에서 3.8로 옮긴 뒤 해를 넘기면 체감 지출은 단순 2배를 넘어섭니다. 배치 50% 할인과 캐싱 $0.075도 2026년까지만 적용됩니다.


자주 놓치는 부분

자주 놓치는 부분

가장 흔한 오해는 “가격이 그대로니 그냥 최신 모델로 바꾸면 이득”이라는 판단입니다. 단가는 그대로여도 모델이 답하기 전에 더 오래 생각하므로 청구서는 늘어납니다. 마이그레이션 비용은 단가가 아니라 토큰으로 계산해야 합니다.

두 번째는 발표 표를 그대로 믿는 것입니다. 한 분석은 구글 표가 Gemini 점수는 구글이 직접 측정하고 경쟁사 점수는 각 사 자체 발표치를 인용한 구조라 동일 조건 비교가 아니라고 지적했습니다. 같은 분석은 LVBench에서 Gemini는 1,024프레임, Claude는 300프레임으로 측정한 비대칭도 함께 짚었습니다. 더 곤란한 것은 Terminal-Bench 2.1 수치가 발표 표에서는 89.4%, 구글 Enterprise 개발자 가이드에서는 90.8%로 보도됐다는 점입니다. 둘 다 구글 수치인데 서로 다르며, 원문 대조에 실패해 어느 쪽이 맞는지는 확인 필요 상태입니다.

세 번째는 Cyber 변종을 기대하고 계획을 짜는 경우입니다. 3.8 Flash Cyber는 실제 취약점 발견 성공률 70% 초과, CWE-Bench 패치 47.2%(선도 프론티어 모델 47.8%)로 발표됐지만, Fairwind Program을 통해 정부·핵심 인프라·소프트웨어 유지관리자에게만 제공됩니다. 신청 절차와 심사 기간은 공식 자료에서 확인하지 못했습니다.

네 번째는 안전성 지표입니다. 딥마인드 모델카드는 다국어 안전성이 이전 버전보다 5.4pp 회귀했다고 명시했습니다. 한국어를 포함한 비영어 서비스라면 자체 검수 절차를 유지하는 편이 안전합니다.

마지막으로 구모델 정리 일정입니다. 2026년 8~9월 릴리즈 노트에는 3.7·3.6 Flash의 지원 종료 공지가 없었습니다. 급하게 옮길 이유는 아직 문서상 없다는 뜻입니다.

용어 풀이
1. 컨텍스트 캐싱 — 매번 반복해서 넣는 긴 지시문을 저장해두고 재사용해 입력 비용을 낮추는 기능이다.
2. 배치 API — 즉시 응답이 필요 없는 작업을 모아 처리하는 대신 요금을 절반으로 낮추는 방식이다.
3. 그라운딩(검색 연결) — 모델이 답을 만들 때 실시간 검색 결과를 참조해 최신 정보를 반영하는 기능이다.


체크리스트 정리

  1. 태스크당 출력 토큰을 실측했는가 — 단가 $0.75/$3.75는 3.7과 같지만 출력이 약 30% 늘어 실지출은 약 40% 증가합니다.
  2. 2027년 예산에 2배 단가를 반영했는가 — 도입가는 2026년 12월 31일 종료, 이후 $1.50/$7.50입니다.
  3. 추론 수준을 정했는가 — high는 태스크당 약 2.5분·TTFT 16.25초, low는 첫 토큰 0.78초입니다.
  4. 필요한 기능이 지원 목록에 있는가 — minimal 추론·이미지/오디오 생성·Live API는 미지원, computer use는 프리뷰입니다.
  5. 작업 유형이 강점 구간인가 — 코딩·금융·법률 문서는 상위권이나 Terminal-Bench 4.0 19.1%, OSWorld-2.0 59.0%로 범용 에이전트는 약합니다.
  6. Cyber 변종 접근 경로를 확인했는가 — Fairwind Program 승인 조직만 가능하며 일반 API로는 제공되지 않습니다.
  7. 비영어 서비스 검수 체계를 유지하는가 — 모델카드가 다국어 안전성 5.4pp 회귀를 명시했습니다.

지역별 제공 범위와 rate limit, Gemini 3.5 Pro 출시 일정은 이번 정리에서 공식 문서로 확인하지 못했습니다.



참고 자료

조사 기준일: 2026년 09월 08일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (2026-09-08 확인)
– Google 공식 블로그, “Introducing Gemini 3.8 Flash and 3.8 Flash Cyber” (2026-09-02) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
– Google DeepMind, Gemini 3.8 Flash 모델카드 — https://deepmind.google/models/model-cards/gemini-3-8-flash/
– Gemini API 모델 문서, Gemini 3.8 Flash — https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
– Gemini API 가격 문서 — https://ai.google.dev/gemini-api/docs/pricing
– Gemini API 릴리즈 노트(변경 이력) — https://ai.google.dev/gemini-api/docs/changelog
– (대조 실패) DeepMind 평가 방법론 PDF — https://storage.googleapis.com/deepmind-media/gemini/gemini_3-8_flash_model_evaluation.pdf
– (본문 미반환) Gemini Enterprise Agent Platform 개발자 가이드 — https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/guides/gemini-3-8-flash
Tier 2 (2026-09-08 확인)
– Artificial Analysis, Gemini 3.8 Flash 릴리즈 분석 — https://artificialanalysis.ai/articles/gemini-3-8-flash
– Artificial Analysis, Gemini 3.8 Flash (high) 모델 페이지 — https://artificialanalysis.ai/models/gemini-3-8-flash
– Artificial Analysis 모델 리더보드 — https://artificialanalysis.ai/leaderboards/models
– The Register (2026-09-02) — https://www.theregister.com/ai-and-ml/2026/09/02/with-gemini-38-flash-google-reminds-everyone-its-still-in-the-race/5294049
– Fortune (2026-09-03) — https://fortune.com/2026/09/03/google-shipped-four-gemini-flash-models-in-106-days-but-its-flagship-frontier-model-is-still-nowhere-to-be-seen/
– 9to5Google (2026-09-02) — https://9to5google.com/2026/09/02/gemini-3-8-flash-launch/
– Vellum, “Gemini 3.8 Flash & 3.8 Flash Cyber Benchmarks Explained” — https://www.vellum.ai/blog/gemini-3-8-flash-benchmarks-explained
– emergent.sh, “Gemini 3.8 Flash Benchmarks: Scores, Cost, and Meaning” — https://emergent.sh/learn/gemini-3-8-flash-benchmarks


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다