하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

GPT-5.6 Luna 80% 인하 vs Gemini 3.7 Flash 도입가 — 2026년 8월 AI API 단가 재계산 실무 가이드

GPT-5.6 Luna 80% 인하 vs Gemini 3.7 Flash 도입가 — 2026년 8월 AI API 단가 재계산 실무 가이드

작성자

카테고리:

약 20분 소요

2026년 7~8월 OpenAI GPT-5.6 Luna 80% 인하, Claude Sonnet 5 인상 철회, Gemini 3.7 Flash 기한부 도입가, DeepSeek 인상까지 성격이 다른 네 사건을 공식 가격표 기준으로 대조하고, 실제 청구액을 다시 계산하는 절차를 단계별로 정리했습니다.

AI API 가격 인하 시작 전 확인할 것

AI API 가격 인하 시작 전 확인할 것

2026년 8월의 모델 단가 뉴스를 하나의 흐름으로 읽으면 예산 계획이 어긋납니다. 이 한 달에 겹친 사건은 성격이 네 가지로 갈립니다. 첫째, OpenAI는 2026년 7월 30일자로 GPT-5.6 Luna를 80%, Terra를 20% 인하했고 이것은 만료일이 없는 정가 변경입니다. 둘째, Anthropic은 2026년 9월 1일 예정이던 Claude Sonnet 5의 $3/$15 인상을 시행하지 않기로 했는데, 이는 인하가 아니라 $2/$10이 그대로 정가로 확정된 것입니다. 셋째, Google의 Gemini 3.7 Flash $0.75/$3.75는 2026년 12월 31일까지만 유효한 도입가이며 2027년 1월 1일부터 $1.50/$7.50이 적용됩니다. 넷째, DeepSeek은 같은 달 반대 방향으로 움직여 피크·오프피크 이중 요금제를 게시했습니다.

이 글의 모든 가격은 2026년 8월 17일 각 벤더 공식 가격 문서에서 확인한 값이며 단위는 100만 토큰당 USD입니다. 블렌디드 단가는 입력:출력 = 3:1 가정(BenchLM 방식)으로 계산했습니다.

반드시 짚어둘 전제가 하나 더 있습니다. 정가 인하율이 곧 청구액 절감률은 아닙니다. 토크나이저가 바뀌면 같은 원문에서 나오는 토큰 수가 달라지고, 프롬프트 길이 구간을 넘기면 요율 자체가 바뀝니다. 독립 집계인 BenchLM 토큰 가격 지수는 2026년 8월 15일 기준 전월 대비 −3.2%, 전년 대비 +36.4%로, 장기 하락과 단기 상승이 동시에 관측됩니다. 즉 “값이 급락 중”이라는 서사와 실제 지수는 방향이 다릅니다.


준비물·필요 서류

준비물·필요 서류

단가 재계산에 들어가기 전 아래 자료를 손에 쥐고 있어야 합니다. 하나라도 빠지면 계산 결과가 아니라 추정치가 나옵니다.

준비 항목 구체적 내용 확인 위치
자사 토큰 분포 로그 요청별 입력·출력 토큰 수, 캐시 히트율, 프롬프트 길이 히스토그램(200k·256k·272k 초과 비율 필수) 자사 API 게이트웨이 로그
벤더 공식 가격표 4종 OpenAI, Anthropic, Google, DeepSeek 원문. T2 요약 글은 근거로 쓰지 않습니다 각 사 공식 docs
만료일 목록 Gemini Flash 계열 2026-12-31 만료, Anthropic Fast mode research preview 여부 벤더 발표문
트래픽 시간대 분포 UTC 기준 시간별 호출량. DeepSeek 피크 판정에 직접 쓰입니다 모니터링 대시보드
캐시 재사용 횟수 5분 캐시·1시간 캐시별 평균 재사용 횟수 애플리케이션 계측
조달 경로 비교표 벤더 직판 vs 마켓플레이스 표기가 OpenRouter 등

가격 기준선으로 쓸 정가는 다음과 같습니다(2026년 8월 17일 확인). GPT-5.6 Luna는 입력 $0.20 / 캐시 입력 $0.02 / 출력 $1.20, Terra는 $2.00 / $0.20 / $12.00, Sol은 $5.00 / $0.50 / $30.00입니다. 인하 전 Luna는 $1 / $6, Terra는 $2.50 / $15였으므로 Luna의 출력 단가는 5분의 1로 떨어졌습니다. Anthropic 쪽은 Sonnet 5 $2/$10, Sonnet 4.6 $3/$15, Haiku 4.5 $1/$5, Opus 5 $5/$25, Fable 5 $10/$50이고, 캐시 읽기는 입력가의 0.1배, 5분 캐시 쓰기 1.25배, 1시간 캐시 쓰기 2배입니다.

Batch API는 Anthropic에서 입출력 모두 50% 할인이므로 배치 가능 워크로드는 별도 열로 관리해야 합니다.


단계별 진행 순서

단계별 진행 순서

1단계 — 기준일을 못 박고 가격표를 원문에서 다시 받는다(소요 20~30분). 이 분야는 열흘이면 자료가 틀립니다. 실제로 2026년 8월 5일자 가격 정리 자료 중에는 “Sonnet 5가 9월 1일 $3/$15로 환원된다”는 항목이 그대로 남아 있는 사례가 있습니다. 그 인상은 취소됐습니다. 주의점: 사내 문서에 가격을 넣을 때는 “2026-08-17 확인”처럼 기준일을 병기하십시오.

2단계 — 토크나이저 보정을 먼저 적용한다(소요 1~2시간). Anthropic 공식 가격 문서는 Claude 4.7 이후 모델과 Mythos Preview가 새 토크나이저를 쓰며 같은 텍스트에 약 30% 더 많은 토큰을 생성한다고 밝히고 있습니다. Sonnet 4.6 이하는 이전 토크나이저입니다. 따라서 Sonnet 4.6($3/$15) → Sonnet 5($2/$10) 전환은 토큰당 33% 인하지만, 문서당 실효 비용은 블렌디드 $6.00 → 약 $5.20으로 13% 절감 수준입니다. 주의점: 한국어 텍스트에서 증가폭이 몇 %인지는 공식 실측치가 공개되지 않았습니다(확인 필요). 자사 샘플로 직접 재봐야 합니다.

3단계 — 프롬프트 길이 절벽을 점검한다(소요 30분~1시간). Grok 4.6은 프롬프트가 200k를 넘으면 요청 전체가 $2/$6에서 $4/$12로 재과금됩니다. 컨텍스트가 500k인 모델에서 200k는 쉽게 넘는 선입니다. 별도 트래커는 Qwen3.7 Flash가 256K 초과 시 요율이 6.7배로 뛴다고 지적합니다. 주의점: 평균값이 아니라 분포의 상위 구간을 봐야 합니다. 평균 150k라도 상위 20%가 절벽을 넘으면 비용은 평균 계산의 두 배가 됩니다.

4단계 — 시간대 요금제를 KST로 환산한다(소요 30분). DeepSeek 공식 문서 기준 피크는 01:00–04:00과 06:00–10:00 UTC이며 나머지가 오프피크입니다. 이를 환산하면 한국시간 10:00–13:00, 15:00–19:00이 피크입니다. 한국 근무시간 대부분이 여기 들어갑니다. 오프피크가 피크의 50%라는 이점은 야간 배치에만 실효가 있습니다. V4-Flash는 캐시 미스 $0.22(오프피크)/$0.44(피크), 출력 $0.66/$1.32입니다. 주의점: 공식 페이지에 변경 고지와 시행일 표기가 없어 언제부터 이 요금인지는 공식 문서만으로 확정되지 않습니다(확인 필요).

5단계 — 속도 옵션의 손익분기를 계산한다(소요 1시간). OpenAI 가격표상 Fast mode는 전 모델 정확히 2배(Sol $10/$60, Terra $4/$24, Luna $0.40/$2.40)인데 체인지로그가 밝힌 속도는 Sol 기준 표준 대비 최대 2.5배입니다. 과금은 확정 2배, 이득은 상한값이므로 실측 배속이 2배 미만이면 손해입니다. 주의점: 제3자 실측 속도 데이터는 확인하지 못했습니다.

6단계 — 성능 대비 단가로 다시 줄 세운다(소요 1~2시간). Artificial Analysis Intelligence Index v4.1.1 기준 Gemini 3.7 Flash(medium) 53점, GPT-5.6 Luna(medium) 39점입니다. 지수 1점당 단가는 Luna $0.00436, 3.7 Flash $0.01094로 3.7 Flash가 2.5배 비쌉니다. 반대로 절대 성능은 3.7 Flash가 14점 높습니다. 재시도 비용이 큰 코딩·에이전트 작업에서는 비싼 쪽이 총비용을 낮출 수 있습니다.

7단계 — 만료일을 달력에 등록한다(소요 15분). 2026년 12월 31일: Gemini 3.7 Flash·3.6 Flash 도입가 종료. 2027년 1월 1일 2배 적용입니다.


자주 놓치는 부분

자주 놓치는 부분

첫째, 인하율의 기준선을 확인하지 않는 실수입니다. Gemini 3.7 Flash의 “50% 인하”는 3주 전인 2026년 7월 21일 출시된 3.6 Flash 정가 $1.50/$7.50을 기준선으로 삼은 값입니다. 게다가 3.6 Flash도 같은 날 $0.75/$3.75로 함께 내려갔으므로, 3.7 Flash는 더 싼 모델이 아니라 같은 값의 더 나은 모델로 읽어야 정확합니다.

둘째, 정가표만 보고 최저가를 확정하는 실수입니다. OpenRouter는 GPT-5.6 Luna를 $0.10/$0.60으로 표기하며 50% 할인 적용 중이라고 밝히고 있습니다 — OpenAI 정가의 절반입니다. 마켓플레이스가 벤더 직판보다 30% 이상 싼 사례도 보고됐습니다. 단 프로모션이므로 지속성은 보장되지 않습니다.

셋째, 발표됐지만 아직 못 쓰는 기능에 SLA를 거는 실수입니다. OpenAI Ultrafast mode는 2026년 8월 13일 공지된 limited preview이고 공식 가격표에 요금 행이 아직 없습니다. Anthropic Fast mode는 research preview로 Opus 5·4.8 한정, 1st-party API 전용이며 Bedrock·Vertex·AWS 마켓플레이스에서는 쓸 수 없고 Batch API와 병용도 불가합니다. Opus 4.7에서 speed: "fast"는 에러를 반환합니다. Claude Mythos 5는 limited availability 표기입니다.

넷째, 리전 승수를 빼먹는 실수입니다. Anthropic에서 inference_geo: "us"는 입력·출력·캐시 전 항목에 1.1배 승수가 붙고, Bedrock·Vertex 리전 엔드포인트는 글로벌 대비 10% 프리미엄입니다.

다섯째, 캐시 정책의 손익분기를 오해하는 실수입니다. Anthropic은 5분 캐시는 1회 재사용, 1시간 캐시는 2회 재사용부터 이득입니다. OpenAI는 캐시 입력이 정가의 1/10로 고정됩니다.

일곱째, 원가 하락이 제품 요금에 반영된다고 가정하는 실수입니다. 2,457개 AI 도구를 추적한 조사에서 65.1%가 여전히 유료이고 무료는 5.0%입니다. 해당 저자들은 도구 값이 올랐다고 주장하지는 않되, 입력 원가 하락이 판매 방식에 보이지 않는다는 점을 명시합니다.


체크리스트 정리

  • 기준일 병기 확인 — 모든 가격에 “2026-08-17 확인” 같은 확인 시점을 붙였는가. 8월 초 자료는 Sonnet 5 항목이 이미 틀렸다.
  • 토크나이저 보정 적용 — Claude 4.7 이후 모델로 옮기면서 약 30% 토큰 증가를 반영했는가. 33% 인하가 실효 13% 절감으로 바뀐다.
  • 길이 절벽 통과율 측정Grok 4.6의 200k, Qwen3.7 Flash의 256K를 넘는 요청 비율을 분포로 확인했는가.
  • KST 피크 시간 대조 — DeepSeek 오프피크 50% 할인이 한국 근무시간(10~13시, 15~19시 피크) 밖에서만 유효하다는 점을 반영했는가.
  • 속도 옵션 손익분기 — Fast mode 확정 2배 요금 대비 실측 배속이 2배를 넘는지 자사 프롬프트로 측정했는가.
  • 만료일 등록2026년 12월 31일 Gemini Flash 도입가 종료를 달력에 넣었는가. 2027년 1월 1일 2배다.
  • 프리뷰 기능 배제 — Ultrafast(limited preview), Anthropic Fast mode(research preview), Mythos 5(limited availability)를 프로덕션 계획에서 분리했는가.

함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 17일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (원문 열람·대조 완료)
– OpenAI API Pricing — https://developers.openai.com/api/docs/pricing.md (확인 2026-08-17)
– OpenAI API Changelog (2026-07-30 / 08-05 / 08-13 항목) — https://developers.openai.com/api/docs/changelog (확인 2026-08-17)
– OpenAI GPT-5.6 Luna 모델 문서 — https://developers.openai.com/api/docs/models/gpt-5.6-luna (확인 2026-08-17)
– OpenAI Developer Community 공지 “Announcing a major Price drop for 5.6 Terra and Luna and Fast mode for 5.6-Sol” (2026-07-30 게시) — https://community.openai.com/t/announcing-a-major-price-drop-for-5-6-terra-and-luna-and-fast-mode-for-5-6-sol/1388484 (확인 2026-08-17)
– Anthropic Claude Platform Pricing — https://platform.claude.com/docs/en/about-claude/pricing (확인 2026-08-17)
– Google “Gemini 3.7 Flash: our most intelligent workhorse model” (2026-08-13) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ (확인 2026-08-17)
– Google “Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber” (2026-07-21) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ (확인 2026-08-17)
– Gemini Developer API Pricing (페이지 최종 갱신 2026-08-13) — https://ai.google.dev/gemini-api/docs/pricing (확인 2026-08-17)
– DeepSeek API Pricing — https://api-docs.deepseek.com/quick_start/pricing (확인 2026-08-17)
– xAI Models & Pricing — https://docs.x.ai/docs/models (확인 2026-08-17)
Tier 2 (원문 열람·대조 완료)
– Artificial Analysis — Gemini 3.7 Flash (medium) vs GPT-5.6 Luna (medium), Intelligence Index v4.1.1 — https://artificialanalysis.ai/models/comparisons/gemini-3-7-flash-medium-vs-gpt-5-6-luna-medium (확인 2026-08-17)
– BenchLM Token Price Index (2026-08-15 스냅샷) — https://benchlm.ai/token-price-index (확인 2026-08-17)
– BenchLM LLM Pricing Trends (2026-08-15 갱신) — https://benchlm.ai/llm-pricing-trends (확인 2026-08-17)
– Forbes, Gerui Wang, “Why OpenAI’s 80% Price Cut Could Trigger A Race To The Bottom In AI” (2026-07-31) — https://www.forbes.com/sites/geruiwang/2026/07/31/why-openais-80-price-cut-could-trigger-a-race-to-the-bottom-in-ai/ (확인 2026-08-17)
– ToolDirectory, “Are AI tools getting cheaper in 2026? The data says no” (2026-08-15 갱신) — https://tooldirectory.ai/blog/ai-model-prices-fell-tool-prices-didnt-2026 (확인 2026-08-17)
– DigitalApplied, “AI API Pricing, August 2026: Cuts, Promos, and Traps” (2026-08-05) — https://www.digitalapplied.com/blog/ai-api-pricing-august-2026-cuts-promos-tracker (확인 2026-08-17)
– Slashdot(VentureBeat 인용), “Google’s Gemini 3.7 Flash Targets Coding and Agents With a 50% Price Cut” (2026-08-13) — https://developers.slashdot.org/story/26/08/13/217215/googles-gemini-37-flash-targets-coding-and-agents-with-a-50-price-cut (확인 2026-08-17)
– Eden AI, DeepSeek 가격 변동 분석 (2026-08-13) — https://www.edenai.co/post/deepseek-price-shake-up-how-pricing-volatility-changes-ai-api-economics (확인 2026-08-17)
– OpenRouter, GPT-5.6 Luna 모델 페이지 — https://openrouter.ai/openai/gpt-5.6-luna (확인 2026-08-17)
열람 실패 (본문 대조 불가 — 인용 금지)
– OpenAI, “Advancing the price-performance frontier with GPT-5.6” — https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/ (HTTP 403, 2회 시도, 2026-08-17)
– @claudeai X 게시물 — https://x.com/claudeai/status/2086891169217122586 (HTTP 402, 2026-08-17)
– CNBC, “OpenAI cuts prices for two of its GPT-5.6 AI models…” (2026-07-30) — https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html (HTTP 403, 2026-08-17)
– Qz, “DeepSeek raising API prices by up to 1,100% starting Aug. 16” — https://qz.com/deepseek-api-price-increase-v4-peak-off-peak-081326 (HTTP 403, 2026-08-17)
– Dataconomy, “DeepSeek Warns Developers Of Significant API Price Increases” (2026-08-06) — https://dataconomy.com/2026/08/06/deepseek-significant-api-price-increase-2026/ (HTTP 403, 2026-08-17)
Tier 3 (커뮤니티): 이번 리서치 범위에서 제외함.


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다