2026년 7~8월 OpenAI GPT-5.6 Luna 80% 인하, Claude Sonnet 5 인상 철회, Gemini 3.7 Flash 기한부 도입가, DeepSeek 인상까지 성격이 다른 네 사건을 공식 가격표 기준으로 대조하고, 실제 청구액을 다시 계산하는 절차를 단계별로 정리했습니다.
AI API 가격 인하 시작 전 확인할 것

2026년 8월의 모델 단가 뉴스를 하나의 흐름으로 읽으면 예산 계획이 어긋납니다. 이 한 달에 겹친 사건은 성격이 네 가지로 갈립니다. 첫째, OpenAI는 2026년 7월 30일자로 GPT-5.6 Luna를 80%, Terra를 20% 인하했고 이것은 만료일이 없는 정가 변경입니다. 둘째, Anthropic은 2026년 9월 1일 예정이던 Claude Sonnet 5의 $3/$15 인상을 시행하지 않기로 했는데, 이는 인하가 아니라 $2/$10이 그대로 정가로 확정된 것입니다. 셋째, Google의 Gemini 3.7 Flash $0.75/$3.75는 2026년 12월 31일까지만 유효한 도입가이며 2027년 1월 1일부터 $1.50/$7.50이 적용됩니다. 넷째, DeepSeek은 같은 달 반대 방향으로 움직여 피크·오프피크 이중 요금제를 게시했습니다.
이 글의 모든 가격은 2026년 8월 17일 각 벤더 공식 가격 문서에서 확인한 값이며 단위는 100만 토큰당 USD입니다. 블렌디드 단가는 입력:출력 = 3:1 가정(BenchLM 방식)으로 계산했습니다.
반드시 짚어둘 전제가 하나 더 있습니다. 정가 인하율이 곧 청구액 절감률은 아닙니다. 토크나이저가 바뀌면 같은 원문에서 나오는 토큰 수가 달라지고, 프롬프트 길이 구간을 넘기면 요율 자체가 바뀝니다. 독립 집계인 BenchLM 토큰 가격 지수는 2026년 8월 15일 기준 전월 대비 −3.2%, 전년 대비 +36.4%로, 장기 하락과 단기 상승이 동시에 관측됩니다. 즉 “값이 급락 중”이라는 서사와 실제 지수는 방향이 다릅니다.
준비물·필요 서류

단가 재계산에 들어가기 전 아래 자료를 손에 쥐고 있어야 합니다. 하나라도 빠지면 계산 결과가 아니라 추정치가 나옵니다.
| 준비 항목 | 구체적 내용 | 확인 위치 |
|---|---|---|
| 자사 토큰 분포 로그 | 요청별 입력·출력 토큰 수, 캐시 히트율, 프롬프트 길이 히스토그램(200k·256k·272k 초과 비율 필수) | 자사 API 게이트웨이 로그 |
| 벤더 공식 가격표 4종 | OpenAI, Anthropic, Google, DeepSeek 원문. T2 요약 글은 근거로 쓰지 않습니다 | 각 사 공식 docs |
| 만료일 목록 | Gemini Flash 계열 2026-12-31 만료, Anthropic Fast mode research preview 여부 | 벤더 발표문 |
| 트래픽 시간대 분포 | UTC 기준 시간별 호출량. DeepSeek 피크 판정에 직접 쓰입니다 | 모니터링 대시보드 |
| 캐시 재사용 횟수 | 5분 캐시·1시간 캐시별 평균 재사용 횟수 | 애플리케이션 계측 |
| 조달 경로 비교표 | 벤더 직판 vs 마켓플레이스 표기가 | OpenRouter 등 |
가격 기준선으로 쓸 정가는 다음과 같습니다(2026년 8월 17일 확인). GPT-5.6 Luna는 입력 $0.20 / 캐시 입력 $0.02 / 출력 $1.20, Terra는 $2.00 / $0.20 / $12.00, Sol은 $5.00 / $0.50 / $30.00입니다. 인하 전 Luna는 $1 / $6, Terra는 $2.50 / $15였으므로 Luna의 출력 단가는 5분의 1로 떨어졌습니다. Anthropic 쪽은 Sonnet 5 $2/$10, Sonnet 4.6 $3/$15, Haiku 4.5 $1/$5, Opus 5 $5/$25, Fable 5 $10/$50이고, 캐시 읽기는 입력가의 0.1배, 5분 캐시 쓰기 1.25배, 1시간 캐시 쓰기 2배입니다.
Batch API는 Anthropic에서 입출력 모두 50% 할인이므로 배치 가능 워크로드는 별도 열로 관리해야 합니다.
단계별 진행 순서

1단계 — 기준일을 못 박고 가격표를 원문에서 다시 받는다(소요 20~30분). 이 분야는 열흘이면 자료가 틀립니다. 실제로 2026년 8월 5일자 가격 정리 자료 중에는 “Sonnet 5가 9월 1일 $3/$15로 환원된다”는 항목이 그대로 남아 있는 사례가 있습니다. 그 인상은 취소됐습니다. 주의점: 사내 문서에 가격을 넣을 때는 “2026-08-17 확인”처럼 기준일을 병기하십시오.
2단계 — 토크나이저 보정을 먼저 적용한다(소요 1~2시간). Anthropic 공식 가격 문서는 Claude 4.7 이후 모델과 Mythos Preview가 새 토크나이저를 쓰며 같은 텍스트에 약 30% 더 많은 토큰을 생성한다고 밝히고 있습니다. Sonnet 4.6 이하는 이전 토크나이저입니다. 따라서 Sonnet 4.6($3/$15) → Sonnet 5($2/$10) 전환은 토큰당 33% 인하지만, 문서당 실효 비용은 블렌디드 $6.00 → 약 $5.20으로 13% 절감 수준입니다. 주의점: 한국어 텍스트에서 증가폭이 몇 %인지는 공식 실측치가 공개되지 않았습니다(확인 필요). 자사 샘플로 직접 재봐야 합니다.
3단계 — 프롬프트 길이 절벽을 점검한다(소요 30분~1시간). Grok 4.6은 프롬프트가 200k를 넘으면 요청 전체가 $2/$6에서 $4/$12로 재과금됩니다. 컨텍스트가 500k인 모델에서 200k는 쉽게 넘는 선입니다. 별도 트래커는 Qwen3.7 Flash가 256K 초과 시 요율이 6.7배로 뛴다고 지적합니다. 주의점: 평균값이 아니라 분포의 상위 구간을 봐야 합니다. 평균 150k라도 상위 20%가 절벽을 넘으면 비용은 평균 계산의 두 배가 됩니다.
4단계 — 시간대 요금제를 KST로 환산한다(소요 30분). DeepSeek 공식 문서 기준 피크는 01:00–04:00과 06:00–10:00 UTC이며 나머지가 오프피크입니다. 이를 환산하면 한국시간 10:00–13:00, 15:00–19:00이 피크입니다. 한국 근무시간 대부분이 여기 들어갑니다. 오프피크가 피크의 50%라는 이점은 야간 배치에만 실효가 있습니다. V4-Flash는 캐시 미스 $0.22(오프피크)/$0.44(피크), 출력 $0.66/$1.32입니다. 주의점: 공식 페이지에 변경 고지와 시행일 표기가 없어 언제부터 이 요금인지는 공식 문서만으로 확정되지 않습니다(확인 필요).
5단계 — 속도 옵션의 손익분기를 계산한다(소요 1시간). OpenAI 가격표상 Fast mode는 전 모델 정확히 2배(Sol $10/$60, Terra $4/$24, Luna $0.40/$2.40)인데 체인지로그가 밝힌 속도는 Sol 기준 표준 대비 최대 2.5배입니다. 과금은 확정 2배, 이득은 상한값이므로 실측 배속이 2배 미만이면 손해입니다. 주의점: 제3자 실측 속도 데이터는 확인하지 못했습니다.
6단계 — 성능 대비 단가로 다시 줄 세운다(소요 1~2시간). Artificial Analysis Intelligence Index v4.1.1 기준 Gemini 3.7 Flash(medium) 53점, GPT-5.6 Luna(medium) 39점입니다. 지수 1점당 단가는 Luna $0.00436, 3.7 Flash $0.01094로 3.7 Flash가 2.5배 비쌉니다. 반대로 절대 성능은 3.7 Flash가 14점 높습니다. 재시도 비용이 큰 코딩·에이전트 작업에서는 비싼 쪽이 총비용을 낮출 수 있습니다.
7단계 — 만료일을 달력에 등록한다(소요 15분). 2026년 12월 31일: Gemini 3.7 Flash·3.6 Flash 도입가 종료. 2027년 1월 1일 2배 적용입니다.
자주 놓치는 부분

첫째, 인하율의 기준선을 확인하지 않는 실수입니다. Gemini 3.7 Flash의 “50% 인하”는 3주 전인 2026년 7월 21일 출시된 3.6 Flash 정가 $1.50/$7.50을 기준선으로 삼은 값입니다. 게다가 3.6 Flash도 같은 날 $0.75/$3.75로 함께 내려갔으므로, 3.7 Flash는 더 싼 모델이 아니라 같은 값의 더 나은 모델로 읽어야 정확합니다.
둘째, 정가표만 보고 최저가를 확정하는 실수입니다. OpenRouter는 GPT-5.6 Luna를 $0.10/$0.60으로 표기하며 50% 할인 적용 중이라고 밝히고 있습니다 — OpenAI 정가의 절반입니다. 마켓플레이스가 벤더 직판보다 30% 이상 싼 사례도 보고됐습니다. 단 프로모션이므로 지속성은 보장되지 않습니다.
셋째, 발표됐지만 아직 못 쓰는 기능에 SLA를 거는 실수입니다. OpenAI Ultrafast mode는 2026년 8월 13일 공지된 limited preview이고 공식 가격표에 요금 행이 아직 없습니다. Anthropic Fast mode는 research preview로 Opus 5·4.8 한정, 1st-party API 전용이며 Bedrock·Vertex·AWS 마켓플레이스에서는 쓸 수 없고 Batch API와 병용도 불가합니다. Opus 4.7에서 speed: "fast"는 에러를 반환합니다. Claude Mythos 5는 limited availability 표기입니다.
넷째, 리전 승수를 빼먹는 실수입니다. Anthropic에서 inference_geo: "us"는 입력·출력·캐시 전 항목에 1.1배 승수가 붙고, Bedrock·Vertex 리전 엔드포인트는 글로벌 대비 10% 프리미엄입니다.
다섯째, 캐시 정책의 손익분기를 오해하는 실수입니다. Anthropic은 5분 캐시는 1회 재사용, 1시간 캐시는 2회 재사용부터 이득입니다. OpenAI는 캐시 입력이 정가의 1/10로 고정됩니다.
일곱째, 원가 하락이 제품 요금에 반영된다고 가정하는 실수입니다. 2,457개 AI 도구를 추적한 조사에서 65.1%가 여전히 유료이고 무료는 5.0%입니다. 해당 저자들은 도구 값이 올랐다고 주장하지는 않되, 입력 원가 하락이 판매 방식에 보이지 않는다는 점을 명시합니다.
체크리스트 정리
- 기준일 병기 확인 — 모든 가격에 “2026-08-17 확인” 같은 확인 시점을 붙였는가. 8월 초 자료는 Sonnet 5 항목이 이미 틀렸다.
- 토크나이저 보정 적용 — Claude 4.7 이후 모델로 옮기면서 약 30% 토큰 증가를 반영했는가. 33% 인하가 실효 13% 절감으로 바뀐다.
- 길이 절벽 통과율 측정 — Grok 4.6의 200k, Qwen3.7 Flash의 256K를 넘는 요청 비율을 분포로 확인했는가.
- KST 피크 시간 대조 — DeepSeek 오프피크 50% 할인이 한국 근무시간(10~13시, 15~19시 피크) 밖에서만 유효하다는 점을 반영했는가.
- 속도 옵션 손익분기 — Fast mode 확정 2배 요금 대비 실측 배속이 2배를 넘는지 자사 프롬프트로 측정했는가.
- 만료일 등록 — 2026년 12월 31일 Gemini Flash 도입가 종료를 달력에 넣었는가. 2027년 1월 1일 2배다.
- 프리뷰 기능 배제 — Ultrafast(limited preview), Anthropic Fast mode(research preview), Mythos 5(limited availability)를 프로덕션 계획에서 분리했는가.
함께 보면 좋은 글
참고 자료
조사 기준일: 2026년 08월 17일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (원문 열람·대조 완료)
– OpenAI API Pricing — https://developers.openai.com/api/docs/pricing.md (확인 2026-08-17)
– OpenAI API Changelog (2026-07-30 / 08-05 / 08-13 항목) — https://developers.openai.com/api/docs/changelog (확인 2026-08-17)
– OpenAI GPT-5.6 Luna 모델 문서 — https://developers.openai.com/api/docs/models/gpt-5.6-luna (확인 2026-08-17)
– OpenAI Developer Community 공지 “Announcing a major Price drop for 5.6 Terra and Luna and Fast mode for 5.6-Sol” (2026-07-30 게시) — https://community.openai.com/t/announcing-a-major-price-drop-for-5-6-terra-and-luna-and-fast-mode-for-5-6-sol/1388484 (확인 2026-08-17)
– Anthropic Claude Platform Pricing — https://platform.claude.com/docs/en/about-claude/pricing (확인 2026-08-17)
– Google “Gemini 3.7 Flash: our most intelligent workhorse model” (2026-08-13) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/ (확인 2026-08-17)
– Google “Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber” (2026-07-21) — https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/ (확인 2026-08-17)
– Gemini Developer API Pricing (페이지 최종 갱신 2026-08-13) — https://ai.google.dev/gemini-api/docs/pricing (확인 2026-08-17)
– DeepSeek API Pricing — https://api-docs.deepseek.com/quick_start/pricing (확인 2026-08-17)
– xAI Models & Pricing — https://docs.x.ai/docs/models (확인 2026-08-17)
Tier 2 (원문 열람·대조 완료)
– Artificial Analysis — Gemini 3.7 Flash (medium) vs GPT-5.6 Luna (medium), Intelligence Index v4.1.1 — https://artificialanalysis.ai/models/comparisons/gemini-3-7-flash-medium-vs-gpt-5-6-luna-medium (확인 2026-08-17)
– BenchLM Token Price Index (2026-08-15 스냅샷) — https://benchlm.ai/token-price-index (확인 2026-08-17)
– BenchLM LLM Pricing Trends (2026-08-15 갱신) — https://benchlm.ai/llm-pricing-trends (확인 2026-08-17)
– Forbes, Gerui Wang, “Why OpenAI’s 80% Price Cut Could Trigger A Race To The Bottom In AI” (2026-07-31) — https://www.forbes.com/sites/geruiwang/2026/07/31/why-openais-80-price-cut-could-trigger-a-race-to-the-bottom-in-ai/ (확인 2026-08-17)
– ToolDirectory, “Are AI tools getting cheaper in 2026? The data says no” (2026-08-15 갱신) — https://tooldirectory.ai/blog/ai-model-prices-fell-tool-prices-didnt-2026 (확인 2026-08-17)
– DigitalApplied, “AI API Pricing, August 2026: Cuts, Promos, and Traps” (2026-08-05) — https://www.digitalapplied.com/blog/ai-api-pricing-august-2026-cuts-promos-tracker (확인 2026-08-17)
– Slashdot(VentureBeat 인용), “Google’s Gemini 3.7 Flash Targets Coding and Agents With a 50% Price Cut” (2026-08-13) — https://developers.slashdot.org/story/26/08/13/217215/googles-gemini-37-flash-targets-coding-and-agents-with-a-50-price-cut (확인 2026-08-17)
– Eden AI, DeepSeek 가격 변동 분석 (2026-08-13) — https://www.edenai.co/post/deepseek-price-shake-up-how-pricing-volatility-changes-ai-api-economics (확인 2026-08-17)
– OpenRouter, GPT-5.6 Luna 모델 페이지 — https://openrouter.ai/openai/gpt-5.6-luna (확인 2026-08-17)
열람 실패 (본문 대조 불가 — 인용 금지)
– OpenAI, “Advancing the price-performance frontier with GPT-5.6” — https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/ (HTTP 403, 2회 시도, 2026-08-17)
– @claudeai X 게시물 — https://x.com/claudeai/status/2086891169217122586 (HTTP 402, 2026-08-17)
– CNBC, “OpenAI cuts prices for two of its GPT-5.6 AI models…” (2026-07-30) — https://www.cnbc.com/2026/07/30/open-ai-price-cut-gpt.html (HTTP 403, 2026-08-17)
– Qz, “DeepSeek raising API prices by up to 1,100% starting Aug. 16” — https://qz.com/deepseek-api-price-increase-v4-peak-off-peak-081326 (HTTP 403, 2026-08-17)
– Dataconomy, “DeepSeek Warns Developers Of Significant API Price Increases” (2026-08-06) — https://dataconomy.com/2026/08/06/deepseek-significant-api-price-increase-2026/ (HTTP 403, 2026-08-17)
Tier 3 (커뮤니티): 이번 리서치 범위에서 제외함.

답글 남기기