2026년 8월 기준 DeepSeek V4-Pro와 V4-Flash의 실제 API 단가, 피크·오프피크 이원화, 벤치마크와 사람 선호 순위의 간극을 대조해 어떤 워크로드에 무엇을 붙일지 판단하는 기준을 정리했습니다.
DeepSeek V4, 무엇을 기준으로 비교해야 할까

결론부터 적으면, 대부분의 팀은 V4-Pro가 아니라 V4-Flash부터 검토하는 것이 맞습니다. Artificial Analysis 측정(2026년 8월 27일 확인)에서 V4-Pro-0813은 인텔리전스 지수 53, V4-Flash-0731은 52로 1점 차인데, Flash의 출력 단가는 Pro의 3분의 1이고 출력 속도는 121.8 tok/s로 Pro(68.3 tok/s)의 약 1.8배입니다. 이 글은 두 모델의 공식 단가·벤치마크·독립 측정치를 대조해 도입 판단 근거를 정리한 것이며, 셀프 호스팅 튜닝이나 파인튜닝 절차는 다루지 않습니다.
비교가 필요해진 직접적인 이유는 가격입니다. 2026년 8월 16일 16:00 UTC부로 V4 전 라인 요금이 인상됐고, 동시에 피크·오프피크 이원화가 도입됐습니다. 인상 전 Pro 출력이 100만 토큰당 $0.87이었는데, 현재는 피크 $3.96(4.55배)·오프피크 $1.98(2.28배)입니다. 4월 24일 프리뷰 시점의 단가로 예산을 잡아둔 팀이라면 산정을 처음부터 다시 해야 하는 폭입니다.
또 하나의 판단 축은 벤치마크와 체감 품질이 정반대 신호를 준다는 점입니다. 공식 모델카드는 LiveCodeBench 93.5(Pass@1), Codeforces 3206을 내세우지만, 사람이 두 답변을 직접 비교해 투표하는 arena.ai 텍스트 리더보드(2026년 8월 21일 기준)에서 은 50위, 점수 1459±10입니다. 1위 claude-fable-5(1508±5)와 49점 차이입니다. 어느 쪽이 틀렸다기보다, 두 지표가 서로 다른 것을 재고 있다고 보는 편이 안전합니다.
용어 풀이
1. MoE(Mixture of Experts) — 모델 전체 파라미터 중 입력마다 일부 전문가 블록만 활성화해 계산량을 줄이는 구조.
2. 활성 파라미터 — 총 파라미터 중 실제 추론 한 번에 동원되는 몫으로, 추론 비용에 직접 영향을 준다.
3. KV 캐시 — 이미 처리한 토큰의 중간 계산을 저장해 재사용하는 메모리로, 긴 컨텍스트에서 용량 병목이 된다.
비교 기준 정리
도입 판단에서 실제로 숫자가 갈리는 항목만 남기면 다음과 같습니다. 특히 모드 표기를 확인하지 않으면 홍보 수치와 실제 호출 결과가 어긋납니다.
| 비교 항목 | 단위·기준 | 확인해야 할 지점 | 주의점 |
|---|---|---|---|
| 출력 단가 | USD / 1M 토큰 | 피크·오프피크 구분 | 2026-08-16 인상 반영본인지 확인 |
| 입력 단가 | 캐시히트 / 캐시미스 별도 | 캐시히트가 미스의 3% 수준 | 프롬프트 재사용 설계 여부로 실비가 갈림 |
| 추론 모드 | low / high / max | 공개 대표 수치는 전부 max | Non-Think 호출은 다른 모델급 성능 |
| 컨텍스트 | 토큰 | 100만(1,048,576) 토큰 공통 | 최대 출력은 384K로 별도 제한 |
| 처리 속도 | tok/s, TTFT(초) | Flash 121.8 / Pro 68.3 | 프로바이더별 편차 존재 |
| 출력 장황도 | 평가 소비 토큰 | Flash 210M vs Pro 130M | 단가 차만큼 실비가 안 벌어질 수 있음 |
| 지식 정확도 | SimpleQA-Verified | Pro 57.9 / Flash 34.1 | 사실 질의 워크로드의 결정 요인 |
| 라이선스 | 가중치 공개 여부 | 0813은 MIT 공개 | 66샤드·약 1.65TB(FP8), 클러스터 전제 |
피크 시간대는 생각보다 좁습니다. 공식 가격 페이지 기준 피크는 UTC 월–금 01:00–04:00과 06:00–10:00뿐이며, 주 35시간으로 전체 168시간의 20.8%입니다. 나머지 79.2%, 주말 전체는 오프피크 단가가 적용됩니다. 배치·비동기 작업을 오프피크로 미룰 수 있는 구조라면 실효 단가가 절반으로 떨어집니다.
아키텍처 쪽 근거도 함께 봐둘 만합니다. arXiv 2606.19348(2026년 4월 26일 제출) 초록은 100만 토큰 컨텍스트에서 V4-Pro가 V3.2 대비 단일 토큰 추론 FLOPs의 27%, KV 캐시의 10%만 사용한다고 밝힙니다. CSA+HCA 하이브리드 어텐션과 mHC 잔차 연결, Muon 옵티마이저를 쓰고 32T 토큰 이상으로 사전학습했습니다. 장문 컨텍스트 단가가 이 정도로 내려온 배경 설명으로는 일관됩니다.
옵션·유형별 비교

파라미터·단가 대조
| 항목 | V4-Pro | V4-Flash |
|---|---|---|
| 총 / 활성 파라미터 | 1.6T / 49B | 284B / 13B |
| 컨텍스트 / 최대 출력 | 1M / 384K | 1M / 384K |
| 캐시히트 입력 (오프–피크) | $0.022–0.044 | $0.007–0.014 |
| 캐시미스 입력 | $0.66–1.32 | $0.22–0.44 |
| 출력 | $1.98–3.96 | $0.66–1.32 |
| AA 인텔리전스 지수 | 53 (110개 중 5위) | 52 (7위) |
| 출력 속도 / TTFT | 68.3 tok/s / 1.48초 | 121.8 tok/s / 1.12초 |
| SimpleQA-Verified | 57.9 | 34.1 |
0813 GA가 프리뷰 대비 올린 폭
| 벤치마크 | 프리뷰 | 0813 GA |
|---|---|---|
| HLE (도구 없음 / 있음) | 37.7 / 48.2 | 42.7 / 60.0 |
| Terminal Bench 2.1 | 72.1 | 87.9 |
| NL2Repo | 38.5 | 61.5 |
| Cybergym | 52.7 | 83.3 |
| DeepSWE | 12.8 | 62.7 |
이 표에서 눈여겨볼 곳은 DeepSWE가 12.8에서 62.7로 약 5배 뛴 부분인데, 이 수치는 전부 자사 측정입니다. Unite.AI는 GA 시점 기준으로 0813 빌드를 독립 재현한 평가자가 없다고 지적했고, 8월 27일 확인 시점에도 제3자 재현치는 확인되지 않았습니다(확인 필요 — 독립 검증 미확인). 또 프리뷰 모델카드의 Terminal Bench는 2.0 기준 67.9여서, 2.1 기준 87.9와 직접 비교할 수 없습니다.
“오픈 SOTA” 주장도 조건부로 읽어야 합니다. Pro-Max의 SWE Verified는 80.6인데, 같은 공식 표에 실린 Opus-4.6이 80.8, Gemini-3.1-Pro가 80.6입니다. 우위가 아니라 사실상 동률입니다. 반대로 모드를 낮추면 격차가 커집니다. Pro Non-Think의 HLE는 7.7, LiveCodeBench는 56.8로, Max 모드(37.7 / 93.5)와 같은 모델로 보기 어려운 수준입니다.
조달 경로도 선택지입니다. Fireworks AI는 0813을 입력 $1.32 / 캐시 $0.044 / 출력 $3.96으로 서빙하는데 이는 DeepSeek 피크가와 동일합니다. OpenRouter에는 17개 프로바이더가 붙어 있고 3일 평균 가동률 100%, 최고 처리량 55 tok/s(NovitaAI), 최저 지연 0.40초(Baseten)입니다. 다만 Venice는 가동률 95.76%로 편차가 있어 프로바이더 지정 없이 쓰면 품질이 흔들립니다.
상황별 추천

에이전트·코딩 워크로드라면 V4-Flash입니다. Flash-0731의 Terminal Bench 2.1은 82.7, NL2Repo 54.2, Cybergym 76.7로 Pro 0813(87.9 / 61.5 / 83.3)에 크게 밀리지 않으면서 출력 단가가 3분의 1입니다. 툴 호출을 반복하는 루프에서는 응답 속도가 체감 품질을 좌우하므로, 121.8 tok/s와 TTFT 1.12초라는 조합이 지수 1점 차보다 실질적입니다.
사실 질의·문서 검색·RAG라면 V4-Pro로 가야 합니다. 갈리는 지점이 SimpleQA-Verified인데 Pro 57.9 대 Flash 34.1로 23.8점 차입니다. 지식 정확도가 결과물의 신뢰를 결정하는 파이프라인에서 이 격차는 단가 차로 상계되지 않습니다. MRCR 1M 83.5(Pro-Max)까지 감안하면 장문 컨텍스트 검색도 Pro 쪽이 근거가 있습니다.
비용이 최우선이고 지연이 문제 되지 않는 배치 작업이라면 오프피크 스케줄링이 가장 큰 절감 수단입니다. 한국 시간 기준 평일 오전 10~13시와 15~19시가 피크 구간이므로, 이 시간대를 피해 큐를 돌리는 것만으로 출력 단가가 절반이 됩니다.
대화 품질·범용 지능이 핵심 가치인 서비스라면 V4가 최선이 아닐 수 있습니다. arena.ai에서 kimi-k3-max는 10위(1489±6)로 V4-Pro(50위, 1459±10)를 앞섭니다. 다만 Kimi K3는 2.8T 파라미터에 출력 $15/1M로 보도됐고, GPT-5.6 Sol은 $30/1M입니다. V4-Pro 오프피크 $1.98은 GPT-5.6 Sol 대비 6.6% 수준이라, 품질 격차를 감수할 여지가 있는지는 워크로드별로 계산해볼 문제입니다.
셀프 호스팅은 소규모 팀에게 현실적 대안이 아닙니다. 0813 가중치가 MIT로 공개돼 있고(HF 저장소 생성 2026-08-13T03:05:06Z, 다운로드 90,822) 라이선스 제약은 없지만, safetensors 66샤드·약 1.65TB(FP8) 규모는 다GPU 클러스터를 전제합니다.
용어 풀이
1. thinking effort — 답하기 전 모델이 내부적으로 얼마나 오래 추론할지 정하는 설정으로, 0813 GA부터 low/high/max 3단계로 노출된다.
2. 캐시히트/캐시미스 — 같은 프롬프트 앞부분을 재사용할 수 있으면 캐시히트로 저렴하게, 새 입력이면 캐시미스로 정가에 과금된다.
3. safetensors 샤드 — 큰 모델 가중치를 여러 파일로 쪼개 저장한 단위로, 개수가 많으면 그만큼 총 용량이 크다.
자주 하는 실수

첫째, 제3자 가격 트래커를 근거로 예산을 잡는 것입니다. benchlm.ai는 2026년 8월 27일 확인 시점에도 V4-Pro-0813 가격을 입력 $0.435 / 출력 $0.87로 표기하고 있습니다. 8월 16일 인상 전 값입니다. 이 값으로 산정하면 피크 시간대 실제 청구액과 최대 4.55배 벌어집니다. 가격은 반드시 공식 가격 페이지를 기준으로 잡아야 합니다.
둘째, 벤치마크 수치의 모드 표기를 확인하지 않는 것입니다. 공개된 대표 점수는 예외 없이 max 모드 값입니다. 기본 호출이나 Non-Think로 붙여 놓고 “홍보 수치가 재현되지 않는다”고 판단하면 원인을 잘못 짚습니다. thinking effort를 어디에 두고 측정했는지가 성능 비교의 전제입니다.
셋째, Flash의 단가 차를 그대로 실비 차로 계산하는 것입니다. Artificial Analysis 인텔리전스 평가에서 Flash는 210M 출력 토큰을 소비했고, Pro는 130M, 전체 중앙값은 110M이었습니다. Flash는 같은 과제에 훨씬 장황하게 답하는 경향이 있어, 출력 단가가 3분의 1이라도 총 청구액은 그만큼 내려가지 않습니다. 실제 프롬프트로 토큰 소비량을 측정한 뒤 계산하는 편이 안전합니다.
넷째, 마이그레이션 항목을 놓치는 것입니다. 구 엔드포인트 ·는 2026년 7월 24일 15:59 UTC부로 완전 폐지됐습니다. 0813부터 OpenAI Responses API 네이티브 지원과 Codex 연동이 추가된 점도 함께 반영해야 합니다.
정리
지수 53 대 52라는 1점 차이 때문에 대부분의 팀은 V4-Flash로 시작해 필요할 때만 Pro로 올리는 순서가 합리적입니다. 갈림길은 두 개뿐입니다. 지식 정확도가 결과를 결정하면 Pro(SimpleQA 57.9 대 34.1), 속도와 단가가 결정하면 Flash입니다. 예산은 2026년 8월 16일 인상 후 공식 단가로 다시 잡고, 배치 작업은 주 35시간뿐인 피크 구간을 피해 돌리는 것만으로 출력 단가가 절반이 됩니다. 다만 0813 GA의 벤치마크 향상폭은 아직 제3자 재현치가 없어, 자사 발표 수치만으로 프로덕션 전환을 확정하기에는 근거가 부족합니다.
참고 자료
조사 기준일: 2026년 08월 27일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1
– DeepSeek API Docs — V4 Preview Release (2026-04-24): https://api-docs.deepseek.com/news/news260424/ — 확인 2026-08-27
– DeepSeek API Docs — V4-Pro GA Release (2026-08-13): https://api-docs.deepseek.com/news/news260813/ — 확인 2026-08-27
– DeepSeek API Docs — V4-Flash-Vision-Exp (2026-08-21): https://api-docs.deepseek.com/news/news260821/ — 확인 2026-08-27
– DeepSeek API Docs — Change Log: https://api-docs.deepseek.com/updates/ — 확인 2026-08-27
– DeepSeek API Docs — Pricing: https://api-docs.deepseek.com/quick_start/pricing — 확인 2026-08-27
– arXiv 2606.19348 — DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence: https://arxiv.org/abs/2606.19348 — 확인 2026-08-27 (PDF 본문은 바이너리로 추출 실패, 초록만 대조)
– HuggingFace — deepseek-ai/DeepSeek-V4-Pro (프리뷰 모델카드): https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro — 확인 2026-08-27
– HuggingFace — deepseek-ai/DeepSeek-V4-Pro-0813 (GA 모델카드): https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813 — 확인 2026-08-27
– HuggingFace API — 0813 저장소 메타데이터: https://huggingface.co/api/models/deepseek-ai/DeepSeek-V4-Pro-0813 — 확인 2026-08-27
– HuggingFace — deepseek-ai/DeepSeek-V4-Flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash — 확인 2026-08-27
Tier 2
– Artificial Analysis — DeepSeek V4 Pro 0813 (max): https://artificialanalysis.ai/models/deepseek-v4-pro — 확인 2026-08-27
– Artificial Analysis — DeepSeek V4 Flash 0731: https://artificialanalysis.ai/models/deepseek-v4-flash — 확인 2026-08-27
– arena.ai (구 LMArena) 텍스트 리더보드, 기준일 2026-08-21: https://arena.ai/leaderboard/text — 확인 2026-08-27
– OpenRouter — deepseek/deepseek-v4-pro: https://openrouter.ai/deepseek/deepseek-v4-pro — 확인 2026-08-27
– OpenRouter — deepseek/deepseek-v4-flash-vision-exp: https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp — 확인 2026-08-27
– Fireworks AI — deepseek-v4-pro-0813: https://fireworks.ai/models/deepseek-ai/deepseek-v4-pro-0813 — 확인 2026-08-27
– Caixin Global (2026-08-01) — DeepSeek Releases Official V4-Flash Model: https://www.caixinglobal.com/2026-08-01/deepseek-releases-official-v4-flash-model-as-chinas-ai-race-intensifies-102470292.html — 확인 2026-08-27
– Unite.AI — DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview: https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/ — 확인 2026-08-27
– Engadget — DeepSeek’s AI models are about to cost four times more: https://www.engadget.com/2236912/deepseek-ai-models-get-four-times-pricier/ — 확인 2026-08-27
– benchlm.ai — DeepSeek V4 Pro 0813: https://benchlm.ai/models/deepseek-v4-pro-0813 — 확인 2026-08-27 (구가격 표기 사례로만 인용)

답글 남기기