딥시크 V4.1 플래시가 2026년 9월 10일 출시되고 V4 Pro는 9월 14일 하선됩니다. 공식 문서에 없는 것과 확인된 요금·일정을 기준별로 나눠 비교 정리했습니다.
딥시크 V4.1 플래시, 무엇을 기준으로 비교해야 할까

지금 딥시크를 쓰고 있다면 성능 비교보다 일정 확인이 먼저입니다. 2026년 9월 10일 12시(베이징 시간) V4.1 플래시가 정식 출시됐고, 상위 모델인 V4 Pro는 2026년 9월 14일 12시에 서비스가 내려갑니다. 하선 이후 V4 Pro로 보낸 요청은 자동으로 V4.1 플래시로 넘어가고 V4.1 플래시 요금이 붙습니다(IT之家 2026-09-10 보도 기준). 사용자가 모델을 고르는 게 아니라, 쓰던 모델이 회수되는 구조입니다.
이 글이 비교하는 대상은 세 가지입니다. 첫째, 하선되는 V4 Pro와 그 자리를 대신할 V4.1 플래시의 요금 구조 차이. 둘째, 같은 날 함께 시행된 플래시 계열 가격 인하가 항목별로 얼마나 다른지. 셋째, 회사 발표와 공식 문서에 실제로 적혀 있는 것 사이의 간극입니다.
먼저 밝혀둘 것이 있습니다. 2026년 9월 10일 기준 딥시크 영문 API 공식 문서에는 deepseek-v4.1-flash라는 모델이 없습니다. 모델 목록은 , , 셋뿐이고, 체인지로그의 마지막 항목도 2026년 8월 21일에 멈춰 있습니다. 출시 소식은 로그인이 필요한 개발자 콘솔 공지와 이메일, 중국 매체 보도로만 전해졌습니다. 그래서 이 글은 공식 문서로 확인된 것과 매체 보도로만 확인된 것을 매번 구분해서 표기합니다. 파라미터 수·컨텍스트 길이·벤치마크 점수처럼 아직 공개되지 않은 항목은 빈칸으로 남겨둡니다. 틀린 숫자보다 빈칸이 낫습니다.
용어 풀이
1. 라우팅 — 사용자가 지정한 모델이 사라졌을 때, 요청을 다른 모델로 대신 넘겨 처리하는 방식.
2. 컨텍스트 윈도우 — 모델이 한 번에 읽고 기억하는 글의 최대 길이로, 토큰 단위로 셉니다.
3. 토큰 — 모델이 글을 잘라 처리하는 최소 단위이며, 과금도 이 단위로 이뤄집니다.
비교 기준 정리
모델을 바꿔야 하는 상황에서 실제로 판단을 좌우하는 축은 네 개입니다. 성능 점수 하나로 줄 세우는 방식은 이번 건에 쓸 수 없습니다. V4.1 플래시의 공식 벤치마크 점수가 공개된 적이 없기 때문입니다.
| 기준 | 단위·표기 | 확인 상태 | 주의점 |
|---|---|---|---|
| 요금(입력·출력) | 1M 토큰당 위안 또는 USD | 위안 기준만 T2 확인 | 캐시 히트·미스·출력 세 항목이 각각 다르게 움직임 |
| 시간대 할증 | 피크/오프피크 배수 | 공식 문서 확인 | 피크는 오프피크의 2배 |
| 하선 일정 | 날짜·현지 시각 | 매체 보도 기준 | 코드에 모델명이 박혀 있으면 조용히 바뀜 |
| 지능 지표 | Artificial Analysis Intelligence Index | V4 계열만 존재 | V4.1은 제3자 리더보드 미등재 |
| 컨텍스트·출력 한도 | 토큰 | V4 계열만 공식 표기 | V4.1 승계 여부 미확인 |
| 가중치 공개 | 라이선스 | V4-Flash-0731은 MIT | V4.1 모델카드 없음 |
여기서 가장 자주 오해되는 게 요금을 한 덩어리로 보는 습관입니다. 딥시크 요금은 캐시 히트 입력, 캐시 미스 입력, 출력 세 항목으로 나뉘고, 이번 인하는 세 항목이 전혀 다른 폭으로 내려갔습니다. 여기에 2026년 8월 16일 16시(UTC)부터 시행된 피크/오프피크 제도가 겹칩니다. 피크 시간대는 UTC 기준 월–금 01:00–04:00과 06:00–10:00이며, 나머지 시간은 모두 오프피크로 절반 요금입니다. 베이징 시간으로는 월–금 09–12시, 14–18시입니다.
두 번째 기준인 지능 지표는 참고용으로만 씁니다. Artificial Analysis 측정에서 2026년 7월 31일 공개된 V4 Flash 0731은 Intelligence Index v4.3 기준 50점으로, GPT-5.6 Luna(max) 51점, Gemini 3.6 Flash 50점과 같은 구간이었습니다. 흥미로운 건 같은 측정에서 V4 Pro가 44점이었다는 점입니다. 상위 모델이라는 이름과 지표가 어긋나는 셈인데, 이번 하선 결정도 이 맥락에서 읽을 수 있습니다.
옵션·유형별 비교

공식 문서에 적힌 요금 (2026년 9월 10일 기준, USD·1M 토큰당)
| 항목 | deepseek-v4-flash | deepseek-v4-pro | 배수 |
|---|---|---|---|
| 캐시 히트 입력(오프피크) | $0.007 | $0.022 | 약 3.1배 |
| 캐시 히트 입력(피크) | $0.014 | $0.044 | 약 3.1배 |
| 캐시 미스 입력(오프피크) | $0.22 | $0.66 | 3배 |
| 캐시 미스 입력(피크) | $0.44 | $1.32 | 3배 |
| 출력(오프피크) | $0.66 | $1.98 | 3배 |
| 출력(피크) | $1.32 | $3.96 | 3배 |
| 컨텍스트 / 최대 출력 | 1M / 384K 토큰 | 1M / 384K 토큰 | 동일 |
V4 Pro를 쓰던 이용자 입장에서 하선 후 라우팅은 비용이 3분의 1로 줄어드는 방향입니다. 문제는 비용이 아니라 응답 품질이 바뀌는데 선택권이 없다는 점입니다.
같은 날 시행된 플래시 계열 인하 (위안 기준, 오프피크·1M 토큰당)
| 항목 | 인하 전 | 인하 후 | 인하폭 |
|---|---|---|---|
| 캐시 히트 입력 | 0.05위안 | 0.02위안 | 60% 인하 |
| 캐시 미스 입력 | 1.5위안 | 1위안 | 33.3% 인하 |
| 출력 | 4.5위안 | 4위안 | 11.1% 인하 |
“최대 60% 인하”라는 표현이 어디서 나왔는지 여기서 드러납니다. 60%는 캐시 히트 입력 한 항목의 이야기이고, 실사용 비중이 큰 출력은 11.1%에 그칩니다. 게다가 이 인하는 2026년 8월 16일 피크 요금제 도입으로 한 차례 올랐던 구조 위에서 이뤄진 것이라, 체감 절감은 발표 문구보다 작을 수 있습니다. 참고로 위안 기준 신규 요금은 중국 매체 보도로 확인된 값이며, 공식 USD 가격표에는 2026년 9월 10일 기준 아직 반영되지 않았습니다(확인 필요).
발표와 문서 사이의 간극
| 항목 | 회사 측 설명 | 문서로 확인된 것 |
|---|---|---|
| 모델 등재 | 정식 출시 | 영문 API 문서 모델 목록·체인지로그에 없음 |
| “모든 지표에서 V4 Pro 초과” | 자체 표현 | 근거 벤치마크 표·측정 조건 미공개 |
| 네이티브 멀티모달 | 텍스트·이미지·음성 통합 | 모달리티별 과금 규정 없음, vision-exp의 이미지 384토큰 규정 승계 여부 불명 |
| 파라미터·컨텍스트 | 발표 없음 | 전부 미확인. V4-Flash의 284B/13B·1M을 V4.1에 적용할 근거 없음 |
| 가중치 | V4-Flash는 MIT 공개 | V4.1 저장소·모델카드 없음(HuggingFace 2026-09-10 확인) |
| 출력 속도 | 매체별 tok/s 수치 유통 | 전부 동시 요청 20개로 제한된 베타 엔드포인트 측정. 매체 간 편차 2배 이상이라 이 글에서는 수치를 쓰지 않음 |
용어 풀이
1. 캐시 히트 — 앞서 보낸 것과 같은 앞부분 프롬프트를 재사용할 때 적용되는 저렴한 입력 요금.
2. MoE(전문가 혼합) — 거대한 모델의 일부 전문가 블록만 골라 켜서 계산량을 줄이는 구조로, V4-Pro는 총 1.6조 중 490억만 활성화합니다.
3. 오프피크 — 사용량이 적은 시간대에 적용되는 할인 요금 구간으로, 딥시크는 피크의 절반을 받습니다.
상황별 추천

V4 Pro를 코드에 고정해 쓰고 있다면 — 이번 주가 마감입니다. 문자열이 하드코딩된 곳을 지금 찾아보시기 바랍니다. 2026년 9월 14일 12시(베이징) 이후에는 에러 없이 조용히 다른 모델이 응답합니다. 실패보다 위험한 건 아무 경고 없이 결과 품질만 달라지는 상황입니다. 하선 전에 자체 회귀 테스트 세트로 V4 Pro와 V4.1 플래시의 출력을 직접 대조해두는 편이 안전합니다. 공식 벤치마크가 없으니 남의 점수를 기다릴 이유도 없습니다.
반복 프롬프트가 많은 워크로드라면 — 이번 인하의 최대 수혜 대상입니다. 시스템 프롬프트가 길고 고정적인 챗봇, 문서 QA, 분류 작업처럼 캐시 적중률이 높은 구조는 캐시 히트 입력 60% 인하가 그대로 반영됩니다. 반면 긴 글을 생성하는 용도가 주력이라면 출력 11.1% 인하뿐이라 체감이 작습니다.
야간·주말 배치 작업이 가능하다면 — 시간대 조정이 인하폭보다 큽니다. 피크와 오프피크는 2배 차이입니다. 요금 인하 11.1%를 따지기 전에, 배치 스케줄을 피크 구간(UTC 월–금 01–04시, 06–10시) 밖으로 옮기는 것만으로 절반이 절약됩니다.
이미지 입력이 필요하다면 — 아직 기다리는 쪽을 권합니다. 2026년 9월 10일 기준 공식 문서상 이미지 입력의 유일한 경로는 이고, 이미지 1장당 최대 384토큰으로 V4-Flash 요율에 따라 과금됩니다. V4.1 플래시가 이를 대체하는지는 공지되지 않았습니다.
가중치를 직접 내려받아 운영해야 한다면 — 현재는 선택지가 없습니다. V4-Flash-0731은 MIT 라이선스로 공개돼 있지만, V4.1 플래시는 가중치도 모델카드도 없습니다.
자주 하는 실수

첫째, “최대 60% 인하”를 전체 요금 인하로 읽는 것입니다. 세 요금 항목 중 실제 지출을 지배하는 건 대개 출력 토큰입니다. 캐시 히트 입력은 오프피크 기준 1M 토큰에 0.02위안으로 원래도 작은 항목이었습니다. 자기 워크로드의 입력·출력 비율과 캐시 적중률을 먼저 뽑아본 뒤에 절감액을 계산해야 실제와 맞습니다.
둘째, 유통되는 속도 수치를 프로덕션 예측치로 쓰는 것입니다. 지금 돌아다니는 tok/s 값은 모두 개별 개발자가 동시 요청 20개로 제한된 2일짜리 베타 엔드포인트(2026년 9월 8일 개시, 9월 10일 종료)에 던진 측정치입니다. 딥시크 공식 수치는 한 건도 없고 매체 간 편차가 2배를 넘습니다. 정식판의 동시 요청 한도조차 아직 공개되지 않았습니다.
셋째, V4-Flash의 스펙을 V4.1에 그대로 옮겨 적는 것입니다. arXiv에 실린 V4 기술 리포트(2026년 4월 26일 제출)의 284B/13B, 1M 컨텍스트, 32T 토큰 사전학습은 V4 기준 수치입니다. V4.1이 같은 규모인지는 알려진 바가 없습니다. 도입 검토 문서에 이 숫자를 옮겨 적으면, 근거의 등급이 조용히 올라간 채로 의사결정이 이뤄집니다.
정리
딥시크 V4.1 플래시 전환에서 실제로 급한 것은 성능 비교가 아니라 2026년 9월 14일 12시(베이징)라는 V4 Pro 하선 일정입니다. 요금은 캐시 히트 60%·캐시 미스 33.3%·출력 11.1%로 항목마다 다르게 내려갔으므로, 자기 워크로드의 캐시 적중률과 출력 비중으로 다시 계산해야 실제 절감액이 나옵니다. 파라미터·컨텍스트·벤치마크·정식 USD 요금은 2026년 9월 10일 기준 공식 문서에 없으니, 도입 판단은 남의 수치가 아니라 자체 회귀 테스트 결과로 내리는 편이 안전합니다. 시간대를 피크 밖으로 옮기는 쪽이 이번 인하보다 절감 효과가 큽니다.
참고 자료
조사 기준일: 2026년 09월 10일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (원문 대조 완료)
– DeepSeek API Docs — Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing (2026-09-10 확인)
– DeepSeek API Docs — Change Log: https://api-docs.deepseek.com/updates/ (2026-09-10 확인)
– DeepSeek API Docs — Your First API Call(모델 목록): https://api-docs.deepseek.com/ (2026-09-10 확인)
– DeepSeek API Docs — DeepSeek-V4-Pro Update(2026-08-13, 가격 개편): https://api-docs.deepseek.com/news/news260813 (2026-09-10 확인)
– DeepSeek API Docs — DeepSeek-V4-Flash-Vision-Exp Release(2026-08-21): https://api-docs.deepseek.com/news/news260821 (2026-09-10 확인)
– arXiv — DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence: https://arxiv.org/abs/2606.19348 (2026-09-10 확인)
– HuggingFace — deepseek-ai 조직 모델 목록: https://huggingface.co/deepseek-ai (2026-09-10 확인)
Tier 2 (독립 검증·매체 취재)
– Artificial Analysis — DeepSeek V4 Flash 0731 scores 50 on the Intelligence Index: https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash (2026-09-10 확인)
– Techmeme — 2026-07-31 헤드라인(AA 50점, Gemini 3.6 Flash 동급): https://www.techmeme.com/260731/p22 (2026-09-10 확인)
– TechNode — DeepSeek begins limited-time beta of V4.1 Flash multimodal model (2026-09-09): https://technode.com/2026/09/09/deepseek-v4-1-flash-multimodal-limited-beta/ (2026-09-10 확인)
– 新浪科技 — DeepSeek 新模型悄悄内测,Flash 9月10日全线大降价 (2026-09-09): https://finance.sina.com.cn/tech/roll/2026-09-09/doc-inirexha3896758.shtml (2026-09-10 확인)
– 网易科技 — DeepSeek V4 Flash明日降价,V4.1 Flash已内测 (2026-09-09): https://www.163.com/tech/article/L6CBBJSO00097U7T.html (2026-09-10 확인)
– IT之家 — DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9月14日下线 (2026-09-10): https://www.ithome.com/1/000/692.htm (2026-09-10 확인)
– CellCog — DeepSeek V4.1 Flash Release Date(개발자 콘솔 공지 경위 정리): https://cellcog.ai/blog/deepseek-v4-1-flash-release-date/ (2026-09-10 확인)
– OrcaRouter — DeepSeek V4.1 Flash API Beta: What We Know Before Launch (2026-09-08): https://www.orcarouter.ai/blog/deepseek-v4-1-flash-leak (2026-09-10 확인)
– Artificial Analysis 모델 페이지(https://artificialanalysis.ai/models/deepseek-v4-flash) — fetch 결과가 같은 기관 기사와 충돌(35 vs 50). 기사 쪽을 채택하고 페이지 수치는 폐기.
– DeepSeek 개발자 콘솔 공지 원문 — 로그인 필요로 접근 불가. V4.1 Flash 관련 서술은 전부 T2 전언 기준.

답글 남기기