하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

DeepSeek V4 로컬 실행 요건 정리 — Flash 128GB, Pro는 8장 노드

DeepSeek V4 로컬 실행 요건 정리 — Flash 128GB, Pro는 8장 노드

작성자

카테고리:

약 20분 소요

DeepSeek V4-Flash와 V4-Pro를 로컬에서 돌리기 위한 실제 요건을 vLLM 공식 레시피와 GGUF 실측치로 정리했습니다. 필요 메모리 92~169GB, Pro 체크포인트 893GB, API 오프피크 단가 비교까지 2026년 8월 기준으로 확인했습니다.

DeepSeek V4 개요

DeepSeek V4 개요

개인 하드웨어로 자가호스팅이 가능한 쪽은 V4-Flash뿐이고, V4-Pro는 8장 GPU 노드가 전제입니다. 근거는 두 가지입니다. V4-Flash-0731은 MI325X 256GB 단일 GPU(TP1)에서 공식 검증됐고 GGUF 8비트가 169GB면 로드됩니다. 반면 V4-Pro-0813은 Hugging Face 저장소 총량만 893GB에 safetensors 66샤드 구성이며, vLLM 공식 레시피가 요구하는 최소 구성이 B300 8장·H200 8장·MI355X 8×288GB·GB200 NVL4 2트레이입니다(2026년 8월 20일 확인). 이 글은 두 모델의 실행 요건을 VRAM·체크포인트 용량·양자화별 메모리·프레임워크 버전·컨텍스트 상한 다섯 축으로 정리했고, 학습 방법론이나 프롬프트 엔지니어링은 다루지 않습니다.

구성부터 짚으면 V4-Pro는 총 1.6T 파라미터에 활성 49B, V4-Flash는 총 284B에 활성 13B인 MoE 2종입니다. 컨텍스트는 양쪽 모두 1M으로 발표됐습니다. 프리뷰는 2026년 4월 24일 공개, Flash 정식판(0731)은 2026년 7월 31일, Pro GA는 2026년 8월 13일입니다. 가중치 정밀도가 혼합인 점이 실행 계획에 직접 영향을 줍니다 — MoE 전문가 파라미터는 FP4, 나머지 대부분은 FP8입니다. 라이선스는 리포지터리와 가중치 모두 MIT라 상용 자가호스팅에 걸림돌이 없습니다.

주의할 대목은 DeepSeek 공식 모델카드에 최소 GPU·VRAM 요건이 없다는 사실입니다. 이 글의 하드웨어 수치는 vLLM 공식 레시피와 NVIDIA 모델카드를 1차 근거로 삼았고, GGUF 메모리 요건은 Unsloth 문서와 제3자 실측을 2차 근거로 구분해 표기했습니다.


1. Flash vs Pro — 자가호스팅 가능선이 갈리는 지점

1. Flash vs Pro — 자가호스팅 가능선이 갈리는 지점

실질적인 판단은 모델 선택이 아니라 “8장 노드를 가졌는가”입니다. vLLM 공식 레시피가 검증한 구성을 그대로 옮기면 경계선이 뚜렷합니다.

구분 V4-Flash-0731 V4-Pro-0813
총/활성 파라미터 284B / 13B 1.6T / 49B
공식 검증 최소 구성 DGX Station 1 GPU(TP1), MI325X 1×256GB(TP1) B300 8장 또는 H200 8장
대체 검증 구성 MI355X 4×288GB(TP4), RTX PRO 6000 8×96GB(TP8) MI355X 8×288GB, GB200 NVL4 2트레이(4+4)
체크포인트 148.66 GiB(MI325X 검증 기준) 약 960GB 혼합정밀도 / 디스크 893GB
병렬 설정 TP1~TP8 TP8 + DP8, kv-cache fp8
컨텍스트 제약 MI325X 검증 시 max-model-len 4096 H200 8장 구성은 800K 상한
vLLM 요건 0.25.0+ (DSpark 사용 시) 0.20.0+, 융합 체크포인트는 0.25.0

Flash 쪽에서 눈여겨볼 부분은 DSpark 추론 가속(speculative decoding) 모듈입니다. V4-Flash-0731에는 이 모듈이 함께 붙어 있고, 그래서 Hugging Face 헤더 표기가 304B(본체 284B + 드래프트 모듈)로 나옵니다. RTX PRO 6000 8×96GB에서 DSpark을 함께 쓰려면 vLLM nightly 이미지가 필요하다는 조건이 레시피에 붙어 있습니다.

Pro 쪽은 숫자만 봐도 개인 범위를 벗어납니다. 66샤드 중 첫 샤드가 1.85GB, 이후 13.9GB 단위로 이어지고 총 893GB입니다. 프리뷰 시점 가중치는 865GB였으니 정식판에서 28GB 늘었습니다. 다운로드 대역폭과 디스크 I/O만으로도 사전 준비가 하루 단위 작업이 됩니다.

파라미터 표기가 자료마다 어긋나는 점은 짚어둘 필요가 있습니다 — Flash가 284B(발표) vs 304B(HF 헤더), Pro가 1.6T(발표)·1.7T(HF 헤더)·1.57T/48B(Unsloth) 로 갈립니다. 드래프트 모듈 포함 여부 차이로 추정되지만 공식 문서로 확인하지 못했습니다.


2. GGUF 양자화별 실제 메모리 요건

2. GGUF 양자화별 실제 메모리 요건

소비자 GPU나 CPU 환경이라면 vLLM 경로가 아니라 GGUF(llama.cpp·Ollama·LM Studio) 경로만 실용적입니다. Unsloth 문서가 공개한 Flash-0731 기준 요건은 다음과 같습니다(공식 발표가 아닌 제3자 배포 문서 기준).

양자화 필요 메모리 파일 크기
1비트(UD-IQ1_S) 92GB 82.5GB
2비트 102GB
3비트(UD-IQ3_XXS) 110~135GB 103~104GB
4비트(UD-Q4_K_XL) 162GB 155GB
8비트(UD-Q8_K_XL) 169GB 162GB

DSpark을 병용하면 각 티어에 약 10GB가 추가됩니다. 드래프트는 별도 파일로 배포되며 Q8_0이 10.9GB, BF16이 11.3GB입니다.

여기서 중요한 함정이 하나 있습니다. 이미 FP4로 학습된 모델이라 저비트 양자화의 용량 이득이 거의 없습니다. Pro-0813 GGUF를 보면 UD-Q4_K_XL이 850GB, UD-Q8_K_XL이 873GB로 차이가 23GB에 불과합니다. “4비트로 내리면 절반이 되겠지”라는 통상적 계산이 이 모델에서는 성립하지 않습니다. Unsloth 문서도 Pro-0813이 1.57T 파라미터·토큰당 48B 활성이라 Flash-0731보다 훨씬 많은 메모리를 요구한다고 적고 있습니다.

속도 쪽 실측이 이 판단을 뒷받침합니다. MI300X 192GB HBM3 환경에서 양자화 5종을 돌린 측정치가 36.92~37.75 t/s 범위로 사실상 동일했습니다. 파일 크기가 1.4배 차이나도 생성 속도가 안 변한다는 뜻이고, 병목이 연산이 아니라 메모리 대역폭이라는 해석으로 이어집니다. 용량을 줄여 속도를 얻으려는 전략은 여기서 통하지 않습니다.

실행 플래그는 llama.cpp 기준 --n-gpu-layers 2, DSpark 사용 시 --spec-draft-n-max 3이 권장됩니다. 이 조합으로 B200 1장에서 60 t/s → 120 t/s(1.9배) 로 보고됐습니다. 단 DSpark의 수용률과 품질 영향을 잰 제3자 측정치는 아직 없고, 1.9배·2배는 모두 제공자 측 수치입니다.


3. CPU 전용 실행 — 로드는 되지만 쓸 만한지는 다른 문제

3. CPU 전용 실행 — 로드는 되지만 쓸 만한지는 다른 문제

“내 PC에서 돌아간다”와 “업무에 쓸 수 있다”를 구분해야 합니다. CPU 전용 실측 사례가 이 간극을 정확히 보여줍니다.

항목 실측값
CPU Xeon 8코어/16스레드
사용 가능 RAM 123GiB
빌드 llama.cpp b10273
모델 UD-IQ3_XXS(97.05GiB 로드)
프리필(512토큰) 12.33 t/s
생성(128토큰) 5.61 t/s
피크 메모리 109,503,840 KiB
컨텍스트 32,768에서 스왑 없이 유지

생성 5.61 t/s는 초당 다섯 토큰 남짓입니다. 코드 리뷰나 장문 요약처럼 출력이 긴 작업에서는 응답 하나에 수 분이 걸립니다. 배치 처리·야간 파이프라인이라면 감당하겠지만 대화형 사용에는 부적합한 구간입니다.

RAM 산정도 주의가 필요합니다. Unsloth 문서의 3비트 권장치가 110GB인데 실측 피크가 십진 환산 약 112GB입니다. 권장치는 “가중치가 들어가는 지점”이고 OS·KV 캐시·프레임워크 여유는 별도라는 뜻이므로, 3비트 구성이라면 128GB를 하한으로 잡는 편이 안전합니다.

1M 컨텍스트를 기본값으로 열지 않는 것도 실무 규칙입니다. 채팅 용도는 8,192, 코드 작업은 32,768에서 시작하라는 권고가 로컬 가이드 쪽에서 반복됩니다. Think Max 추론 모드만 예외적으로 384K 이상으로 잡으라고 공식 모델카드가 권고합니다.

참고로 1M KV 캐시의 실측 메모리 수치는 확인하지 못했습니다. “총 메모리 170~175GB(가중치 158GB + 1M KV 약 10GB)” 형태로 유통되는 수치가 있으나 1차 출처를 찾지 못해 인용하지 않습니다. V4 기술 리포트 원문(arXiv 2606.19348로 표기됨)도 PDF 파싱에 실패해 본문 대조가 안 된 상태입니다.


4. Blackwell NVFP4 경로와 프레임워크 버전 함정

4. Blackwell NVFP4 경로와 프레임워크 버전 함정

Blackwell 세대 GPU를 가졌다면 GGUF보다 NVFP4 양자화판이 유리합니다. NVIDIA가 2026년 5월 28일 V4-Flash NVFP4 양자화판을 nvidia-modelopt v0.44.0 기준으로 공개했습니다.

항목 원본 NVFP4
GPQA Diamond 0.894 0.891
AA-LCR 0.658 0.655

정확도 손실이 소수점 셋째 자리 수준입니다. 대가는 프레임워크 요구 조건입니다 — GB300에서 TP4/TP8이 검증됐고, vLLM은 0.22.1rc1.dev504라는 특정 dev 빌드에서 확인됐으며, SGLang은 PR #25820이 필요합니다. 병합되지 않은 PR을 전제로 한다는 말은 운영 환경에 그대로 올리기 어렵다는 뜻입니다.

버전 요건을 한 번 더 정리하면 다음과 같습니다.

경로 최소 요건
Flash 기본(vLLM) vLLM 0.25.0+(DSpark 사용 시)
Flash + RTX PRO 6000 + DSpark vLLM nightly 이미지
Pro 기본 vLLM 0.20.0+
Pro + DSpark 융합 체크포인트 vLLM 0.25.0
NVFP4 vLLM 0.22.1rc1.dev504 / SGLang은 미병합 PR
GGUF llama.cpp b10273 이상에서 실측 확인

구 모델명을 참조하는 코드가 남아 있다면 즉시 정리해야 합니다. deepseek-chat과 deepseek-reasoner는 2026년 7월 24일 이후 완전 폐지됐습니다. Pro GA와 함께 Responses API 네이티브 지원과 thinking effort 3단계(low/high/max) 가 추가됐으니 호출 계층도 함께 손보는 편이 낫습니다.


5. API vs 로컬 — 단가로는 API가 이깁니다

5. API vs 로컬 — 단가로는 API가 이깁니다

비용만 놓고 보면 자가호스팅이 API를 이기는 구간이 좁습니다. 2026년 8월 16일 16:00 UTC부터 피크/오프피크 이원화가 적용됐고 오프피크는 정확히 피크의 절반입니다(2026년 8월 20일 확인, 100만 토큰당 USD).

모델 캐시미스 입력 캐시히트 입력 출력
v4-flash 오프피크 $0.22 $0.007 $0.66
v4-flash 피크 $0.44 $0.014 $1.32
v4-pro 오프피크 $0.66 $0.022 $1.98
v4-pro 피크 $1.32 $0.044 $3.96

피크 시간대는 01:00–04:00, 06:00–10:00 UTC이고 그 외는 전부 오프피크입니다. 컨텍스트 1M, 최대 출력 384K가 공통 조건입니다. 배치성 작업을 오프피크로 옮기는 것만으로 비용이 절반이 되므로 스케줄링이 가장 값싼 최적화입니다. 일부 매체가 $0.435/$0.87로 표기한 사례가 있는데 공식 가격표와 어긋나고 기준 시점·산출 방식도 불명입니다.

그러니 로컬을 택하는 근거는 단가가 아닙니다. v4-flash 오프피크 출력이 100만 토큰당 1달러 미만인데 로컬 3비트 CPU 구성은 생성 5.61 t/s입니다. 자가호스팅의 정당한 사유는 데이터 통제(외부 전송 금지 업무), 오프라인 요건, 장기 상시 부하 세 가지로 좁혀집니다.

품질 위치도 참고할 만합니다. Artificial Analysis Intelligence Index v4.1.1 기준 Pro-0813(max)이 53점으로 107개 모델 중 3위, 출력 77.0 t/s, TTFT 1.67초입니다. 세부는 GPQA Diamond 93%, Terminal-Bench v2.1 79%, GDPval-AA v2 55%, HLE 39%, SciCode 49%, CritPt 18% 입니다. Flash-0731은 v4.1.1 기준 52점, 출력 107.2 t/s, TTFT 1.22초이고 출시 시점 v4.1에서는 50점, GDPval-AA v2 Elo 1559, 출력 토큰 사용량이 전세대 대비 12% 감소(약 206M) 로 측정됐습니다.

발표 수치와 독립 측정 사이의 간극은 알고 있어야 합니다. DeepSeek 자체 발표는 Pro-0813 Terminal Bench 2.1이 87.9, HLE 42.7/60.0인데 AA 측정은 각각 79%와 39%입니다. DeepSeek가 하네스·시도 횟수·effort를 공개하지 않아 직접 대조가 불가능하고, HLE 60.0이 도구·검색 허용 조건인지는 공식 문서에 명시가 없습니다. Flash-0731 발표치는 Terminal Bench 2.1 82.7, NL2Repo 54.2입니다.

마지막으로 체크포인트 용량 표기가 자료마다 다릅니다 — HF 167GB, vLLM 레시피 148.66 GiB, BF16 GGUF 162GB. 드래프트 모듈과 정밀도 포함 범위가 문서별로 달라 보이지만 어느 기준이 맞는지는 확인하지 못했습니다. 스토리지를 산정할 때는 가장 큰 값에 여유를 더해 잡는 편이 안전합니다.


정리

V4-Flash-0731은 단일 256GB GPU 또는 8×96GB에서 공식 검증됐고, GGUF 8비트 169GB면 128~192GB급 워크스테이션에 들어갑니다. 반면 V4-Pro-0813은 8장 노드와 893GB 디스크가 전제라 개인 하드웨어 범위를 벗어납니다. FP4 네이티브 모델이라 저비트 양자화의 용량 이득이 거의 없고(Pro Q4 850GB vs Q8 873GB) MI300X 실측에서 양자화 티어를 바꿔도 속도가 37 t/s 부근에 머물렀으니, 병목은 연산이 아니라 대역폭입니다. 1M 컨텍스트를 기본값으로 열지 말고(H200 8장 구성도 800K 상한) 채팅 8,192·코드 32,768에서 시작하는 편이 안전하며, 비용만 따진다면 오프피크 API가 로컬보다 저렴한 구간이 넓습니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 20일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (모두 2026-08-20 확인)
– DeepSeek API Docs, DeepSeek V4 Preview Release (2026-04-24): https://api-docs.deepseek.com/news/news260424/
– DeepSeek API Docs, DeepSeek-V4-Pro GA Release (2026-08-13): https://api-docs.deepseek.com/news/news260813/
– DeepSeek API Docs, Change Log: https://api-docs.deepseek.com/updates/
– DeepSeek API Docs, Models & Pricing: https://api-docs.deepseek.com/quick_start/pricing/
– HF deepseek-ai/DeepSeek-V4-Pro: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
– HF deepseek-ai/DeepSeek-V4-Flash: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
– HF deepseek-ai/DeepSeek-V4-Flash-0731: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
– HF deepseek-ai/DeepSeek-V4-Pro-0813 파일 목록(893GB, 66샤드): https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813/tree/main
– HF nvidia/DeepSeek-V4-Flash-NVFP4 (2026-05-28): https://huggingface.co/nvidia/DeepSeek-V4-Flash-NVFP4
– vLLM Recipes, DeepSeek-V4-Flash: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
– vLLM Recipes, DeepSeek-V4-Pro: https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Pro
– (파싱 실패) DeepSeek V4 Model Card PDF: https://fe-static.deepseek.com/chat/transparency/deepseek-V4-model-card-EN.pdf
Tier 2 (모두 2026-08-20 확인)
– Unsloth Docs, DeepSeek-V4: How to Run Locally: https://unsloth.ai/docs/models/deepseek-v4
– HF unsloth/DeepSeek-V4-Flash-0731-GGUF: https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
– HF unsloth/DeepSeek-V4-Pro-0813-GGUF: https://huggingface.co/unsloth/DeepSeek-V4-Pro-0813-GGUF
– ComputingForGeeks, Run DeepSeek V4 Flash Locally: https://computingforgeeks.com/run-deepseek-v4-flash-locally/
– Atomic Chat, How to Run DeepSeek V4 Flash Locally: https://atomic.chat/blog/guides/how-to-run-deepseek-v4-flash-locally
– Artificial Analysis, DeepSeek V4 Flash 0731: https://artificialanalysis.ai/models/deepseek-v4-flash
– Artificial Analysis, V4 Flash 0731 scores 50 (v4.1): https://artificialanalysis.ai/articles/deepseek-v4-flash-0731-scores-50-on-the-artificial-analysis-intelligence-index-10-points-above-previous-deepseek-v4-flash
– Artificial Analysis, DeepSeek V4 Pro 0813: https://artificialanalysis.ai/models/deepseek-v4-pro
– OfficeChai, DeepSeek V4 0813 Pro Benchmarks: https://officechai.com/ai/deepseek-v4-0813-pro-benchmarks/
– Simon Willison, deepseek-ai/DeepSeek-V4-Flash-0731 (2026-07-31): https://simonwillison.net/2026/Jul/31/deepseek-v4-flash-0731/


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다