하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

로컬 LLM 돌릴 GPU 고르는 법: VRAM·대역폭 우선순위 총정리

로컬 LLM 돌릴 GPU 고르는 법: VRAM·대역폭 우선순위 총정리

작성자

카테고리:

약 21분 소요


로컬 LLM GPU 핵심만 먼저 정리하면

로컬 LLM용 GPU 선택은 “어느 카드가 더 빠른가”가 아니라 “내가 쓸 모델이 VRAM에 들어가는가”에서 시작합니다. Puget Systems가 2025년 7월 18일 공개한 VRAM 사이징 자료를 보면, VRAM을 초과해 시스템 RAM으로 오프로드가 발생하는 순간 같은 하드웨어에서 27B 모델이 12B보다 약 30배 느려집니다. 아무리 좋은 GPU를 사도 이 격차는 회복되지 않습니다.

모델이 VRAM에 들어간 다음에야 두 번째 요소가 의미를 갖습니다. 응답 속도, 곧 토큰 생성 속도를 좌우하는 것은 메모리 대역폭입니다. 연산력(AI TOPS)은 세 번째로, 주로 프롬프트 처리 구간에서만 영향을 줍니다. 실제로 RTX 5090(32GB)과 RTX PRO 6000 Blackwell(96GB)은 메모리 대역폭이 1,792GB/s로 같고 종합 성능 차이도 10~15%에 그칩니다. 그런데 gpt-oss 120B는 PRO 6000에서 163.15 tok/s로 돌아가는 반면 5090에서는 로드조차 되지 않습니다. GPU를 사기 전 던져야 할 첫 질문이 예산이 아니라 “어느 크기의 모델을, 몇 명이 동시에 쓸 것인가”인 이유입니다.


Q1. RTX 5090 32GB와 RTX PRO 6000 96GB는 성능 차이가 얼마나 나나요?

Q1. RTX 5090 32GB와 RTX PRO 6000 96GB는 성능 차이가 얼마나 나나요?

연산 성능만 보면 차이가 거의 없습니다. 두 제품은 같은 Blackwell 실리콘 계열을 쓰고 메모리 대역폭도 1,792GB/s로 완전히 같습니다. Tom’s Hardware 실측에서 RTX PRO 6000은 스톡 RTX 5090보다 평균 10~15% 빠른 수준에 그쳤고, 3DMark 일부 항목에서는 오버클럭한 5090이 오히려 5~10% 앞섰습니다. 가격 차이를 성능 격차로 설명할 수는 없다는 뜻입니다.

항목 RTX 5090 RTX PRO 6000 (WS) RTX PRO 6000 Max-Q
메모리 32GB GDDR7 96GB GDDR7 ECC 96GB GDDR7 ECC
대역폭 1,792GB/s 1,792GB/s 1,792GB/s
CUDA 코어 21,760개
AI 성능 3,352 AI TOPS 4,000 AI TOPS 3,511 AI TOPS
최대 소비전력 575W (TGP) 600W 300W
MIG 지원 미지원 지원(최대 4) 지원(최대 4)

진짜 갈림길은 실행 가능 여부입니다. StorageReview의 LM Studio 단일 스트림 실측에서 RTX PRO 6000은 gpt-oss 120B를 163.15 tok/s로 돌렸지만, 리뷰어는 “RTX 5090은 120B 모델을 아예 로드·실행하지 못한다”고 못박았습니다. 96GB 메모리 풀의 가치는 속도가 아니라 실행 범위 자체에 있습니다. 거꾸로 30B 이하 모델만 쓸 계획이 확실하다면 PRO 6000은 명백한 과투자이고, 5090이 합리적입니다. 참고로 RTX PRO 6000의 공식 MSRP는 NVIDIA가 공개하지 않았습니다. Tom’s Hardware가 보도한 $13,250은 유통 채널가라 정가 근거로 쓸 수 없습니다(2026년 8월 확인 시점 기준).


Q2. 70B 모델을 돌리려면 VRAM이 정확히 얼마나 필요한가요?

Q2. 70B 모델을 돌리려면 VRAM이 정확히 얼마나 필요한가요?

가장 많이 틀리는 지점입니다. 모델 가중치 크기만 보고 “70B니까 Q4면 40GB 정도면 되겠지”라고 계산하면 실서비스에 투입하는 순간 반드시 모자랍니다. 실제 VRAM 소요량은 모델 가중치 + KV 캐시 + 동시 사용자 수의 함수입니다.

Puget Systems가 2025년 7월 18일 공개한 사이징 자료의 사례를 보면, DeepSeek-R1 70B를 Q8 추론 + FP16 KV 캐시 + 8K 컨텍스트 + 동시 사용자 8명 조건으로 운영하려면 약 125GB VRAM이 듭니다. 96GB 단일 카드로도 감당이 안 되는 수치입니다.

사용 시나리오 권장 구성 근거
30B 이하 Q4~Q8, 단일 사용자 RTX 5090 32GB 대역폭 1,792GB/s로 동급 최고 수준
70B Q4~Q6, 단일~소수 사용자 RTX PRO 5000 72GB 2025-12-18 정식 출시, 2,142 AI TOPS
70B~120B, ECC·상시 가동 RTX PRO 6000 96GB gpt-oss 120B 163.15 tok/s 실측
70B급 다중 사용자(8명 이상) Max-Q 2장(96GB×2=192GB) 300W×2 구성으로 PSU 여유 확보

여기서 Max-Q 판본이 왜 나왔는지가 드러납니다. 성능은 3,511 AI TOPS로 약 12% 낮지만 최대 소비전력이 600W에서 300W로 절반입니다. 같은 섀시, 같은 PSU에 두 장을 넣을 수 있다는 얘기입니다. 다중 사용자 시나리오 대부분에서는 96GB를 600W로 쓰기보다 192GB를 600W로 확보하는 쪽이 낫습니다. RTX PRO 5000 72GB는 검색 요약에 1,344GB/s·14,080 CUDA·300W라는 수치가 반복해서 나오지만 NVIDIA 공식 페이지에서 직접 확인되지 않습니다. 견적서에 넣기 전 PNY 등 파트너사 공식 데이터시트로 다시 확인하세요.


Q3. DGX Spark는 128GB인데 왜 느리다는 평가가 많나요?

Q3. DGX Spark는 128GB인데 왜 느리다는 평가가 많나요?

DGX Spark는 GB10 Grace Blackwell Superchip 기반으로 128GB LPDDR5X 통합 메모리를 얹어 최대 200B 추론, 70B 파인튜닝을 한 대에서 처리한다고 NVIDIA가 밝히고 있습니다. 96GB GPU도 못 하는 일입니다. 그런데도 느리다는 평가가 반복되는 이유는 메모리 대역폭이 273GB/s에 그치기 때문입니다. RTX PRO 6000의 1,792GB/s와 비교하면 약 1/6.6 수준입니다.

NVIDIA 자체 측정(배치 1, 입력 2048, 출력 128, TRT-LLM, NVFP4) 결과도 같은 그림입니다.

모델 prefill (tok/s) decode (tok/s)
Llama 3.1 8B 10,256.9 38.65
Qwen3 14B 5,928.95 22.71
Qwen3 235B (2대 연결) 23,477.03 11.73

같은 Llama 3.1 8B가 RTX PRO 6000에서는 197.07 tok/s(StorageReview 실측)로 나옵니다. 대화 응답 속도로 약 5배 차이입니다. 여기서 자주 나오는 오독이 “최대 1 PFLOP FP4″라는 스펙입니다. 희소성(sparsity)을 적용한 기준이고 연산 바운드인 프리필 구간의 지표라, 토큰 생성 속도와는 직결되지 않습니다. 커뮤니티에서도 속도 실망 보고가 이어지고, ServeTheHome 리뷰는 gpt-oss-120B에서 약 14.5 tok/s 수준을 보고했습니다. 다만 리뷰 댓글에 달린 Strix Halo 약 43 tok/s, M2 Max 약 53.5 tok/s 같은 비교 수치는 측정 조건이 통제되지 않은 사용자 보고이며 공식 확인 자료가 아닙니다(2026년 8월 확인 시점 기준).

가격도 확인이 필요합니다. DGX Spark Founders Edition의 MSRP는 $3,999에서 $4,699로 올라 2026년 2월 23일 주부터 전 지역에 적용됐습니다(NVIDIA 개발자 포럼 공식 공지, 정가 기준). 하드웨어는 그대로이고, 사유는 업계 전반의 메모리 공급 제약입니다. 인터넷에는 구 가격 $3,999 표기가 그대로 남아 있으니 견적 낼 때 조심하세요.


Q4. 토큰 생성 속도와 프롬프트 처리 속도는 왜 따로 봐야 하나요?

Q4. 토큰 생성 속도와 프롬프트 처리 속도는 왜 따로 봐야 하나요?

두 구간의 병목이 서로 다릅니다. Puget Systems가 2024년 8월 22일 공개한 RTX GPU 추론 비교를 보면 토큰 생성(디코드) 속도는 메모리 대역폭과, 프롬프트 처리(프리필) 속도는 FP16 연산량 및 텐서 코어 수와 상관관계가 강합니다. 실제로 구형 RTX A6000이 신형 RTX 4500 Ada보다 토큰 생성에서 더 빠른 역전 현상도 관측됐습니다. 세대가 새롭다고 무조건 빠르지는 않습니다.

RTX 5090이 좋은 예입니다. llama.cpp b4493 · Phi-3 Mini Q4_K_M 기준 토큰 생성에서 RTX 4090보다 약 29% 빨랐는데, 대역폭 1.79TB/s 대 1.01TB/s 차이가 그대로 반영된 결과입니다. 반면 같은 테스트의 프롬프트 처리는 기대에 한참 못 미쳐 Windows 환경에서 RTX 4080 SUPER 수준에 머물렀습니다. Puget은 드라이버 문제로 추정했고, “Linux의 llama.cpp 테스트에서는 같은 불일치가 나타나지 않는다”고 덧붙였습니다(2025년 2월 21일 기준).

실무에서는 두 가지를 챙기면 됩니다. 첫째, 벤치마크를 인용할 때 OS·드라이버·프레임워크 버전을 같이 확인해야 합니다. 같은 카드가 환경에 따라 두 배 가까이 다른 성능을 냅니다. 둘째, 워크로드 성격에 따라 우선순위가 갈립니다. RAG처럼 긴 문서를 매번 입력하는 용도라면 프리필 성능이, 짧은 질의에 긴 답변을 뽑는 챗봇이라면 디코드 성능, 곧 대역폭이 중요합니다. 참고로 RTX PRO 6000의 Linux 환경 llama.cpp·vLLM 실측은 이번 자료 대조 범위에서 확인하지 못했습니다.


Q5. 전원·발열·안정성에서 미리 알아둘 위험 요소가 있나요?

Q5. 전원·발열·안정성에서 미리 알아둘 위험 요소가 있나요?

세 가지를 짚어두겠습니다.

첫째, 카드 TGP와 시스템 전원 요구량은 별개입니다. RTX PRO 6000의 공식 최대 소비전력은 600W지만, StorageReview 실측에서 SDXL 부하 때 시스템 전체가 918.5W를 지속 소비했고 피크는 1,036.3W를 찍었습니다. RTX 5090도 TGP 575W에 권장 시스템 파워가 1,000W입니다. 실제 구성에서는 1,200W급 이상 PSU를 기준으로 잡는 편이 안전합니다.

둘째, 12V-2×6 전원 커넥터 이슈입니다. der8auer의 전류 실측에서는 정품 케이블 환경에서도 단일 핀에 최대 41A가 몰리는 사례가 나왔습니다. PCI-SIG 권고치 9.5A의 4배가 넘고, 케이블 온도가 100℃ 이상, 심하면 150℃까지 올랐습니다. 커넥터 녹음 사례는 국내외 커뮤니티에서 반복 보고되지만 개별 사례라 공식 확인 자료는 아닙니다. 구형 12VHPWR 케이블을 재사용하지 말라는 권고는 이제 사실상 표준입니다.

위험 요소 확인된 수치 대응 방향
시스템 전력 지속 918.5W / 피크 1,036.3W 1,200W급 이상 PSU 검토
커넥터 전류 편중 단일 핀 최대 41A (권고 9.5A) 신품 12V-2×6 케이블, 체결 상태 확인
GSP 크래시 Xid 62/120/154 보고 납품 전 장시간 부하 검증

셋째, RTX PRO 6000에서 vLLM FP8 MoE 추론과 gpu_burn 부하 중 GSP 펌웨어 크래시(Xid 62/120→154)가 나서 PSU 전원을 완전히 차단해야 복구됐다는 개발자 포럼 보고가 있습니다(2026년 3월 27일 게시). 1차 보고자 중심의 사례이고 NVIDIA 공식 수정 확인도 안 된 상태라 하드웨어 개체나 슬롯 문제일 가능성이 남아 있어 일반화하긴 어렵습니다. 대량 도입을 검토 중이라면 특정 드라이버 버전에서 장시간 부하 검증을 거치세요. 이 밖에 팬 소음과 코일 훨이 크다는 리뷰어 평, 반대로 유휴 전력은 PRO 6000이 17~20W로 5090의 30W대보다 낮다는 개인 벤치 보고가 있으나 모두 공식 확인 자료는 아닙니다.


정리

로컬 LLM GPU는 VRAM 용량 → 메모리 대역폭 → 연산력 순의 순차 필터로 고르면 됩니다. 오구매는 대부분 이 순서를 뒤집은 데서 나옵니다. RTX 5090과 RTX PRO 6000은 대역폭이 1,792GB/s로 같고 성능차도 10~15%에 그치니, 둘의 가격 차이는 속도가 아니라 실행 가능한 모델 범위를 사는 비용입니다. VRAM은 모델 가중치가 아니라 가중치 + KV 캐시 + 동시 사용자로 계산합니다. 70B Q8에 8명 동시 사용이면 약 125GB가 듭니다. DGX Spark는 128GB로 대형 모델을 올릴 수 있지만 273GB/s 대역폭 탓에 응답 속도가 곧 품질인 서빙 용도에는 맞지 않고, 개발·프로토타이핑 장비라는 자리가 분명합니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 11일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 — 제조사 공식 (전 항목 2026-08-11 확인)

Tier 2 — 전문 매체 실측·기술 리뷰 (전 항목 2026-08-11 확인)

Tier 3 — 커뮤니티·포럼 (수치 근거 아님, 2026-08-11 확인)


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다