하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

H100 H200 B200 세대 차이 총정리, 도입 전 확인할 기준

H100 H200 B200 세대 차이 총정리, 도입 전 확인할 기준

작성자

카테고리:

약 24분 소요


H200 B200 차이, 무엇을 기준으로 비교해야 할까

H200 B200 차이, 무엇을 기준으로 비교해야 할까

GPU 세대 비교 자료를 찾다 보면 “B200이 H200보다 4~5배 빠르다”는 문장을 흔히 만납니다. 그런데 이 숫자를 그대로 예산안에 넣으면 거의 확실하게 어긋납니다. 이유는 단순합니다. 그 비교는 B200을 NVFP4로, H200을 FP8로 돌린 결과입니다. H200이 속한 Hopper 세대에는 FP4 텐서코어 자체가 없으니, 애초에 같은 조건에서 잰 숫자가 아닙니다.

같은 FP8끼리 놓고 보면 그림이 달라집니다. NVIDIA 공식 수치 기준 H200 SXM의 FP8은 3,958 TFLOPS(스파시티 적용), B200은 9 PFLOPS(스파시티 적용)로 약 2.27배입니다. SemiAnalysis가 GLM-5로 측정한 FP8 대 FP8 실측치는 약 2.29배로, 공칭치와 거의 정확히 맞아떨어졌습니다(2026년 8월 확인 시점 기준).

그래서 이 세대 비교는 다음 네 가지 축으로 쪼개야 실무 판단이 가능해집니다.

첫째, 메모리. H100 80GB → H200 141GB → B200 180GB로 이어지는 용량 변화가 모델 적재 가능 여부를 직접 결정합니다. 둘째, 연산 정밀도. FP4를 쓸 수 있는 워크로드인지 아닌지가 성능 이득의 절반 이상을 좌우합니다. 셋째, 전력과 냉각. B200 세대는 GPU를 교체하는 일이 아니라 랙과 배관을 바꾸는 일에 가깝습니다. 넷째, 소프트웨어 성숙도. 같은 하드웨어 교체인데 실현율이 65%에서 100%까지 갈립니다.

이 글은 2026년 8월 11일 기준으로 확인된 제조사 공식 자료와 독립 벤치마크를 대조해 정리한 내용이며, 필자가 해당 장비를 직접 장기 운용한 기록은 아닙니다.


비교 기준 정리

세대 비교에서 실제로 의미가 있는 항목만 추려 기준·단위·주의점을 정리하면 다음과 같습니다. 특히 모든 TFLOPS 표기가 스파시티(sparsity) 적용치라는 점은 반드시 짚어야 합니다. NVIDIA 스펙시트는 이 값을 크게 표기하는데, 미적용(dense) 실성능은 약 절반입니다. 이 사실을 모르고 인용하면 견적 단계에서 두 배 기대가 생깁니다.

비교 항목 단위 왜 중요한가 주의점
GPU당 메모리 용량 GB 모델·KV 캐시 적재 한계를 결정 8기 합산치와 GPU당 값을 혼동하기 쉬움
메모리 대역폭 TB/s 디코딩 단계 처리량의 실질 병목 H200의 H100 대비 개선은 사실상 이 항목
FP8 연산 PFLOPS 세대 간 동일 조건 비교의 유일한 기준 스파시티/dense 구분 필수
FP4(NVFP4) 연산 PFLOPS Blackwell 이후 신설, Hopper에는 없음 정확도 손실 검증 없이 적용 불가
NVLink 대역폭 GB/s·TB/s 다중 GPU 확장 효율 SXM과 NVL 폼팩터가 다름
GPU TDP W 랙 전력 설계의 출발점 기본 동작점과 최대 허용치가 다름
시스템 소비전력 kW 랙당 수용 대수를 결정 8기 노드 단위로 봐야 함
섀시 높이 U 기존 랙 재사용 가능 여부 H200 6U → B200 8U로 증가 사례 있음
소프트웨어 실현율 배수 공칭 성능이 실제로 나오는 비율 PoC 없이는 추정 불가

여기서 가장 자주 놓치는 것이 TDP의 이중 표기입니다. NVIDIA DGX B200 User Guide의 전력 캡핑 문서는 B200 GPU의 기본 SetPoint를 700W, 허용 최대치를 1,000W, 최소치를 200W로 명시합니다. 반면 ServeTheHome나 The Register 같은 전문 매체는 공랭 B200을 1,000W로 서술합니다. 둘 다 맞는 말입니다. 실무 결론은 전력·냉각 설비는 1,000W 기준으로 설계하고, 실제 기본 동작점은 700W로 안내하는 것입니다. 한쪽만 인용하면 설비가 과소 설계되거나 반대로 과대 투자됩니다.


옵션·유형별 비교

옵션·유형별 비교

GPU 단위 스펙 대조

아래 수치는 2026년 8월 기준 NVIDIA 공식 자료에서 확인된 값입니다. B200 관련 수치는 개별 GPU 데이터시트가 아니라 8기 시스템 공식값에서 산출했습니다.

항목 H100 SXM H200 SXM B200 B300(Blackwell Ultra)
메모리 80GB HBM3 141GB HBM3e 180GB HBM3e 288GB HBM3e
대역폭 3.35TB/s 4.8TB/s 8TB/s 미확인(공식 표기 없음)
FP8 (sparse) 3,958 TFLOPS 3,958 TFLOPS 9 PFLOPS 9 PFLOPS
FP4 (sparse) 미지원 미지원 18 PFLOPS 18 PFLOPS
FP4 (dense, 8기) 72 PFLOPS 108 PFLOPS
NVLink(GPU당) 900GB/s 900GB/s 1.8TB/s 1.8TB/s
TDP 최대 700W 최대 700W 기본 700W / 최대 1,000W 시스템 기준 약 14kW

여기서 두 가지가 눈에 띕니다. 하나는 H100과 H200의 연산 TFLOPS가 완전히 동일하다는 점입니다. H200은 “더 빠른 H100″이 아니라 메모리 강화판입니다. 연산 병목 워크로드라면 H200으로 바꿔도 빨라지지 않습니다. 다른 하나는 B200과 B300의 FP4 sparse 값이 같은데 dense 값은 1.5배 차이가 난다는 점입니다. 메모리는 1.6배 차이입니다.

시스템 단위 도입 조건

항목 H200 8-GPU 노드 DGX B200 DGX B300
섀시 높이 통상 6U급 10U 10U
최대 소비전력 공식값 미확인 약 14.3kW 약 14kW
전원 구성 3.3kW PSU 6개(5+1)
GPU 메모리 총량 1,128GB 1,440GB 2,100GB(공식 표기)
NVLink 집계 14.4TB/s 14.4TB/s
네트워킹 0.8TB/s 1.6TB/s
무게 최대 142.4kg
발열 48,794 BTU/hr

DGX B200의 공식 사양은 10U에 약 14.3kW, 무게 142kg, 발열 48,794 BTU/hr입니다. 운영 온도는 10~35°C입니다. HGX B300의 총 메모리는 공식 페이지가 2.1TB로 표기하지만, GPU당 288GB × 8기는 산술상 2.3TB입니다. 공식 자료끼리 어긋나는 지점이므로, 제안서에는 “GPU당 288GB”로만 표기하는 편이 안전합니다.

실측 성능은 얼마나 나오는가

측정 조건 H200 B200 배수
GLM-5, FP8+MTP, SGLang v0.5.12 851.9 tok/s/GPU 1,947.3 tok/s/GPU 2.29배
GLM-5, H200 FP8 vs B200 NVFP4 851.9 tok/s/GPU 4,115.5 tok/s/GPU 4.83배
Llama 4 Maverick, vLLM v0.8.4 6,694 tok/s 9,870 tok/s 1.47배
100만 토큰당 비용(80 tok/s/user) $1.06 $0.29 3.65배 우위

같은 8-GPU 교체인데 결과가 1.47배와 2.29배로 갈립니다. 최적화된 SGLang + NVFP4 환경에서는 공칭치를 그대로 실현했지만, vLLM 0.8.4에 Llama 4 Maverick을 얹은 조건에서는 +47%에 그쳤습니다. 세대차의 실현율이 65%에서 100% 사이에서 움직인다는 뜻입니다.

전력당 처리량으로 보면 차이가 더 분명합니다. gpt-oss 120B를 90 tok/s/user 조건으로 돌렸을 때 B200은 MW당 280만 토큰/초, H100은 90만 토큰/초로 약 3.1배 격차가 확인됐습니다(SemiAnalysis InferenceMAX 측정, 2026년 8월 확인).


상황별 추천

상황별 추천

H200이 여전히 맞는 경우

FP8·BF16 파이프라인이 이미 안정화됐고 재검증에 쓸 엔지니어링 공수가 없다면 H200이 낮은 리스크 선택입니다. 모델이 141GB × 8기 안에 들어가고, 처리량보다 안정성이 우선이며, 기존 6U 공랭 섀시와 노드 10kW급 랙 전력을 그대로 쓰고 싶은 경우가 여기에 해당합니다. 8-GPU 노드 1~2대 규모의 사내 도입이라면 인프라 개조 비용이 GPU 차액을 넘어설 수 있습니다.

다만 토큰당 비용이 핵심 지표라면 계산이 뒤집힙니다. 동일 FP8에서도 B200이 2.3배 빠르고, FP4까지 내려가면 100만 토큰당 비용이 $1.06에서 $0.29로 떨어집니다(2026년 8월 기준 SemiAnalysis 측정값).

B200을 건너뛰고 B300을 볼 경우

지금 시점에서 신규로 B200을 들일 근거를 설명하기 어려운 구간이 존재합니다. DGX B300의 소비전력은 약 14kW로 DGX B200의 약 14.3kW와 사실상 동급인데, GPU당 메모리는 1.6배(180GB → 288GB), FP4 dense는 1.5배(72 → 108 PFLOPS), 네트워킹은 2배(0.8 → 1.6TB/s)입니다. 전력·랙 조건이 거의 같은데 사양이 크게 앞선다면, 대형 MoE나 장문 컨텍스트로 GPU당 메모리가 병목인 조직은 B300 쪽을 먼저 검토하는 편이 합리적입니다.

단, INT8 표기가 걸립니다. NVIDIA HGX 페이지 기준 B200 8기는 72 POPS, B300은 3 POPS로 표기돼 있습니다. 두 값의 sparse/dense 기준이 명시돼 있지 않아 현재로선 해석이 불가능한 상태입니다(확인 필요 항목). 구형 비전 모델 등 INT8 의존 파이프라인을 쓰고 있다면 B300 제안 전 반드시 재확인해야 합니다.

대규모 신규 투자를 검토하는 경우

Vera Rubin NVL72가 풀 프로덕션에 진입했고 2026년 하반기 출하가 공식화됐습니다. HGX Rubin NVL8은 GPU 메모리 2.3TB HBM4, NVFP4 추론 400 PFLOPS, NVLink 스위치 28.8TB/s로 HGX B200(1.4TB, FP4 144 PFLOPS sparse, NVLink 14.4TB/s) 대비 전 항목이 앞섭니다. 현실적인 선택지는 당장 필요한 용량은 B200/B300으로 채우고, 증설분은 Rubin 공급 일정 확인 후로 미루는 이원화입니다. 국내 공급 일정은 아직 확인되지 않았습니다.

랙 스케일이 필요한 경우

GB200 NVL72는 H200 8-GPU 노드와 근본적으로 다른 물건입니다. Grace CPU 36개와 Blackwell GPU 72개로 GPU 메모리 13.4TB, NVLink 130TB/s를 구성합니다. DeepSeek R1(670B MoE) FP8을 약 35 tok/s/user 조건으로 돌렸을 때 단일 노드 대안 대비 100만 토큰당 TCO에서 4배 우위가 보고됐습니다. 다만 이 급은 전산실이 아니라 데이터센터 설계 영역입니다.


자주 하는 실수

자주 하는 실수

첫째, 정밀도가 다른 숫자를 세대차로 착각하는 것. “4~5배”는 하드웨어 세대차가 아니라 FP4 전환 효과가 대부분입니다. NVIDIA 공식 페이지에는 B200 단일 GPU의 H200 대비 배수 표기가 없습니다. 있는 것은 GB200 NVL72의 H100 대비 30배 주장인데, 이마저 TTL 50ms·32,768 입력/1,024 출력·32,768 GPU 규모라는 조건이 붙습니다. 반대로 표준 벤치마크인 MLPerf Training v5.1 기준으로는 동일 512 GPU에서 GB200 NVL72가 Hopper 대비 최대 3.2배, GB300 NVL72가 누적 4.2배입니다. 마케팅 배수(50~65배)와 벤치마크 배수(4.2배)는 완전히 다른 층위이므로, 내부 검토 자료에는 후자만 쓰는 것이 안전합니다. 참고로 NVIDIA 스스로 “달러당 성능 약 2배” 주장은 공개 GPU 시간당 임차가 기준이며 MLCommons 검증 대상이 아니라고 명시했습니다.

여기에 하나 더 붙일 것이 있습니다. 기술 커뮤니티에서는 어텐션 가중치의 FP4 양자화가 MLP보다 정확도 손실이 크다는 인식이 공유되며, NVIDIA modelopt 기본 설정이 어텐션을 BF16으로 남긴다는 점이 근거로 인용됩니다. 일부 사용자 보고 기준이며 공식 확인 자료는 아니지만, 수학·다단계 논리·코드 생성처럼 추론 체인이 긴 워크로드에서는 FP4가 FP8의 무조건적 대체재가 아니라는 의견이 우세합니다. 도입 검토에서 가장 먼저 답해야 할 질문은 “우리 모델을 FP4로 내려도 되는가”입니다.

둘째, 소프트웨어 마찰 비용을 0으로 두는 것. 앞서 본 1.47배 사례가 이 지점을 보여줍니다. 여기에 초기 마찰이 더해집니다. 일부 사용자 보고에 따르면 sm_50~sm_90만 지원하는 구형 PyTorch 빌드는 sm_100(B200)을 인식하지 못해 H100용으로 굳어진 사내 이미지·CI가 첫 부팅에서 막힙니다. distributed.tensor.distribute_tensor 호출이 H100 약 1초 대비 B200에서 30초 이상 걸렸다는 보고, B200 + vLLM + FlashInfer 조합에서 불법 메모리 접근 크래시가 발생했다는 보고도 이슈 트래커에 올라와 있습니다. 모두 공식 확인 자료가 아닌 개발자 커뮤니티 보고(2026년 8월 확인 시점)지만, PoC 없이 “2배”를 전제한 예산·일정은 어긋난다는 신호로는 충분합니다.

셋째, GPU만 바꾸면 된다고 가정하는 것. B200 세대는 장비 교체가 아니라 건물 공사에 가깝습니다. GPU 최대 1,000W, 시스템 14.3kW, PSU 3.3kW 6개, 무게 142kg, 발열 48,794 BTU/hr입니다. 동일 벤더의 8-GPU 서버가 H200 세대 6U에서 B200 세대 8U로 커졌고, 늘어난 2U는 전부 전원과 냉각이 차지합니다. 국내에서는 NHN클라우드가 B200 7,656장을 수랭식(DLC)으로 운영하면서 천장 급수·회수 배관과 랙별 CDU 설치 공사에만 5개월을 썼다고 보도됐습니다. 업계 통설로 랙당 전력밀도 40kW를 넘으면 공랭만으로는 발열 처리가 어렵다고 알려져 있으나, 이는 매체 보도 수준이며 NVIDIA 공식 권고치는 확인되지 않았습니다. H200 노드를 돌리던 랙에 B200 노드를 그대로 넣을 수 있다고 가정하면 안 됩니다.


정리

H100에서 H200으로의 변화는 메모리 용량 1.76배·대역폭 1.4배이며 연산 성능은 동일하고, H200에서 B200으로의 변화는 같은 FP8 기준 약 2.27배입니다. 시중의 “4~5배”는 B200을 FP4로, H200을 FP8로 돌려 비교한 숫자이므로 FP4 적용이 가능한 워크로드에 한해서만 성립합니다. 실현율은 소프트웨어 성숙도에 따라 65%에서 100% 사이로 갈리므로, 워크로드 PoC 없이 배수를 전제한 예산은 어긋납니다.

판단 순서는 명확합니다. ① 우리 모델을 FP4로 내려도 되는가 → ② 랙 전력·냉각을 14kW급으로 개조할 수 있는가 → ③ 개조가 가능하다면 같은 전력에 메모리 1.6배인 B300, 그리고 2026년 하반기 출하 예정인 Rubin과 함께 놓고 볼 것. FP8·INT8만 쓰고 재검증 공수가 없으며 랙 개조가 불가능하다면 H200이 여전히 합리적인 선택이고, 토큰당 비용이 핵심 지표라면 B200 이상 세대로 가되 5개월짜리 인프라 공사를 한 세대 전 제품에 쓰지 않도록 세대 선택을 마지막에 확정하는 것이 좋습니다.

본문의 가격·공급 관련 사항은 2026년 8월 11일 기준이며, DGX B200·B300의 정가는 NVIDIA가 공개 소매가를 발표하지 않아 총판 견적이 필요합니다. 시중의 “GPU당 $30~40K”류 수치는 전부 리셀러 추정치이며 공식 자료가 아닙니다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 09일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 — 제조사 공식 (WebFetch 본문 확인)
– NVIDIA DGX B200 제품 페이지 — https://www.nvidia.com/en-us/data-center/dgx-b200/ (2026-08-09)
– NVIDIA DGX B200 User Guide, Introduction — https://docs.nvidia.com/dgx/dgxb200-user-guide/introduction-to-dgxb200.html (2026-08-09)
– NVIDIA DGX B200 User Guide, Managing Power Capping — https://docs.nvidia.com/dgx/dgxb200-user-guide/power-capping.html (2026-08-09)
– NVIDIA DGX B300 제품 페이지 — https://www.nvidia.com/en-us/data-center/dgx-b300/ (2026-08-09)
– NVIDIA HGX 플랫폼 (B200/B300/Rubin NVL8 비교표) — https://www.nvidia.com/en-us/data-center/hgx/ (2026-08-09)
– NVIDIA GB200 NVL72 제품 페이지 — https://www.nvidia.com/en-us/data-center/gb200-nvl72/ (2026-08-09)
– NVIDIA Blackwell Architecture — https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/ (2026-08-09)
– NVIDIA H200 제품 페이지 — https://www.nvidia.com/en-us/data-center/h200/ (2026-08-09)
– NVIDIA Newsroom, “Blackwell Platform Arrives to Power a New Era of Computing” — https://nvidianews.nvidia.com/news/nvidia-blackwell-platform-arrives-to-power-a-new-era-of-computing (2026-08-09)
– NVIDIA Technical Blog, “Blackwell Enables 3x Faster Training…” (MLPerf Training v5.0/v5.1) — https://developer.nvidia.com/blog/nvidia-blackwell-enables-3x-faster-training-and-nearly-2x-training-performance-per-dollar-than-previous-gen-architecture/ (2026-08-09)
– NVIDIA Enterprise RA, HGX AI Factory Components — https://docs.nvidia.com/enterprise-reference-architectures/hgx-ai-factory/latest/components.html (2026-08-09)
– NVIDIA Newsroom, “Vera Rubin Ramps Into Full Production” — https://nvidianews.nvidia.com/news/vera-rubin-full-production-agentic-ai-factory (2026-08-09, 검색 확인)
– AMD Instinct MI355X 공식 제품 페이지 및 데이터시트 — https://www.amd.com/en/products/accelerators/instinct/mi350/mi355x.html (2026-08-09, 검색 요약 확인 — 본문 재확인 필요)
Tier 2 — 전문 매체·독립 벤치마크 (WebFetch 본문 확인)
– SemiAnalysis InferenceX, “B200 NVFP4 vs H200 FP8 on GLM-5” — https://inferencex.semianalysis.com/blog/b200-glm5-nvfp4-vs-h200-fp8-3-6x-perf-per-dollar (2026-08-09)
– SemiAnalysis, “InferenceMAX: Open Source Inference Benchmarking” — https://inferencex.semianalysis.com/blog/inferencemax-open-source-inference-benchmarking (2026-08-09)
– Metrum AI, “Llama 4 Maverick on NVIDIA H200 versus B200 using vLLM” — https://www.metrum.ai/blog/llama-h200-v-b200-performance (2026-08-09)
– ServeTheHome, “ASRock Rack 8U8X-GNR2 SYN B200 Review” — https://www.servethehome.com/asrock-rack-8u8x-gnr2-syn-b200-review-nvidia-hgx-b200-8-gpu-server-intel-xeon/ (2026-08-09)
– The Register, “Nvidia turns up the AI heat with 1,200W Blackwell GPUs” — https://www.theregister.com/2024/03/18/nvidia_turns_up_the_ai/ (2026-08-09 확인)
– 블로터, “B200 7656장 돌리는 NHN클라우드의 무기 ‘수랭식’” — https://www.bloter.net/news/articleView.html?idxno=670224 (2026-08-09, 검색 확인)
– 디일렉, “NHN, 정부 B200 구매분 75% 싹쓸이…’수냉식 냉각’이 결정타” — https://www.thelec.kr/news/articleView.html?idxno=38711 (2026-08-09, 검색 확인)
– ZDNet Korea, “열 때문에 GPU 성능 반토막…일부라도 수랭 전환해야” — https://zdnet.co.kr/view/?no=20260521120555 (2026-08-09, 검색 확인)
Tier 3 — 개발자·커뮤니티 보고 (수치 근거 아님)
– PyTorch Issue #153401, “Long pause with distributed.tensor.distribute_tensor using B200 GPU” — https://github.com/pytorch/pytorch/issues/153401 (2026-08-09)
– PyTorch Issue #145949, “[CUDA][Blackwell] Blackwell Tracking Issue” — https://github.com/pytorch/pytorch/issues/145949 (2026-08-09)
– canonical/notebook-operators Issue #538, “Tensorflow and Pytorch Images are not compatible with Blackwell GPUs” — https://github.com/canonical/notebook-operators/issues/538 (2026-08-09)
– flashinfer Issue #2219, “Illegal Memory Access on NVIDIA B200 (Blackwell) running Qwen3-Next-80B via vLLM” — https://github.com/flashinfer-ai/flashinfer/issues/2219 (2026-08-09)
– vLLM Issue #50189, “Xid 31 MMU fault with flashinfer_b12x MoE backend” (SM120 환경 — B200 아님, 참고용) — https://github.com/vllm-project/vllm/issues/50189 (2026-08-09)
주: Reddit은 크롤러 차단으로 이번 조사에서 직접 확인하지 못했다. r/LocalLLaMA 계열 B200 운영 보고는 다음 리서치에서 별도 경로로 확보 필요.


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다