하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

H100 H200 도입 전 워크로드 병목부터 확인해야 하는 이유

H100 H200 도입 전 워크로드 병목부터 확인해야 하는 이유

작성자

카테고리:

약 14분 소요


H200 개요

H200 개요

H200 개요

AI 인프라 도입을 검토하는 실무자 대부분은 “H100과 H200 중 무엇을 선택해야 하는가”라는 질문에서 출발한다. 문제는 이 질문 자체가 절반만 맞다는 점이다. NVIDIA 공식 자료를 기준으로 보면 H200은 H100 대비 메모리 용량이 80GB에서 141GB HBM3e로 약 1.76배, 메모리 대역폭이 3.35TB/s에서 4.8TB/s로 약 1.4배 늘어났지만, FP64·FP32·TF32·FP16·FP8 연산 성능(TFLOPS)은 H100과 완전히 동일하다(2026년 7월 31일 NVIDIA 공식 자료 기준). 즉 H200은 “더 빠른 H100″이 아니라 “메모리 병목이 있는 워크로드에서만 빨라지는 H100″이다. 실제로 NVIDIA가 공식 제품 페이지에서 홍보하는 “Llama2 70B 최대 1.9배” 같은 수치는 특정 배치·시퀀스 조건에서 뽑은 최고치이고, MLCommons가 감사한 MLPerf 공식 제출 결과 기준으로는 약 42~45% 개선에 그친다. 이 글은 공식 스펙과 실측 벤치마크를 함께 대조해, 도입 담당자가 “우리 워크로드에 어느 세대가 맞는가”를 판단할 기준을 제시한다.


1. H100 · H200 확정 스펙 비교

1. H100 · H200 확정 스펙 비교

두 제품의 핵심 차이는 메모리와 전력 설계에 있다. 연산 성능표는 동일하기 때문에 별도로 구분하지 않았다.

항목 H100 SXM H200 SXM 비고
메모리 80GB HBM3 141GB HBM3e 약 1.76배 증가
메모리 대역폭 3.35TB/s 4.8TB/s 약 1.4배 증가
NVLink 900GB/s 900GB/s 동일
FP16 연산(스파시티 적용) 1,979 TFLOPS 1,979 TFLOPS 완전 동일
FP8·INT8(스파시티 적용) 3,958 TFLOPS 3,958 TFLOPS 완전 동일
최대 TDP 700W 700W(SXM) / 600W(NVL) 폼팩터별 상이

※ 위 TFLOPS 수치는 전부 스파시티(sparsity) 적용치이며, 미적용(dense) 실성능은 약 절반 수준으로 봐야 한다(2026년 7월 31일 NVIDIA 공식 자료 기준). 스펙시트 수치를 그대로 실제 처리량으로 오해하면 도입 후 기대치와 실제 성능 사이에 괴리가 생긴다.

폼팩터에 따른 TDP 차이도 견적 단계에서 반드시 짚어야 한다. H100 PCIe는 350W, H100 NVL은 350~400W인 반면 SXM은 700W에 달해 서버 섀시·전원·냉각 설계가 통째로 달라진다. H200 NVL의 경우 최대 TDP가 600W로 공식 확인됐다(2026년 7월 31일 NVIDIA 공식 자료 기준). 폼팩터를 먼저 확정하지 않고 견적을 요청하면 재작업이 발생하기 쉽다.


2. 공식 발표 수치 vs MLPerf 실측치 — 상충 지점

2. 공식 발표 수치 vs MLPerf 실측치 — 상충 지점

이 섹션이 이번 글의 핵심이다. NVIDIA 공식 홍보 수치와 제3자 감사 기관(MLCommons)의 MLPerf 제출 수치 사이에는 뚜렷한 차이가 있다.

항목 공식 홍보 수치(T1) MLPerf 감사 실측치(T2) 상충 원인(추정)
Llama2 70B 추론, H200 vs H100 최대 1.9배(NVIDIA H200 제품 페이지, 2026-07-31 확인) 약 1.42배(22,290→31,712 tokens/s, MLPerf 제출 결과 인용 보도, 2026-07-31 확인) 공식 수치는 TensorRT-LLM 최적 배치·시퀀스 조건의 최고치, MLPerf는 표준화된 시나리오라 보수적
GPT-3 175B 챗봇 시나리오 1.6배(NVIDIA 공식) 독립 3자 감사 수치 미확인 확인 필요 — 공식 미확인 상태
HPC 워크로드 “최대 110배”(특정 벤치마크 기준, 세부 조건 미명시) 별도 검증 자료 없음 조건이 공개되지 않아 일반화하기 어려움

MLPerf Inference v5.0에서는 신규 GPU 교체 없이 TensorRT-LLM 같은 소프트웨어 최적화만으로도 H100의 Llama2 70B 처리량이 최대 1.5배 늘어난 사례가 NVIDIA 공식 블로그에서 확인됐다(2026년 7월 31일 확인). 성능 차이를 하드웨어 차이로만 단순화할 수 없다는 뜻이다. 소프트웨어 버전 관리만으로도 상당한 성능 변동이 생긴다는 점을 도입 검토 단계에서 고려해야 한다.


3. 워크로드별 실측 성능 격차 — Baseten 벤치마크

3. 워크로드별 실측 성능 격차 — Baseten 벤치마크

추론 인프라 전문 기업 Baseten이 H200 8기와 H100 8기를 vLLM 환경에서 직접 비교한 실측 결과는 “H200이 항상 빠르다”는 통념을 정면으로 반박한다(2026년 7월 31일 Baseten 기술 블로그 확인, 공식 제조사 자료가 아닌 제3자 실측치임을 밝힌다).

워크로드 시나리오 조건 H200 성능 우위
장문 컨텍스트 + 대형 배치 입력 32,784 / 출력 2,048, 배치 64 3.4배
고처리량 배치(BF16) 입출력 2,048/2,048, 배치 4,096 47%
고처리량 배치(FP8) 입출력 2,048/2,048, 배치 4,096 36%
단문 입출력(BF16) 입출력 128/2,048, 배치 64 거의 동일(0%대)
단문 입출력(FP8) 입출력 128/2,048, 배치 64 11%

표를 보면 패턴이 뚜렷하다. H200의 이득은 메모리 대역폭 병목이 해소되는 구간(긴 컨텍스트, 대형 배치, 대형 모델 단일 GPU 서빙)에서만 뚜렷하게 나타나고, 연산 병목이 지배적인 짧은 시퀀스·소형 배치 워크로드에서는 체감 차이가 거의 없다. 구조적 스파시티 같은 소프트웨어 기법을 적용하면 Llama2 추론이 약 33% 추가 가속되기도 하는데, 이는 하드웨어 세대 차이가 아니라 최적화 기법의 효과다(2026년 7월 31일 Tom’s Hardware 보도 확인).


4. B200(Blackwell)까지 포함한 세대선택 프레임

4. B200(Blackwell)까지 포함한 세대선택 프레임

H100과 H200 사이에서 고민하고 있다면 한 세대 더 기다리는 선택지도 함께 저울질할 필요가 있다. MLPerf v5.0 실측 기준으로 8-GPU HGX B200 시스템은 H200 대비 Llama2 70B 서버 시나리오에서 약 3배(98,443 vs 33,072 tokens/s), 오프라인 시나리오에서 약 2.8배(98,858 vs 34,988 tokens/s) 처리량을 기록했다(2026년 7월 31일 NVIDIA Developer Blog 확인, 근거는 MLCommons 감사 제출 수치). Mixtral 8x7B는 2.1배, SDXL은 1.6배 개선됐다.

비교축 H100 H200 B200(HGX 8-GPU 기준)
세대 성격 기준 세대 H100의 메모리 강화판 연산 아키텍처 자체가 바뀐 신세대
Llama2 70B 개선폭(MLPerf) 기준 약 1.42배 H200 대비 약 2.8~3배
개별 GPU 공식 TDP·TFLOPS 확인됨 확인됨 개별 GPU 단위 공식 스펙 미확보(시스템 합산치만 공개)

다만 B200 개별 GPU 단위의 공식 TDP·TFLOPS는 아직 확인되지 않는다. NVIDIA는 2026년 7월 31일 기준으로 8-GPU 시스템 합산치만 공개했고, 개별 스펙 페이지는 공개하지 않았다. 공급 일정과 가격 프리미엄, 전력 설계 부담도 커서 확정 견적 전 재확인이 필수다. 참고로 AMD MI300X는 192GB HBM3, 대역폭 5.325TB/s로 H200보다 수치상 우위에 있으나(AMD 공식 데이터시트 기준, 2026년 7월 31일 확인), CUDA 대비 ROCm 생태계 성숙도 차이가 실질적 도입 장벽으로 반복 언급된다.


5. 실사용자 보고 이슈 및 자주 묻는 질문

5. 실사용자 보고 이슈 및 자주 묻는 질문

아래 내용은 공식 검증 자료가 아니라, 인프라 실무자 블로그·후기에서 반복적으로 관찰된 보고를 정리했다(2026년 7월 31일 기준, 다수 보고 유형).

  • 서빙 모델이 소형·짧은 컨텍스트 위주인 조직에서는 H200 도입 후에도 “체감 성능 차이가 거의 없었다”는 유형의 후기가 반복됐다. 이는 위 3번 섹션의 Baseten 단문 시나리오 실측 결과와 일치하는 패턴이다.
  • HGX H200 8-GPU 풀 시스템에서 FP16 원본 초대형 모델(1.2~1.3TB급)을 그대로 올리려 하면 메모리가 부족해 FP8 등 양자화가 사실상 필수였다는 보고가 있었다. “메모리가 2배 늘었다고 아무 모델이나 다 올라가는 것은 아니다”라는 인식이 실무자 사이에 확산돼 있다.

Q. H200으로 바꾸면 무조건 2배 빨라지나요?
아니다. 워크로드가 메모리 대역폭에 걸려 있는지에 전적으로 달려 있으며, 공식 홍보치는 최적 조건의 최고치다. MLPerf 감사 기준 실제 개선폭은 약 42~45% 수준이다.

Q. H100/H200 정가는 얼마인가요?
NVIDIA는 공식 소매가를 발표하지 않는다. 시중에 도는 가격은 전부 리셀러 추정치이며 공식 확인 자료가 아니므로, 정확한 견적은 반드시 총판에서 확인해야 한다.

Q. 지금 H100/H200 중 고민 중인데 B200까지 봐야 하나요?
공급 일정과 예산이 맞는다면 함께 검토하는 편이 합리적이다. MLPerf 실측 기준 B200이 H200 대비 2.8~3배 처리량을 기록했기 때문에, 신규 대규모 투자라면 Blackwell 세대까지 저울질할 가치가 있다.


정리

H100과 H200의 차이는 연산 성능이 아니라 메모리 용량·대역폭에 한정되며, NVIDIA 공식 발표치(최대 1.9배)와 MLPerf 감사 실측치(약 1.42배) 사이에는 뚜렷한 격차가 있다. 긴 컨텍스트·대형 모델 단일 GPU 서빙·대형 배치 추론처럼 메모리 병목이 있는 워크로드라면 H200이 실측 기준 최대 3.4배까지 확실한 이득을 주지만, 짧은 시퀀스·소형 배치 위주라면 가격 차이를 정당화하기 어려울 수 있다. 신규 대규모 도입을 검토 중이라면 H100·H200 비교에서 멈추지 말고, MLPerf 실측 기준 한 세대 앞선 B200까지 함께 저울질하는 편이 합리적이다.


함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 07월 31일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (WebFetch로 직접 확인)
– NVIDIA H200 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/h200/ (2026-07-31)
– NVIDIA TensorRT-LLM 공식 블로그, H200 Launch — https://nvidia.github.io/TensorRT-LLM/blogs/H200launch.html (2026-07-31)
– NVIDIA Developer Blog, “Blackwell Delivers Massive Performance Leaps in MLPerf Inference v5.0” — https://developer.nvidia.com/blog/nvidia-blackwell-delivers-massive-performance-leaps-in-mlperf-inference-v5-0/ (2026-07-31)
– NVIDIA B200(HGX) 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/b200/ (2026-07-31)
Tier 1 (WebSearch로 원문 인용만 확인, 직접 WebFetch 실패)
– AMD Instinct MI300X 공식 데이터시트 — https://www.amd.com/content/dam/amd/en/documents/instinct-tech-docs/data-sheets/amd-instinct-mi300x-data-sheet.pdf (2026-07-31, 접속 실패로 재확인 필요)
Tier 2
– Baseten 기술 블로그, “Evaluating NVIDIA H200 Tensor Core GPUs for LLM inference” — https://www.baseten.co/blog/evaluating-nvidia-h200-gpus-for-llm-inference/ (2026-07-31, WebFetch 확인)
– Tom’s Hardware, “Nvidia Hopper H200 breaks MLPerf benchmark record with TensorRT” — https://www.tomshardware.com/pc-components/gpus/nvidia-hopper-h200-breaks-mlperf-benchmark-record-with-tensorrt-not-blackwell-submissions-yet-sorry (2026-07-31, WebSearch로 수치 확인·본문은 유료화벽)
– aimultiple.com, GPU Concurrency Benchmark — https://aimultiple.com/gpu-benchmark (2026-07-31, WebFetch 시도, 차트 미로딩으로 수치 확보 제한적)
– ServeTheHome, MLPerf Inference v5.0 관련 보도 — https://www.servethehome.com/mlperf-inference-v5-0-released-amd-intel-nvidia/ (2026-07-31, WebFetch 확인, 구체 수치는 확보 못함)
Tier 3
– 추론 인프라 실무자 블로그·후기(단문 시나리오 체감 차이 없음, FP16 초대형 모델 양자화 필수 경험) — WebSearch 취합, 2026-07-31


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다