하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

H100 H200 GPU 도입 전 확인할 실사용 이슈 총정리

H100 H200 GPU 도입 전 확인할 실사용 이슈 총정리

작성자

카테고리:

약 16분 소요


H100 H200 개요

H100 H200 개요

엔비디아 H100과 H200은 현재 대규모 AI 학습·추론 인프라에서 가장 널리 채택되는 데이터센터급 GPU다. 두 제품은 같은 Hopper 아키텍처(CUDA Compute Capability 9.0, sm_90)를 공유하지만, H200은 HBM3e 메모리를 탑재해 용량과 대역폭을 끌어올린 강화판이라는 점에서 도입 검토 시 항상 함께 비교되는 조합이다. 문제는 “H200이 무조건 더 빠르다”는 식의 단순 비교가 실제 벤치마크 결과와 상당 부분 어긋난다는 점이다. 2026년 8월 기준으로 공개된 MLPerf 제출 결과, 인프라 기업의 자체 실측 자료, 그리고 대규모 클러스터 운영 사례를 종합하면 GPU 선택은 “어떤 워크로드를 돌리는가”에 따라 결론이 완전히 달라진다. 이 글에서는 제조사 공식 스펙과 제3자 실측 벤치마크, 그리고 실사용자들이 커뮤니티·개발자 포럼에 남긴 운영 이슈를 구분해서 정리했다. 스펙시트 숫자만 보고 견적을 넣기 전에, 실제 워크로드에서 어떤 차이가 나는지부터 확인하는 것이 도입 실패를 줄이는 첫 단계다.


1. H100 vs H200 공식 스펙 비교

1. H100 vs H200 공식 스펙 비교

두 제품의 차이는 연산 성능이 아니라 메모리 쪽에 집중돼 있다. NVIDIA 공식 자료 기준으로 H200 SXM은 H100 SXM 대비 메모리 용량이 약 1.76배(80GB→141GB), 대역폭이 약 1.4배(3.35TB/s→4.8TB/s) 늘었지만, FP16·FP8 등 연산 TFLOPS는 세대 내 동일 폼팩터 기준으로 사실상 같다.

항목 H100 SXM H200 SXM H200 NVL
메모리 80GB HBM3 141GB HBM3e 141GB HBM3e
대역폭 3.35TB/s 4.8TB/s 4.8TB/s
NVLink 900GB/s 900GB/s GPU당 900GB/s(2~4-way)
최대 TDP 700W(조정 가능) 700W(조정 가능) 600W(조정 가능)
CUDA Compute Capability 9.0(sm_90) 9.0(sm_90) 9.0(sm_90)
AI Enterprise 라이선스 별도 구매 별도 구매 5년 구독 기본 포함

여기서 실무적으로 중요한 것은 두 가지다. 첫째, H200 SXM의 최대 TDP는 700W다. “H200은 무조건 저전력”이라는 통념과 달리 폼팩터에 따라 전력 특성이 다르다. 둘째, H200 NVL을 선택하면 NVIDIA AI Enterprise 5년 구독이 기본 포함되지만 H200 SXM은 별도 애드온 구매가 필요해, 같은 세대 GPU라도 폼팩터에 따라 총소유비용(TCO) 구조가 달라진다. NVIDIA AI Enterprise 자체관리 라이선스 정가는 1년 GPU당 4,500달러, 3년 13,500달러, 영구 라이선스(5년 지원 포함) 22,500달러이며, 클라우드 종량제는 GPU·시간당 1달러 수준이다(2026년 6월 문서 갱신 기준, NVIDIA 공식 라이선싱 가이드). 교육기관이나 NVIDIA Inception/Connect 회원은 표준가의 25%만 부담한다.


2. 실측 벤치마크로 본 워크로드별 체감 차이

2. 실측 벤치마크로 본 워크로드별 체감 차이

스펙시트상 연산 성능이 동일하다고 해서 실사용 체감이 같다는 뜻은 아니다. 여러 인프라 사업자가 공개한 실측 벤치마크를 보면 워크로드 종류에 따라 H200의 개선 폭이 크게 갈린다.

워크로드 조건 H200 vs H100 개선폭 출처·조건
Llama2-70B, MLPerf 제출(H100=FP16, H200=FP8) 처리량 약 40% 향상(33,000 tokens/s) CoreWeave, MLPerf Inference v5.0
Llama2-70B, MLPerf 여러 세대 제출 종합 37~45% 향상 MLCommons 제출 결과 종합
Mistral Large 123B, 장문 컨텍스트(입력 32,784토큰·배치 64) 최대 3.4배 Baseten 자체 실측
Mistral Large 123B, 대규모 배치(배치 4,096) BF16 47% / FP8 36% Baseten 자체 실측
Mistral Large 123B, 짧은 컨텍스트(입력 128토큰, 실시간 채팅형) BF16 거의 동일 / FP8 11%만 향상 Baseten 자체 실측

이 표에서 가장 눈여겨봐야 할 지점은 마지막 행이다. Baseten의 자체 인프라 실측 결과, 실시간 채팅처럼 프롬프트가 짧고 배치 크기가 작은 워크로드에서는 H200으로 전환해도 체감 개선이 거의 없었다. 반면 긴 컨텍스트·대량 배치 추론에서는 최대 3.4배까지 벌어진다. 즉 H200의 메모리 대역폭 개선은 “메모리가 병목인 워크로드”에서만 실제 성능으로 전환되고, 연산이 병목인 워크로드에서는 체감 차이가 미미하다. Baseten은 이 실측을 근거로 “대부분의 추론 작업에서는 여전히 H100이 비용 효율적”이라는 결론을 내렸다는 점도 도입 검토 시 참고할 만하다.

다만 CoreWeave의 MLPerf 제출 결과에서 “40% 향상”이라는 수치는 주의가 필요하다. H100은 FP16, H200은 FP8이라는 서로 다른 정밀도 조건에서 나온 값이기 때문이다. 정밀도 차이가 포함된 수치이므로 순수한 하드웨어 성능 차이로 그대로 인용하기는 어렵다. 벤치마크 수치를 도입 근거로 쓸 때는 반드시 정밀도(FP8·FP16·BF16)와 소프트웨어 스택 버전 조건을 함께 확인해야 한다.


3. 경쟁 제품 대비 위치 — AMD MI300X

3. 경쟁 제품 대비 위치 — AMD MI300X

메모리 용량·대역폭만 놓고 보면 AMD Instinct MI300X가 H200보다 유리한 구간이 있다. MI300X는 HBM3 192GB, 대역폭 5.3TB/s로 H200 SXM(141GB, 4.8TB/s)보다 수치상 앞선다.

항목 H100 SXM H200 SXM AMD MI300X
메모리 80GB HBM3 141GB HBM3e 192GB HBM3
대역폭 3.35TB/s 4.8TB/s 5.3TB/s
최대 TDP 700W 700W 750W
FP8 연산(스파시티 적용) 3,958 TFLOPS 3,958 TFLOPS 5,229.8 TFLOPS

AMD 공식 데이터시트 기준 MI300X는 FP8 dense 2,614.9 TFLOPS, 2:4 구조적 스파시티 적용 시 5,229.8 TFLOPS로 스펙상 수치는 높게 나온다. 다만 이 수치를 실제 성능으로 그대로 옮기기는 어렵다는 점을 짚어야 한다. 소프트웨어 생태계 성숙도(CUDA vs ROCm) 차이는 실사용 환경에서 자주 언급되는 변수이며, 스펙시트의 우위가 실제 배포 편의성이나 프레임워크 호환성 우위로 곧바로 이어지지는 않는다. 메모리 병목이 큰 초거대 모델·긴 컨텍스트 워크로드라면 H200과 MI300X를 함께 검토할 가치가 있고, 짧은 컨텍스트 위주라면 GPU 세대보다 소프트웨어 스택 안정성이 우선순위가 될 수 있다.


4. 실사용자가 보고하는 운영 이슈

4. 실사용자가 보고하는 운영 이슈

실사용 후기 각도에서 중요한 것은 순수 성능 수치가 아니라 실제 운영 중 발생하는 이슈다. H100·H200은 개인이 구매해 사용하는 소비자 제품이 아니어서 커뮤니티 후기 자체가 많지 않고, 대신 대규모 클러스터 운영 사례와 개발자 포럼 보고가 주된 정보원이 된다.

Meta가 공개한 기술보고서를 인용한 매체 보도에 따르면, 16,384개 H100으로 구성된 클러스터에서 Llama 3 학습 54일간 총 419건의 예기치 않은 인터럽션이 발생했다. 평균 약 3시간마다 1건꼴이며, 이 중 GPU 자체 장애(NVLink 포함)가 148건(30.1%)으로 가장 많았고, HBM3 메모리 장애 72건(17.2%), 네트워크 스위치·케이블 문제 35건(8.4%) 순이었다. 다만 이는 16,384개 GPU급 초대형 클러스터의 특수 사례이며, 중소 규모(8~64 GPU) 클러스터의 고장률을 뒷받침하는 별도 공식 자료는 2026년 8월 기준 확인되지 않는다.

이 외에 개발자 포럼과 인프라 업체 블로그에서 반복적으로 언급되는 이슈는 다음과 같다. 다만 아래 항목은 공식 확인 자료가 아니라 실사용자·소수 업체의 보고 수준이므로 수치 근거로는 쓰지 않는 것이 안전하다.

  • NVLink 오류 코드 반복 보고: “NVLink error 74” 등 오류가 NVIDIA 개발자 포럼에 다수 게시됨(2026년 8월 확인 시점 기준, 공식 집계 아님)
  • GPU 이탈(XID 79) 발생률: 한 인프라 서비스업체는 “H100 배포 첫 해 약 3.2%에서 XID 79 발생, 512노드 클러스터에서 저하된 GPU 1개가 전체 처리량을 40%까지 낮출 수 있다”고 보고했으나, 단일 업체 자료로 교차검증되지 않은 수치다(2026년 8월 확인 시점 기준)
  • 드라이버 버전 불일치: “클러스터 이슈의 31%가 드라이버 버전 불일치에서 기인한다”는 관측도 같은 업체 자료로, 역시 미검증 상태다
  • 전력·냉각 설계 과소평가: 8-GPU급 도입 이후 랙 전력밀도를 초과했다는 유형의 인프라 사례가 반복 보고된다. 폼팩터별로 TDP가 350W(PCIe)부터 700W(SXM)까지 두 배 차이가 나는 만큼, 견적 이전에 폼팩터와 전원·냉각 설계를 먼저 확정하는 것이 도입 실패를 줄이는 방법으로 언급된다

5. 도입 전 체크리스트 — 자주 묻는 질문

5. 도입 전 체크리스트 — 자주 묻는 질문

Q. H200이 H100보다 무조건 빠른가?
아니다. 연산 TFLOPS는 동일 폼팩터 기준 H100과 H200이 사실상 같고, 개선은 메모리 용량·대역폭에 한정된다. 실측 결과를 보면 긴 컨텍스트·대량 배치 워크로드에서는 최대 3.4배까지 벌어지지만, 짧은 프롬프트 위주 실시간 서비스에서는 개선폭이 0~11%에 그친다. 워크로드 패턴부터 진단한 뒤 GPU를 선택해야 한다.

Q. 스펙시트의 TFLOPS 수치를 그대로 믿어도 되나?
주의가 필요하다. NVIDIA 스펙시트에 크게 표기되는 TFLOPS는 대부분 스파시티(sparsity) 적용치이며, 스파시티 미적용(dense) 실성능은 약 절반 수준이다. 벤치마크 자료를 비교할 때는 정밀도(FP8·FP16)와 스파시티 적용 여부를 함께 확인해야 한다.

Q. H100/H200 정가는 얼마인가?
NVIDIA는 공식 소매가를 공개하지 않는다. 시중에서 언급되는 2만5천~4만 달러(H100), 약 3만1천 달러(H200) 수준의 숫자는 전부 리셀러 추정치이며 제조사 공식 자료가 아니다. 정확한 견적은 반드시 공식 총판을 통해 확인해야 한다.

Q. 소규모(8~64 GPU) 클러스터에도 대규모 클러스터의 장애율이 적용되나?
단정할 수 없다. Meta 사례는 16,384개 GPU급 초대형 클러스터에서 나온 수치이며, 중소 규모 클러스터의 정량적 고장률(MTBF)을 뒷받침하는 별도 공식 자료는 2026년 8월 기준 확인되지 않았다. 소규모 도입을 검토 중이라면 이 수치를 그대로 적용하지 말고 별도로 확인하는 것이 안전하다.


정리

H100과 H200은 연산 성능이 아니라 메모리 용량·대역폭에서 차이가 나는 조합이며, 이 차이가 실제 체감으로 이어지는지는 워크로드에 따라 완전히 달라진다. MLPerf·Baseten 실측 자료를 종합하면 긴 컨텍스트·대량 배치 추론에서는 H200이 확실히 유리하지만, 짧은 프롬프트 위주 실시간 서비스에서는 H100 대비 개선폭이 거의 없다. 도입을 검토한다면 벤치마크 수치의 정밀도 조건을 반드시 확인하고, 폼팩터별 TDP·라이선스 포함 여부, 그리고 자사 워크로드의 컨텍스트 길이·배치 크기부터 먼저 진단하는 것이 순서다.



함께 보면 좋은 글


참고 자료

조사 기준일: 2026년 08월 07일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (제조사 공식)
– NVIDIA H200 공식 제품 페이지 — https://www.nvidia.com/en-us/data-center/h200/ (확인일 2026-08-07)
– NVIDIA Developer, CUDA GPUs(Compute Capability) — https://developer.nvidia.com/cuda/gpus (확인일 2026-08-07)
– NVIDIA AI Enterprise Licensing Guide, Pricing — https://docs.nvidia.com/ai-enterprise/planning-resource/licensing-guide/latest/pricing.html (문서 갱신 2026-06-08, 확인일 2026-08-07)
– NVIDIA TensorRT-LLM 공식 블로그, H200 launch — https://nvidia.github.io/TensorRT-LLM/blogs/H200launch.html (문서 갱신 2026-07-30, 확인일 2026-08-07)
– AMD Instinct MI300X 공식 제품 페이지/데이터시트 — https://www.amd.com/en/products/accelerators/instinct/mi300/mi300x.html , https://www.amd.com/content/dam/amd/en/documents/instinct-tech-docs/data-sheets/amd-instinct-mi300x-data-sheet.pdf (확인일 2026-08-07)
Tier 2 (전문 매체·실측 벤치마크)
– CoreWeave 공식 블로그, MLPerf Inference v5.0 결과 — https://www.coreweave.com/blog/coreweave-delivers-breakthrough-ai-performance-with-nvidia-gb200-and-h200-gpus-in-mlperf-inference-v5-0 (확인일 2026-08-07)
– Baseten 블로그, H200 vs H100 LLM 추론 실측 — https://www.baseten.co/blog/evaluating-nvidia-h200-gpus-for-llm-inference/ (확인일 2026-08-07)
– Hyperbolic 블로그, H200 vs H100 비교 — https://www.hyperbolic.ai/blog/h200-vs-h100 (확인일 2026-08-07)
– Tom’s Hardware, Meta Llama 3 학습 클러스터 장애 보도 — https://www.tomshardware.com/tech-industry/artificial-intelligence/faulty-nvidia-h100-gpus-and-hbm3-memory-caused-half-of-the-failures-during-llama-3-training-one-failure-every-three-hours-for-metas-16384-gpu-training-cluster (확인일 2026-08-07)
Tier 3 (커뮤니티·비제조사 인프라업체 블로그, 수치 근거 아님)
– NVIDIA Developer Forums, NVLink error 74 스레드 (확인일 2026-08-07)
– Introl 블로그, GPU 클러스터 트러블슈팅(XID 79, 드라이버 불일치 통계) — https://introl.com/blog/troubleshooting-gpu-clusters-common-issues-resolution-playbook (확인일 2026-08-07)


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다