Grok 4.6은 2026년 8월 기준 가중치가 공개되지 않아 로컬 실행이 불가능합니다. xAI 공개 모델 grok-2의 8×40GB GPU 요건, Bedrock 데이터 경계 한계, 200k 토큰 가격 분기점까지 실행 조건을 정리했습니다.
Grok 4.6 핵심만 먼저 정리하면
로컬 실행이 요건이라면 Grok 4.6은 후보에서 빼야 합니다. 2026년 8월 25일 기준 xAI 공식 문서 어디에도 가중치 공개·자체 호스팅·온프레미스 관련 기술이 없고, 제공 채널은 xAI API·Grok Build·Cursor·게이트웨이(OpenRouter·Vercel·Cloudflare)뿐입니다. Grok 4.6의 로컬 실행 요건이라는 질문 자체가 현시점에서는 성립하지 않습니다. 실제 선택지는 API를 쓰거나 두 세대 뒤진 grok-2 가중치를 내려받는 것, 둘 중 하나입니다. Hugging Face의 조직에 올라온 공개 가중치는 grok-1(2024년 3월 28일 갱신)과 grok-2(2025년 11월 5일 갱신) 두 개뿐이고, grok-3 이상 저장소는 2026년 8월 25일 확인 시점에 없습니다. 이 글에서는 로컬 실행 가능 여부, 대안인 grok-2의 하드웨어 요건, API 경유 시 과금·데이터 경계 조건을 실제 문서 수치로 정리했습니다.
Q1. Grok 4.6 가중치를 받아서 내 서버에 올릴 수 있나요?

불가능합니다. xAI 모델 문서(docs.x.ai/developers/grok-4-6)와 발표문(x.ai/news/grok-4-6) 양쪽 모두 API 접근 경로만 기술하며, 다운로드·설치·가중치 배포 항목은 아예 없습니다. 엔터프라이즈 문서(docs.x.ai/build/enterprise)가 제공하는 데이터 통제 수단도 팀 단위 ZDR(Zero Data Retention) 하나뿐입니다. VPC·전용 인스턴스·온프레미스·리전별 데이터 residency 항목은 기재돼 있지 않습니다.
현재 접근 가능한 형태는 아래와 같습니다.
| 항목 | 값 | 근거 |
|---|---|---|
| 모델 ID | grok-4.6 |
xAI 모델 문서 |
| 컨텍스트 창 | 500,000 토큰 | xAI 모델 문서 |
| 입출력 | 텍스트·이미지 → 텍스트 | xAI 모델 문서 |
| 지식 컷오프 | 2026년 2월 1일 | xAI 문서 |
| 추론 강도 | low / medium / high / xhigh 4단계 | xAI 문서 |
| 기본 레이트리밋 | 150 RPS / 50,000,000 TPM | xAI 모델 문서 |
| 공식 발표일 | 2026년 8월 12일 | x.ai 발표문 |
참고로 2차 매체 다수가 인용하는 “1.5조 파라미터” 수치는 xAI 공식 문서·발표문 어디에도 없습니다 — 파라미터 규모가 공개되지 않았으니 하드웨어 소요를 역산할 방법도 없습니다.
Q2. Dell과 xAI가 온프레미스 협력을 발표했다던데 사내 설치는 언제 되나요?

발표는 실재하지만 지금 도입 계획을 세울 근거로는 부족합니다. Dell Technologies는 2026년 5월 18일 공식 블로그에서 Dell AI Factory with NVIDIA로 Grok 모델을 온프레미스 제공한다고 발표했습니다. 다만 해당 발표문에는 대상 모델 버전·하드웨어 사양·출시 시점이 명시돼 있지 않고, “Grok 4.6″이라는 이름 자체가 나오지 않습니다(2026년 8월 25일 원문 확인).
그래서 현시점에서 “Grok을 사내에 설치할 수 있다”는 진술은 성립하지 않습니다. 확인하지 못한 항목을 정리하면 이렇습니다.
- Dell AI Factory 온프렘 구성에 Grok 4.6이 포함되는지 — 확인 못 함
- 주문 가능 시점과 최소 하드웨어 구성 — 확인 못 함
- 라이선스 조건 및 가격 체계 — 확인 못 함
여기에 더해 xAI는 2025년 8월 Grok 3 오픈웨이트를 “약 6개월 내” 공개하겠다고 밝혔고 2026년 2월 재확인 보도도 있었으나, 2026년 8월 25일 기준 미이행 상태이며 새 일정도 공표되지 않았습니다. 오픈웨이트 공개 약속이 한 차례 시한을 넘긴 이력이 있는 만큼, 온프렘 발표만 근거로 도입 로드맵을 확정하는 건 위험합니다.
Q3. 그럼 실제로 내려받아 돌릴 수 있는 xAI 모델은 무엇이고 요건은 어떻게 되나요?

grok-2 하나뿐이며, 개인 장비로는 사실상 못 돌립니다. Hugging Face xai-org/grok-2 모델카드가 명시한 공식 구동 조건은 40GB 초과 VRAM GPU 8장 + SGLang 0.5.1 이상 + fp8 양자화 + TP=8입니다. 체크포인트는 약 500GB / 42개 파일, 라이선스는 “Grok 2 Community License Agreement”입니다. 다른 AI 모델 학습에 쓰지 못하게 막는 조항이 있어 OSI 기준 오픈소스로는 분류되지 않습니다.
| 구분 | 실측값 | 출처 등급 |
|---|---|---|
| 총 파라미터 / forward당 활성 | 약 270B / 약 115B (MoE 8전문가 중 2활성) | T2 분석 |
| GPU당 상주 가중치 (fp8) | 약 34GB | T2 실측 |
| GPU당 상주 가중치 (bf16) | 약 67GB — 대부분 카드 용량 초과 | T2 실측 |
| 권장 디스크 | 600–650GB | T2 실측 |
| 최소 조합 | NVLink 연결 A100 80GB / H100 / H200 8장 | T2 가이드 |
GGUF 양자화로 내려도 부담은 여전합니다. unsloth 배포판 실측 용량은 UD-TQ1_0 81.8GB, UD-IQ1_S 88.9GB, Q2_K 100GB, Q4_K_M 164GB, Q8_0 286GB, BF16 539GB이며, 구동에는 llama.cpp PR 15539 빌드가 필요합니다. 1비트 수준까지 눌러도 81.8GB입니다. 소비자용 GPU 단일 카드로는 손이 닿지 않는 구간입니다. 게다가 grok-2는 2024년에 학습된 모델이라 Grok 4.6과는 세대 자체가 다릅니다.
Q4. API로 쓴다면 비용은 어떻게 설계해야 하나요?

발표 헤드라인의 $2 / $6은 프롬프트 200k 토큰 미만 구간에만 적용됩니다. 500k 컨텍스트를 실제로 채우면 단가가 2배로 뜁니다.
| 채널·구간 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| xAI 직판 (200k 미만) | $2.00 | $0.50 | $6.00 |
| xAI 직판 (200k 이상) | $4.00 | $1.00 | $12.00 |
| Bedrock Global CRIS | $2.00 | $0.50 | $6.00 |
| Bedrock In-Region·Geo CRIS | $2.20 | $0.55 | $6.60 |
(단위: per 1M tokens, 2026년 8월 25일 확인 기준)
Bedrock은 Priority 티어가 1.75배, Flex 티어가 0.5배 배수로 적용됩니다. 실제 에이전트 루프 비용은 정가와 다르게 움직이는데, Artificial Analysis 측정에서 과제당 실측 비용 $0.84, 장기 과제 평균 완료 턴 수 약 53턴, 평균 투입 입력 토큰 약 0.5B로 집계됐습니다. 경쟁 모델 정가는 Claude Opus 5가 $5 / $25, GPT-5.6 Sol이 $5 / $30 수준이라 가격 우위는 분명합니다.
여기서 반드시 짚어야 할 함정이 하나 더 있습니다. 기본 추론 강도가 문서마다 반대로 적혀 있습니다 — xAI 문서는 high(default), AWS Bedrock 모델카드는 low(default)로 기재합니다. 같은 모델인데 공식 문서 두 곳이 상충하고, 기본값에 따라 토큰 소비와 비용이 크게 갈립니다. reasoning.effort 값을 코드에서 항상 명시적으로 지정하십시오. 명시하지 않으면 채널을 옮기는 것만으로 비용과 품질이 흔들립니다.
또한 발표문이 언급한 grok-4.6-fast 변형은 공식 모델 목록에서 항목을 찾지 못했습니다(확인 필요 — T1 미확인).
Q5. 데이터가 국내에 머물러야 하는 요건이면 Bedrock 경유로 해결되나요?

해결되지 않습니다. AWS Bedrock에 xai.grok-4.6이 2026년 8월 18일 launch, 2026년 8월 19일 일반 공급(GA)으로 등재됐고 runtime 엔드포인트 기준 30개 이상 리전을 지원합니다. 그런데 에서 In-Region 추론은 어느 리전에서도 지원되지 않습니다. 서울(ap-northeast-2)을 포함한 대부분 리전이 Global CRIS만 지원합니다. 국내 데이터 잔류가 계약 요건이라면 Bedrock 경유로도 못 채웁니다.
xAI 직판 API 쪽도 사정이 다르지 않습니다.
운영 안정성 지표는 참고할 만합니다. OpenRouter 실측(제공자 P50)으로 처리량 55 tokens/sec, 지연 1.12초, 가동률 99.95%가 집계됐고, 서빙 제공자는 xAI 본사 2계열(ZDR/일반)뿐입니다. 성능 자체는 Artificial Analysis Intelligence Index 61점으로 Grok 4.5의 56점에서 5점 올랐습니다. Claude Opus 5 63점·Claude Fable 5 62점이 위, GPT-5.6 Sol이 61점으로 동률입니다. 세부적으로는 Terminal-Bench v2.1 88.4%, τ³-Banking 50.7%, GDPval-AA v2 Elo 1753, AA-Briefcase Elo 1577이 측정됐습니다. 참고로 널리 인용되는 “1753 ELO”는 LMArena Elo가 아니라 Artificial Analysis의 GDPval-AA v2 Elo이며, 해당 지표에서 1위가 아니라 2위입니다. LMArena 텍스트 리더보드상 Grok 4.6의 순위와 Elo는 원본에서 확인하지 못했습니다.
정리
2026년 8월 25일 기준 Grok 4.6은 가중치가 공개되지 않았고 온프레미스 경로도 사양·일정 없이 발표 단계에 머물러 있습니다. 로컬 실행을 요건으로 잡는 순간 후보에서 빠집니다. API로 간다면 500k 컨텍스트는 세일즈 포인트로 읽되 과금은 200k 경계로 설계하고, reasoning.effort는 문서 상충을 감안해 코드에서 항상 명시해야 합니다. 국내 데이터 잔류가 필수라면 Bedrock도 답이 아닙니다. 자체 호스팅이 목적이라면 grok-2(약 270B / 8×40GB+ GPU / SGLang 0.5.1+)로 내려가는 대신 두 세대 뒤진 성능을 감수하는 선택만 남습니다. 긴 문서를 한 번에 처리하는 작업이라면 컨텍스트 1M에 $1.25 / $2.50인 grok-4.3이 오히려 유리하니, 요건을 먼저 확정한 뒤 채널을 고르는 순서가 맞습니다.
참고 자료
조사 기준일: 2026년 08월 25일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (원문 열람·대조 완료, 2026-08-25 확인)
– https://docs.x.ai/developers/models/grok-4.6 — 모델 스펙·가격·레이트리밋
– https://docs.x.ai/developers/grok-4-6 — 지식 컷오프·추론 강도·제공 채널
– https://docs.x.ai/developers/models — 전체 모델 목록·구간별 가격
– https://x.ai/news/grok-4-6 — 발표문(발표일·벤치마크·가격)
– https://docs.x.ai/build/enterprise — 엔터프라이즈 배포 옵션(ZDR)
– https://docs.aws.amazon.com/bedrock/latest/userguide/model-card-xai-grok-4-6.html — Bedrock 모델카드(가격·리전·기본 추론값)
– https://huggingface.co/xai-org — xAI 공개 가중치 저장소 목록
– https://huggingface.co/xai-org/grok-2 — grok-2 모델카드(용량·GPU 요건·라이선스)
– https://www.dell.com/en-us/blog/dell-technologies-and-spacexai-collaborate-to-bring-grok-on-premises-to-enterprise-environments/ — 온프레미스 협력 발표
Tier 2 (2026-08-25 확인)
– https://artificialanalysis.ai/articles/grok-4-6-benchmarks-and-analysis — 독립 지수·에이전트 벤치·실측 비용
– https://the-decoder.com/spacexais-grok-4-6-matches-openais-best-model-and-undercuts-it-on-price/ — 경쟁 모델 가격 비교
– https://openrouter.ai/x-ai/grok-4.6 — 처리량·지연·가동률 실측
– https://www.unite.ai/grok-4-6-is-now-generally-available-on-amazon-bedrock/ — Bedrock GA 일자·리전 수
– https://huggingface.co/unsloth/grok-2-GGUF — 양자화별 용량·llama.cpp 요건
– https://www.spheron.network/blog/deploy-grok-2-5-gpu-cloud/ — GPU당 VRAM·디스크 실측
– https://huggingface.co/xai-org/grok-2/discussions/24 — grok-2 파라미터 구성 분석

답글 남기기