오픈소스 AI 모델 시작 전 확인할 것

2026년 8월 셋째 주는 오픈 가중치 모델 공개가 유난히 몰린 주였습니다. 알리바바가 Qwen3.8 계열을, DeepSeek이 V4-Pro를 정식 출시했고, 국내에서는 독자 AI 파운데이션 모델(독파모) 2차 참여 기업 네 곳의 가중치가 허깅페이스에 모두 올라왔습니다. 다만 “공개됐다”는 헤드라인과 “우리 조직이 쓸 수 있다”는 결론 사이에는 최소 세 개의 관문이 있습니다.
첫 번째 관문은 라이선스입니다. 이번에 공개된 모델의 라이선스는 MIT, Apache 2.0, 그리고 기업 자체 라이선스로 갈립니다. Qwen3.8-2.4T-A95B는 qwen3.8-max라는 자체 라이선스를 쓰는데, MaaS 사업자 계열 합산 매출이 연속 12개월 중 미화 5,000만 달러를 넘으면 별도 라이선스를 받아야 한다는 조항이 들어 있습니다. 반면 같은 날 묶여 발표된 Qwen3.8-27B는 Apache 2.0입니다.
두 번째 관문은 하드웨어입니다. 2.4조 파라미터 모델은 동적 1비트 양자화로 압축해도 397GB, BF16 무손실은 4.9TB입니다. “오픈웨이트”가 곧 “개인이 돌릴 수 있다”를 뜻하지 않습니다.
세 번째 관문은 비용 구조의 변동성입니다. DeepSeek API 요금은 조사 기준일인 2026년 8월 16일 16:00 UTC부터 인상되며 피크·오프피크 요금제로 전환됩니다. 어제 잡은 예산이 오늘 어긋날 수 있다는 뜻입니다.
이 글은 이 세 관문을 순서대로 통과하는 실무 점검 절차를 다룹니다. 모든 수치는 2026년 8월 16일 확인 기준이며, 출처 등급(T1 원문 확인 / T2 독립 측정 / T3 커뮤니티)을 병기했습니다.
준비물·필요 서류

도입 검토를 시작하기 전에 아래 항목을 표로 정리해 두면 이후 판단이 빨라집니다.
모델별 라이선스·규격 대조표
| 모델 | 총 파라미터 / 활성 | 컨텍스트 | 라이선스 | 모달리티 |
|---|---|---|---|---|
| Qwen3.8-2.4T-A95B | 2.4T / 95B (MoE) | 262,144 → 1,010,000 확장 | qwen3.8-max 자체 | 텍스트 전용 |
| Qwen3.8-27B | 27B 밀집 | 262,144 → 100만 확장 | Apache 2.0 | 이미지·비디오 이해 |
| DeepSeek-V4-Pro | 1.6T / 49B (MoE) | 100만 | MIT | 텍스트 전용 |
| K-EXAONE-2.0-750B-A37B | 750B / 37B (MoE) | 262,144 | Apache 2.0 | 텍스트 |
| Solar-Open2-250B | 250B / 15B | 100만 | Upstage Solar License | 텍스트 |
| Motif-3 | 약 314B / 약 13.2B | 262,144 | MIT | 텍스트 |
| A.X-K2 (SKT) | 688B | 미확인 | 확인 필요 (T1 미확인) | 파생 모델로 비전·오디오 존재 |
사전에 확보해야 할 항목
- 법무 검토용 라이선스 원문 사본. 요약본이 아니라 허깅페이스 리포지터리의
LICENSE파일 원문을 내려받으십시오. 지역 제한설처럼 원문에 없는 조항이 커뮤니티에서 유통되는 사례가 실제로 있었습니다. - 자사 매출·MAU 수치. Qwen 자체 라이선스는 연매출 5,000만 달러, 월간활성사용자 1억 명, 월매출 2,000만 달러라는 세 개의 임계값을 씁니다. 제3자에게 출력이나 모델 능력을 제공하지 않는 사내 사용은 면제됩니다.
- 가용 GPU 목록과 VRAM 총량. 양자화 계획을 세우려면 카드별 VRAM을 정확히 알아야 합니다.
- 월간 예상 토큰 사용량(입력·출력 분리). API 경로를 검토한다면 필수입니다. 캐시 히트 비율까지 추정해 두면 좋습니다.
- 배치 작업의 시간대 유연성 여부. DeepSeek 피크 시간대는 01:00–04:00 및 06:00–10:00 UTC로, 한국시간 기준 오전 10~13시와 15~19시입니다.
- 파생 모델 상용화 계획. Solar Open2는 파생 모델 이름에 “Solar” 접두어와 “Built with Solar” 표기를 요구합니다.
단계별 진행 순서

1단계 — 용도를 세 갈래 중 하나로 확정 (소요 30분)
용도가 정해지지 않으면 이후 모든 비교가 무의미해집니다. 세 갈래로 나누십시오. (A) 개인·소규모 팀의 단일 GPU 로컬 추론, (B) API로 프런티어급 추론을 저렴하게, (C) 한국어·규제 환경에서의 자체 호스팅. 각 갈래마다 지배적 제약이 다릅니다. A는 VRAM, B는 토큰 단가, C는 라이선스와 조달 가능한 GPU 수량입니다.
주의점: 두 갈래를 동시에 만족시키려는 시도가 가장 흔한 실패 패턴입니다. 예컨대 “로컬에서 돌리면서도 프런티어급 성능”은 이번 주 라인업으로는 성립하지 않습니다.
2단계 — 라이선스 원문 대조 (소요 1~2시간)
모델카드 요약이 아니라 LICENSE 파일을 직접 여십시오. 확인할 항목은 ⑴ 상용 이용 임계값, ⑵ 표기 의무, ⑶ 재배포·파인튜닝 산출물 조건, ⑷ 지역 제한 조항의 실제 존재 여부입니다.
실측 사례: Qwen3.8-max 라이선스가 미국·EU·영국·한국에서의 사용을 금지한다는 주장이 개발자 커뮤니티에 퍼졌으나, 원문에는 지역 제한 조항이 없습니다. 준거법 조항도 원문에서 확인되지 않습니다. 매출·MAU 임계 조항을 지역 조항으로 오독한 것으로 보입니다.
3단계 — 하드웨어 요구량 계산 (소요 1시간)
양자화 수준별 VRAM 요구량을 대입합니다. Qwen3.8-27B 기준 제3자 도구 벤더 문서의 수치는 다음과 같습니다.
| 양자화 | 필요 VRAM | 실행 가능 하드웨어 |
|---|---|---|
| 2-bit | 11–13GB | VRAM 12GB급 |
| 3-bit | 13–16GB | VRAM 16GB급 |
| 4-bit | 17–19GB | RTX 5080·4090, 24GB Mac |
| 6-bit | 24GB | RTX 4090 |
| 8-bit | 31GB | A6000급 |
| BF16 | 56GB | H100 1장 |
대형 모델은 계산 결과가 극단적으로 달라집니다. Qwen3.8-2.4T는 동적 1비트 XXXS 양자화에서도 397GB이고, Solar Open2-250B는 최소 H200 4장, 권장 8장이 모델카드에 명시돼 있습니다.
주의점: NVFP4 양자화는 블랙웰 계열에서 BF16 대비 약 1.5배 빠르다고 벤더 문서가 주장하나, 이는 벤더 측 수치입니다.
4단계 — 벤치마크를 같은 이름끼리만 비교 (소요 1시간)
이 단계에서 대부분의 잘못된 의사결정이 발생합니다. 이번 주 유통된 SWE-bench 계열 수치만 정리해도 다음과 같이 뒤섞여 있습니다.
| 모델 | 수치 | 벤치마크 이름 |
|---|---|---|
| Qwen3.8-2.4T | 67.7 | SWE-bench Pro |
| Qwen3.8-27B | 61.7 | SWE-bench Pro |
| DeepSeek-V4-Pro | 80.6% resolved | SWE-bench Verified |
| Motif-3 | 76.2 | SWE-bench Verified |
| Solar Open2 | 70.4 | SWE-bench Verified |
Pro와 Verified는 서로 다른 평가 셋이므로 한 줄에 놓고 비교할 수 없습니다. 커뮤니티에 돌던 “SWE-bench 87.3%”는 모델카드에 없는 수치입니다.
주의점: Qwen 모델카드는 shot 수와 도구 허용 여부를 명시하지 않습니다. 반면 DeepSeek 카드는 MMLU-Pro 87.5(5-shot), GSM8K 92.6(8-shot)처럼 조건을 병기합니다. 조건이 없는 수치는 신뢰 구간을 넓게 잡으십시오.
5단계 — API 비용 재산정 (소요 2시간)
DeepSeek 요금 변경이 이번 주 최대 변수입니다.
| 모델 | 변경 전 입력/출력 | 오프피크 | 피크 |
|---|---|---|---|
| deepseek-v4-pro | $0.435 / $0.87 | $0.66 / $1.98 | $1.32 / $3.96 |
| deepseek-v4-flash | $0.14 / $0.28 | $0.22 / $0.66 | $0.44 / $1.32 |
출력 기준으로 v4-pro는 오프피크 2.3배, 피크 4.6배 인상입니다. 캐시 히트 단가도 100만 토큰당 0.003625달러에서 0.022~0.044달러로 올라 프롬프트 캐싱의 절감 효과가 줄었습니다. 참고로 Qwen3.8-Max API는 입력 2.00달러, 출력 6.00달러입니다.
주의점: 두 모델 모두 최대 출력이 384K입니다. 장문 생성 작업이라면 출력 단가가 총비용을 지배합니다.
6단계 — 독립 지표로 교차 확인 (소요 30분)
자사 발표 수치와 제3자 측정치를 나란히 놓으십시오. Artificial Analysis 지수 기준으로 Qwen3.8 Max는 58점(188개 중 10위), DeepSeek V4 Pro는 53점(오픈웨이트 106개 중 3위), Motif 3는 47점(오픈웨이트 7위), Solar Open2는 37점(25위), A.X K2는 35점, K-EXAONE 2.0은 31점으로 보고됐습니다.
주의점: Qwen3.8 Max의 58점은 알리바바 API 엔드포인트를 측정한 값이며, 해당 페이지는 이 모델을 여전히 “proprietary”로 분류하고 있습니다. 내려받은 가중치의 성능 근거로 쓸 수 없습니다.
7단계 — 파일럿 구동과 실측 (소요 1~2주)
자사 워크로드 100~300건으로 실측합니다. 측정 항목은 첫 토큰 지연(TTFT), 초당 출력 토큰, 실제 소비 토큰량입니다. DeepSeek V4 Pro는 TTFT 1.79초, 출력 90.1 tok/s(중앙값 72)가 측정됐고, 평가 중 1.3억 토큰을 생성해 중앙값 대비 장황한 편으로 기록됐습니다. Solar Open2는 1.6억 출력 토큰으로 동급 중앙값 1억을 크게 웃돌았습니다. 장황함은 그대로 비용입니다.
자주 놓치는 부분

첫째, 발표된 기능과 공개된 가중치의 기능이 다릅니다. Qwen3.8-2.4T-A95B 모델카드는 “requires thinking mode for all interactions. Multimodal inputs are not supported, and thinking cannot be disabled”라고 명시합니다. API의 Qwen3.8-Max가 가진 비전 입력, non-thinking 모드, 기본 100만 컨텍스트는 공개 가중치에 없습니다. 허깅페이스 토론 #13은 이 문제를 제목에 걸었고 조사 시점에 973개의 좋아요와 36개 이상의 댓글이 달렸습니다. 다만 “비전 제거는 클라우드 유도”라는 해석은 검증되지 않은 사용자 추정이며, Qwen 팀의 공식 응답은 해당 스레드에 없었습니다.
둘째, thinking을 끌 수 없다는 제약은 아키텍처 문제입니다. 2.4T 모델은 저지연 경로에 넣을 수 없습니다. 챗봇 응답, 자동완성, 실시간 분류 같은 용도에서는 후보에서 빠집니다.
셋째, 큰 모델이 더 많은 걸 한다는 직관이 이번엔 뒤집혔습니다. 27B는 이미지·비디오 입력을 지원하는데 2.4T 오픈 체크포인트는 텍스트 전용입니다. 모달리티만 보면 작은 쪽이 넓습니다.
넷째, Artificial Analysis에서 가격이 0.00달러로 표시되는 건 무료라는 뜻이 아닙니다. Motif 3와 Solar Open2가 그 사례인데, 상용 서빙 제공자가 없어 가격과 속도가 측정되지 않았다는 의미입니다. 출력 속도도 N/A입니다. GPU를 직접 확보해야 씁니다.
다섯째, 순위 표기가 매체와 원출처 사이에서 어긋납니다. Motif 3는 오픈웨이트 4위로 보도됐으나 원 페이지 직접 확인 시 7위였습니다. 어느 시점 스냅숏인지 확인하지 않고 인용하면 근거가 무너집니다.
여섯째, 자사 발표와 독립 지수의 간극을 인지해야 합니다. LG AI연구원은 자체 24개 벤치마크 평균 70.1점(1차 63.3 대비 약 10% 향상)을 근거로 경쟁 모델과 대등하거나 우위라고 발표했으나, 기사에도 제3자 검증이 없다고 적혀 있습니다. 같은 모델의 Artificial Analysis 지수는 31점으로 국내 4개 모델 중 최하위였습니다. 어느 쪽이 맞다기보다 측정 셋이 다릅니다.
체크리스트 정리
- 용도를 A(로컬 단일 GPU) / B(저비용 API) / C(자체 호스팅) 중 하나로 확정했는가. 두 갈래를 동시에 노리지 않았는지 확인하십시오. 단일 GPU에서 오늘 당장 쓸 수 있는 선택지는 사실상 Qwen3.8-27B 하나입니다.
- 라이선스 원문(
LICENSE파일)을 직접 열어봤는가. 매출 임계, 표기 의무, 파생 모델 명명 규칙을 확인하십시오. MIT는 Motif 3와 DeepSeek-V4-Pro, Apache 2.0은 Qwen3.8-27B와 K-EXAONE 2.0입니다. - 양자화 수준별 VRAM 계산이 실제 보유 하드웨어와 맞는가. 4비트 17~19GB면 24GB 카드 한 장으로 충분하지만, 2.4T급은 1비트로도 397GB입니다.
- 인용하려는 벤치마크 수치의 정확한 이름과 조건(shot 수·도구 허용)을 함께 적었는가. Pro와 Verified를 섞지 마십시오.
- API 비용을 2026년 8월 16일 이후 요금표로 다시 계산했는가. 배치 작업이라면 한국시간 10~13시와 15~19시를 피하는 것만으로 절반 가까이 절감됩니다.
- 자사 발표 수치와 독립 지수를 나란히 놓고 비교했는가. 한쪽만 인용하면 순위가 뒤집힙니다.
- 확인되지 않은 항목을 “확인 필요”로 남겨뒀는가. SKT A.X-K2의 라이선스, 독파모 2차 단계평가 공식 결과, DeepSeek-V4-Pro-0813 체크포인트와 공개 가중치의 동일성 여부는 조사 기준일에 원문으로 확인하지 못한 항목입니다. 도입 결정 전에 반드시 직접 확인하십시오.
참고 자료
조사 기준일: 2026년 08월 16일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (WebFetch로 원문 확인, 확인일 2026-08-16)
– Hugging Face — Qwen/Qwen3.8-2.4T-A95B 모델카드: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
– Hugging Face — Qwen3.8-Max 라이선스 원문: https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/raw/main/LICENSE
– Hugging Face — Qwen/Qwen3.8-27B 모델카드: https://huggingface.co/Qwen/Qwen3.8-27B
– Hugging Face — Qwen 조직 페이지(공개 순서 확인): https://huggingface.co/Qwen
– Hugging Face — deepseek-ai/DeepSeek-V4-Pro 모델카드: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
– DeepSeek API Docs — 2026-08-13 체인지로그(V4-Pro GA): https://api-docs.deepseek.com/news/news260813
– DeepSeek API Docs — 가격표(2026-08-16 16:00 UTC 변경 포함): https://api-docs.deepseek.com/quick_start/pricing
– Hugging Face — LGAI-EXAONE/K-EXAONE-2.0-750B-A37B: https://huggingface.co/LGAI-EXAONE/K-EXAONE-2.0-750B-A37B
– Hugging Face — upstage/Solar-Open2-250B: https://huggingface.co/upstage/Solar-Open2-250B
– Hugging Face — Motif-Technologies/Motif-3: https://huggingface.co/Motif-Technologies/Motif-3
– SK텔레콤 뉴스룸 — A.X K2 공개(2026-07-29): https://news.sktelecom.com/228501
Tier 2 (독립 측정·매체 취재, 확인일 2026-08-16)
– Artificial Analysis — Qwen3.8 Max: https://artificialanalysis.ai/models/qwen3-8-max
– Artificial Analysis — DeepSeek V4 Pro 0813: https://artificialanalysis.ai/models/deepseek-v4-pro
– Artificial Analysis — Motif 3: https://artificialanalysis.ai/models/motif-3
– Artificial Analysis — Solar Open2 250B: https://artificialanalysis.ai/models/solar-open2-250b
– latent.space AINews — Qwen 3.8 Max(2.4T) and 27B: https://www.latent.space/p/ainews-qwen-38-max24t-and-27b-new
– Korea JoongAng Daily — LG unveils K-Exaone 2.0: https://www.koreajoongangdaily.com/business/lg-unveils-kexaone-20-koreas-largest-opensource-ai-model/12802076
– Unsloth Docs — Qwen3.8 로컬 실행 요구사항: https://unsloth.ai/docs/models/qwen3.8
– ZDNet Korea — 독파모 2차 결과 발표 임박(2026-08-13): https://zdnet.co.kr/view/?no=20260813172911
– 바이라인네트워크 — 독파모 2차 단계평가 국민평가단(2026-08-06): https://byline.network/2026/08/0806-3/
– BigGo Finance — Motif 3 AAII 47점 및 국내 4사 비교: https://finance.biggo.com/news/57ab7685-e1d6-4f97-9a48-8bf1aabcc3d6
– Unite.AI — Kimi K3 revenue-tiered license: https://www.unite.ai/moonshot-opens-kimi-k3-weights-under-a-revenue-tiered-license/
Tier 3 (커뮤니티 — 수치 근거 아님)
– Hugging Face 토론 #13 — 2.4T 오픈웨이트의 vision·1M 미포함 항의(973 likes, 36+ 코멘트): https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B/discussions/13
– Hacker News — Qwen 3.8-27B 스레드(본문 직접 확인 실패, HTTP 429): https://news.ycombinator.com/item?id=49272534
확인 실패 기록
– [https://qwen.ai/research](https://qwen.ai/research) — 본문 미렌더링, Qwen3.8-Max 공식 블로그 원문 확보 실패https://x.com/Alibaba_Qwen/status/2084100707423289643
-](https://x.com/Alibaba_Qwen/status/2084100707423289643) — HTTP 402, 공식 X 발표문 원문 확보 실패
– [https://news.ycombinator.com/item?id=49272534 — HTTP 429, 스레드 본문 확보 실패

답글 남기기