하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

잉클링 975B 오픈웨이트 도입 판단: VRAM·가격·컨텍스트 실효치 점검

잉클링 975B 오픈웨이트 도입 판단: VRAM·가격·컨텍스트 실효치 점검

작성자

카테고리:

약 19분 소요

잉클링(Inkling) 975B/41B 오픈웨이트 모델의 실제 도입 조건을 정리했습니다. BF16 2TB VRAM 요건, Tinker 서버리스 단가, 1M 컨텍스트의 실효 상한 256K, Inkling-Small의 SimpleQA 급락까지 2026년 8월 기준 수치로 확인합니다.

씽킹머신 잉클링 개요

씽킹머신 잉클링 개요

결론부터 말하면, 잉클링(Inkling)은 자체 데이터로 파인튜닝할 계획이 확실한 조직만 선택할 모델입니다. 성능 순위 때문에 고를 모델이 아니라는 점은 만든 회사가 발표문에 직접 적었습니다 — Thinking Machines Lab은 2026년 7월 15일 공개 발표문에서 “Inkling is not the strongest overall model available today, open or closed.”라고 명시했습니다. 이 글은 그 전제 아래 실행 요건(VRAM·컨텍스트·양자화), 단가 구조, 대안 모델과의 비교를 2026년 8월 22일 기준 자료로 정리했습니다.

모델 제원은 총 파라미터 975B에 활성 파라미터 41B, 66-layer decoder-only transformer에 sparse Mixture-of-Experts 피드포워드 백본을 결합한 구조입니다. 사전학습 규모는 발표문 원문 기준 45조(45 trillion) 토큰이며, 텍스트·이미지·오디오·비디오를 포함합니다. 라이선스는 Apache 2.0이고 가중치 전체가 Hugging Face에 공개됐습니다. 확인일 기준 최근 30일 다운로드는 145,026회입니다.

도입을 판단할 때 중요한 것은 발표문 헤드라인 수치와 실제 운용 조건 사이의 간극입니다. 공식 최대 컨텍스트는 1M 토큰이지만 관리형 경로에서는 256K가 상한이고, “오픈웨이트”라는 표현은 라이선스의 자유를 뜻하되 실행 하한은 데이터센터급입니다. 아래에서 그 간극을 항목별로 짚습니다.


1. 실행 요건: 2TB VRAM이라는 하한선

1. 실행 요건: 2TB VRAM이라는 하한선

가중치가 공개됐다는 사실과 자체 호스팅이 가능하다는 사실은 별개입니다. 모델카드에 명시된 실행 요건은 다음과 같습니다.

수치형식 VRAM 요건 GPU 구성 비고
BF16 2TB+ 8×B300 또는 16×H200 Inkling 기준
NVFP4 600GB+ 4×B300 또는 8×H200 Inkling 기준
BF16 600GB Inkling-Small (T2: MarkTechPost)
NVFP4 180GB 단일 B300에서 W4A4 가능 Inkling-Small (T2: MarkTechPost)

지원 수치형식은 BF16·MXFP8·NVFP4 세 가지입니다. 즉 가장 공격적인 양자화(NVFP4)를 적용해도 600GB 이상이 필요하며, 개인 워크스테이션이나 단일 서버로 커버되는 규모가 아닙니다. 라이선스가 Apache 2.0이라 파인튜닝·재배포 권리는 열리지만, 실행 인프라 관점에서 대부분의 조직에 “오픈”은 곧 “관리형 API를 쓰거나 클라우드 GPU 임대료를 낸다”는 의미로 귀결됩니다.

입출력 모달리티도 정확히 확인해야 합니다. 모델카드 기준 입력은 텍스트(UTF-8)·이미지(장변 40~4096px 권장)·오디오(WAV 16kHz, 20분 이내 권장)이며, 출력은 텍스트뿐입니다. 사전학습 데이터에 비디오가 포함된 것과 비디오를 입력으로 받는 것은 다른 이야기입니다. 일부 매체가 비디오를 입력 모달로 기술했으나 모델카드에는 비디오 입력 지원이 없습니다. 오디오·이미지를 함께 넣는 파이프라인을 설계한다면 이 경계가 그대로 제약 조건이 됩니다.

Inkling-Small은 상대적으로 현실적인 선택지입니다. 총 276B / 활성 12B, 42-layer 구조로 토큰당 256개 전문가 중 6개와 공유 전문가 2개를 라우팅합니다(아키텍처 세부는 T2: MarkTechPost). NVFP4 기준 180GB이면 단일 노드 구성이 가능한 범위에 들어옵니다.


2. 컨텍스트 1M은 어디까지 실효인가

2. 컨텍스트 1M은 어디까지 실효인가

이 항목이 설계 단계에서 가장 큰 오판을 만듭니다. 공식 최대 컨텍스트는 1M 토큰이지만, 실제 접근 경로마다 상한이 다릅니다.

경로 컨텍스트 근거
오픈웨이트 자체 호스팅 최대 1M T1: 모델카드
Tinker 훈련 티어 64K / 256K 선택 T1: Tinker 문서
Tinker 서버리스 추론 262,144 (모델 ID 표기) T1: Tinker 문서
Artificial Analysis 측정 조건 256K T2: AA
OpenRouter 표기 1M (최대 출력 262,144) T2: OpenRouter

정리하면, 관리형 경로에서 실효 상한은 256K(262,144 토큰)입니다. 제3자 평가기관인 Artificial Analysis도 Tinker API 256K 조건으로 측정했고, 오픈웨이트 버전이 1M을 지원한다는 점은 별도로 표기했습니다. OpenRouter 모델 페이지는 컨텍스트를 1M으로 적고 있으나 최대 출력은 262,144로 표기돼 있어, 어느 제공사가 1M을 실효로 제공하는지는 사실 확인이 상충하는 항목입니다. 이 글에서는 양쪽을 병기합니다. 1M 전제 설계가 필요하다면 자체 호스팅 비용부터 계산하는 편이 안전합니다.

서버리스 추론 자체도 완성된 서비스가 아닙니다. Tinker 문서는 서버리스가 현재 베타이며 Inkling과 Inkling-Small에만 제공된다고 밝힙니다. 프로덕션 SLA를 전제한 도입이라면 베타 표기를 그대로 리스크로 계상해야 합니다.

처리량 수치는 출처와 시점마다 흔들립니다. 7월 중순 측정은 72.7 tok/s·TTFT 1.75초, 확인일 기준 AA 모델 페이지는 83.9 tok/s·TTFT 1.79초, OpenRouter P50은 110 tok/s·지연 0.24초입니다(모두 T2). 제공사와 측정 시점에 따라 달라지므로 단일 수치로 인용할 수 없습니다. 용량 산정은 실제 사용할 제공사에서 직접 측정하는 것이 유일한 방법입니다.


3. 가격 구조와 한시 할인이라는 변수

3. 가격 구조와 한시 할인이라는 변수

2026년 8월 22일 확인 기준 Tinker 문서의 단가는 다음과 같습니다(모두 1M 토큰당).

항목 Inkling (64K 티어) Inkling-Small (64K 티어) Nemotron-3-Ultra-550B
Prefill $1.87 $0.58 $2.49
Cached $0.374 $0.116
Sample $4.68 $1.44 $6.225
Train $5.61 $1.73

서버리스 256K 티어는 Inkling이 입력 $1.00 / 캐시 $0.17 / 출력 $4.05, Inkling-Small이 $0.30 / $0.06 / $1.20입니다. 체크포인트 저장은 GB당 월 $0.10이고, 캐시 프리필은 80% 할인이 적용됩니다.

여기서 반드시 짚어야 할 점이 있습니다. Tinker 가격표에는 “Limited-time 50% discount” 표기가 붙어 있고, 종료 시점은 문서에 없습니다(확인 필요 — T1 미확인). 지금 보이는 단가가 정상가라는 보장이 없으므로, 12개월 이상의 예산 계획은 할인 없는 단가로 세우는 편이 안전합니다. 할인 종료만으로 추론 비용이 두 배가 되는 시나리오를 감당할 수 있는지가 실질적인 판단 기준입니다.

서드파티 경로도 비교 대상입니다. OpenRouter 확인일 시세는 입력 $0.95 / 출력 $4.05 / 캐시 리드 $0.16이며 제공사는 DeepInfra·Together·Baseten 3곳입니다(T2). 공식 발표문이 명시한 서드파티 제공처는 Together AI·Fireworks·Modal·Databricks·Baseten 5곳입니다. Databricks는 Unity AI Gateway·AI Playground·Agent Bricks 경로로 제공하되 SQL 질의 기능은 곧 지원한다고 밝혔습니다(T2: Databricks 블로그) — 시점은 미확인입니다. Inkling-Small의 서드파티 제공사 목록은 확인하지 못했습니다.

같은 플랫폼 안에서 비교하면 잉클링이 유리합니다. Nemotron-3-Ultra-550B 대비 prefill·sample 단가가 모두 낮으면서 Artificial Analysis Intelligence Index는 41점 대 38점으로 앞섭니다(T2). Tinker에서 굳이 Nemotron을 고를 이유는 약해 보입니다.


4. 벤치마크를 읽는 방법과 Small의 함정

4. 벤치마크를 읽는 방법과 Small의 함정

자사 측정 조건은 effort 0.99, temperature 1.0이며 코딩 평가는 256K max-token trajectory입니다. 사내에서 재현하려면 이 조건을 그대로 맞춰야 합니다.

평가 항목 Inkling Inkling-Small
AIME 2026 97.1% 95.5%
GPQA Diamond 87.2% 89.5%
HLE (텍스트만, 도구 없음) 29.7% 31.6%
SWE-bench Verified 77.6% 80.2%
MMMU Pro (Standard 10) 73.5% 74.0%
Terminal Bench 2.1 (best harness) 63.8% 64.7%
IFBench 79.8% 82.2%
SimpleQA Verified 43.9% 20.6%

표의 마지막 줄이 이 글에서 가장 중요한 한 줄입니다. Inkling-Small은 HLE·SWE-bench·IFBench·Terminal Bench에서 상위 모델을 앞서면서 파라미터는 3분의 1 미만입니다. 그런데 사실 회상 능력(SimpleQA Verified)은 43.9%에서 20.6%로 절반 이하로 떨어집니다. 지식 검색·사내 QA·고객 문의 응대처럼 사실 정확도가 결과를 좌우하는 용도에 Small을 투입하면 벤치마크 총점과 정반대 결과가 나옵니다. RAG 없이 Small을 지식 응답에 쓰는 구성은 권하기 어렵습니다.

제3자 지수도 설정값에 따라 흔들립니다. Artificial Analysis는 런치 기사에서 잉클링을 41점으로 미국 오픈웨이트 1위라고 평가했으나(Nemotron 3 Ultra 38, Gemma 4 31B 29, gpt-oss-120b 24), 확인일 기준 모델 데이터 페이지는 Inkling(xhigh) 42점, 107개 중 14위로 표시합니다. effort 설정이 점수를 움직인다는 뜻입니다. effort는 성능뿐 아니라 청구 토큰 수를 직접 좌우하는 변수이므로, 사내 평가에서는 effort를 고정한 뒤 비용과 점수를 함께 기록해야 합니다. 발표문 차트에는 0.2~0.99 범위가 등장하지만 파라미터명과 허용 범위의 문장 정의는 확인하지 못했습니다(확인 필요 — T1 미확인).

토큰 효율 주장도 조건부입니다. 발표문 원문은 Terminal Bench 2.1에서 Nemotron 3 Ultra 대비 약 3분의 1 토큰으로 동급이라는 취지이며, 특정 벤치마크·특정 비교 대상 한정 주장입니다. AA 측정에서는 지수 과제당 평균 출력 25K 토큰으로 GLM-5.2(43K)·Kimi K2.6(38K)·DeepSeek v4 Pro(37K)보다 적은 반면, 같은 기관 모델 페이지는 총 출력 130M(중위값 100M)으로 다소 장황한 편으로 분류합니다. 비교군을 바꾸면 결론이 뒤집히는 지표입니다.

세부 평가에서는 약점도 드러납니다. AA 기준 τ³-Banking은 Inkling 24% / Small 15%, AA-Omniscience는 정확도 40%에 환각률 63%입니다. 환각률 63%라면 도구 없이 사실 응답을 맡기는 구성은 위험합니다.


5. 도입 여부를 가르는 체크리스트와 리스크

5. 도입 여부를 가르는 체크리스트와 리스크

경쟁 구도에서 잉클링의 위치는 비교적 명확합니다.

비교 대상 잉클링이 나은 점 잉클링이 밀리는 점
DeepSeek V4 Flash (284B/13B) 오디오·이미지 네이티브 입력, Tinker 파인튜닝 경로 AA 지수 40점 동일 — 순수 지능 지표상 차별점 없음
Nemotron 3 Ultra AA 41 대 38, Tinker 단가도 저렴
GLM-5.2 등 중국계 오픈웨이트 AA 지수 출력 토큰 25K 대 43K HLE 29.7% 대 40.1%로 열위
폐쇄형 상용 API 가중치 소유 + 도메인 파인튜닝 회사가 최강이 아니라고 명시

파인튜닝을 실제로 돌릴 계획이 없다면 이 모델을 선택할 근거가 사라집니다. 성능 경쟁이 도입 명분이 아니기 때문입니다.

모델카드가 직접 밝힌 한계도 그대로 반영해야 합니다. 환각, 지시를 정확히 따르지 못하는 경우, 긴 멀티턴 대화에서의 성능 저하, 언어·방언별 성능 편차가 명시돼 있고, 의료·법률·안전 중대 영역은 추가 파인튜닝·검증·인간 감독 없이 배포하지 말라고 권고합니다.

벤더 지속성도 평가 항목입니다. TechCrunch 보도에 따르면 500억 달러 규모 조달이 작년 11월 추진됐다가 1월에 정체된 뒤 회사가 자금 상황을 언급하지 않았고, 인원은 약 200명이며, 가중치를 내려받은 쪽이 회사에 비용을 낼 의무가 없다는 수익 구조 문제가 지적됐습니다(T2). 같은 보도는 초기 post-training 데이터 일부를 Moonshot AI의 Kimi K2.5 등 타사 오픈웨이트 모델로 생성했다고 회사가 밝혔다고 전하며, 함께 소개된 Bridgewater 사례는 두 회사 자체 평가이며 독립 평가가 아니라고 못 박았습니다. 도입 근거로 인용할 만한 등급의 성과가 아닙니다. 조달 정체 이후 갱신 정보가 없어 벤더 리스크 평가 근거는 부족합니다.

확인하지 못한 항목도 명시해 둡니다. 학습 데이터 컷오프 날짜, 50% 할인 종료일과 정상가, thinking effort의 정확한 파라미터 규격, 1M 컨텍스트를 실효로 제공하는 상용 엔드포인트, Inkling-Small의 서드파티 제공사 목록, LMArena 순위는 모두 확인하지 못했습니다. PoC 단계에서 제공사에 직접 문의해 채워야 하는 공백입니다.

참고로 2차 매체 수치를 그대로 옮기면 위험합니다. 사전학습 규모를 45 quadrillion으로 표기한 매체 사례가 있는데(T2: Techzine), 원문은 45 trillion으로 1,000배 차이입니다.


정리

잉클링은 종합 성능으로 고르는 모델이 아니라 가중치 소유와 도메인 파인튜닝을 위해 고르는 모델입니다. 회사 스스로 최강이 아니라고 적었고, 자체 호스팅 하한은 NVFP4에서도 600GB·BF16에서 2TB VRAM입니다. 관리형 경로 실효 컨텍스트는 256K(262,144)이며, 1M 전제 설계는 자체 호스팅 비용 계산이 선행돼야 합니다. 2026년 8월 22일 확인 기준 단가에는 종료일 미공개의 50% 한시 할인이 반영돼 있으므로 예산은 할인 없는 단가로 잡고, Inkling-Small을 지식 응답에 쓸 경우 SimpleQA 20.6%라는 사실 회상 약점을 RAG로 보완해야 합니다.



참고 자료

조사 기준일: 2026년 08월 22일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (모두 WebFetch로 원문 확인, 확인일 2026-08-22)
– Inkling 발표문: https://thinkingmachines.ai/news/introducing-inkling/ (2026-07-15)
– Inkling-Small 발표문: https://thinkingmachines.ai/news/inkling-small/ (2026-07-30)
– Inkling 모델카드: https://thinkingmachines.ai/model-card/inkling/
– Tinker Models & Pricing 문서: https://tinker-docs.thinkingmachines.ai/tinker/models/
– 제품 페이지: https://thinkingmachines.ai/inkling/
– HF 모델 페이지(라이선스·다운로드): https://huggingface.co/thinkingmachines/inkling
Tier 2 (모두 WebFetch로 확인, 확인일 2026-08-22)
– Artificial Analysis — Inkling 런치 분석: https://artificialanalysis.ai/articles/thinking-machines-has-released-inkling-the-new-leading-u-s-open-weights-model (2026-07-15)
– Artificial Analysis — Inkling Small 분석: https://artificialanalysis.ai/articles/inkling-small-lands-within-a-point-of-inkling-on-the-artificial-analysis-intelligence-index-with-less-than-a-third-of-the-parameters (2026-07-30)
– Artificial Analysis — 모델 데이터 페이지: https://artificialanalysis.ai/models/inkling
– TechCrunch: https://techcrunch.com/2026/07/15/thinking-machines-amps-up-its-bet-against-one-size-fits-all-ai-with-its-first-open-model-inkling/ (2026-07-15)
– implicator.ai: https://www.implicator.ai/thinking-machines-inkling-takes-u-s-open-model-lead-with-41-score/ (2026-07-16, 07-20 수정)
– MarkTechPost: https://www.marktechpost.com/2026/08/02/thinking-machines-lab-releases-inkling-small-276b-open-weights-multimodal-moe-model/ (2026-08-02)
– OpenRouter 모델 페이지: https://openrouter.ai/thinkingmachines/inkling
– Databricks 블로그: https://www.databricks.com/blog/inkling-thinking-machines-lab-now-databricks (2026-07-15)
– Techzine: https://www.techzine.eu/news/analytics/142945/thinking-machines-lab-releases-inkling-an-open-weights-model/ (2026-07-16, 학습 토큰 수치 오기 사례)
– Hugging Face 블로그: https://huggingface.co/blog/thinkingmachines-inkling (2026-07-15, 하드웨어·프레임워크 지원)
Tier 3: 조사하지 않음 (범위 제외)


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다