하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

뮤즈 스파크 1.1 vs 1.2 차이 정리, 어떤 버전을 써야 할까

뮤즈 스파크 1.1 vs 1.2 차이 정리, 어떤 버전을 써야 할까

작성자

카테고리:

약 19분 소요

2026년 8월 22일 기준 Muse Spark 1.1과 1.2의 벤치마크·가격·컨텍스트를 공식 자료로 대조했습니다. 가격은 동일하고 코딩은 1.2가, 무도구 멀티모달은 1.1이 앞섭니다. 판단 기준을 표로 정리했습니다.

메타 뮤즈 스파크, 무엇을 기준으로 비교해야 할까

코딩과 장기 실행 과제가 목적이라면 지금은 Muse Spark 1.2를, 도구를 끄고 쓰는 차트·이미지 해석이 목적이라면 1.1을 고르는 것이 맞습니다. 근거는 단순합니다 — 2026년 8월 22일 기준 두 버전의 API 가격이 입력 100만 토큰당 $1.25, 출력 $4.25로 완전히 같고 컨텍스트도 둘 다 1,048,576토큰(1M)이라, 가격 쪽에는 버전을 올리지 않을 이유가 남아 있지 않습니다. 이 글은 Meta 공식 문서와 Artificial Analysis·Vals AI·VentureBeat의 독립 측정치를 대조해 두 버전의 실제 차이를 정리한 것이며, 소비자 앱 사용법이나 프롬프트 작성 요령은 다루지 않습니다.

비교가 필요해진 배경에는 출시 간격이 있습니다. Muse Spark 1.1은 2026년 7월 9일 Meta Model API의 public preview와 함께 공개됐고, 불과 27일 뒤인 8월 5일에 코딩 특화 버전 1.2가 터미널 에이전트 Muse Code(beta)와 함께 나왔습니다. 검색으로 “1.1이 무엇이 달라졌나”를 찾아 들어온 시점에 이미 후속 모델이 존재합니다. 그러니 “1.1의 변화”만 보는 비교는 실무 판단에 쓸 수 없습니다.

중요한 판단 기준이 하나 더 있습니다. 조건을 지운 숫자 하나로 모델을 고르면 실제 환경에서 기대와 다른 결과가 나옵니다. 그래서 아래 비교에서는 측정 주체와 조건을 항목마다 함께 적습니다.


비교 기준 정리

두 버전을 놓고 볼 때 실제로 결정을 바꾸는 항목은 여섯 가지입니다. 각 항목의 단위와 함께 볼 때 주의할 점을 정리했습니다.

비교 항목 단위·기준 확인해야 할 점
컨텍스트 창 토큰 수 1.1·1.2 모두 1,048,576토큰으로 차이 없음. 이 항목으로는 버전이 갈리지 않습니다
API 가격 100만 토큰당 USD 2026년 8월 22일 기준 입력 $1.25 / 출력 $4.25 / 캐시 입력 $0.15로 두 버전 동일
숨은 과금 검색 1,000건당 USD 웹 검색 그라운딩은 1,000건당 $2.50이 별도 청구됩니다. 비용 모델에서 가장 빠지기 쉬운 항목
레이트 리밋 RPM / TPM Standard 티어는 3,000 RPM / 4,000,000 TPM
실제 비용 태스크당 USD Artificial Analysis Index 기준 태스크당 비용은 1.1 $0.29 → 1.2 $0.40으로 올랐습니다

여기서 마지막 항목이 이 비교의 함정입니다. 토큰 단가는 같은데 태스크당 비용이 오른 이유는 1.2가 같은 문제를 풀면서 토큰을 더 많이 쓰기 때문입니다. Artificial Analysis 측정으로 1.2의 입력 토큰 사용량은 53%, 출력 토큰은 36% 늘었습니다. 단가표만 보고 “가격이 같으니 무조건 최신”이라고 판단하면 청구서에서 어긋납니다.

용어를 한 줄로 풀어두면, 컨텍스트 창은 모델이 한 번에 읽고 기억하는 글의 최대 분량입니다. 1M 토큰은 한국어 기준 대략 장편 소설 여러 권 분량으로, 두 버전 모두 이 조건에서는 동급입니다. 캐시 입력은 같은 내용을 반복해서 보낼 때 적용되는 할인 단가입니다. $0.15는 정상 입력가 $1.25의 12% 수준이라 반복 프롬프트가 많은 서비스에서는 실질 비용을 크게 낮춥니다.

레이트 리밋에는 확인이 필요한 지점이 하나 있습니다. 1.2에 신설된 Contributor 티어의 리밋을 공식 가격 문서는 100 RPM으로 적고 있으나, VentureBeat의 실사용 보고는 60 RPM으로 기재했습니다. 두 수치가 상충하므로 실제 계정에서 직접 확인해야 합니다.


옵션·유형별 비교

옵션·유형별 비교

Meta 공식 모델 페이지의 벤치마크 표에서 1.1의 위치를 먼저 봅니다. 비교 대상은 이전 Muse Spark, Gemini 3.1 Pro, Claude Opus 4.8, GPT-5.5입니다.

벤치마크 Muse Spark 1.1 이전 버전 Gemini 3.1 Pro Opus 4.8 GPT-5.5
MCP Atlas 88.1 82.2 78.2 82.2 75.3
JobBench 54.7 17.0 15.9 48.4 38.3
Toolathlon-Verified 75.6 49.4 61.1 76.2 73.5
OSWorld-Verified 80.8 53.3 76.2 83.4 78.7
Finance Agent v2 57.2 43.0 53.9 51.8
Terminal-Bench 2.1 80.0 67.3 70.3 82.7 83.4
SWE-Bench Pro 61.5 55.0 54.2 69.2 58.6
DeepSWE 1.1 53.3 10.0 12.0 59.0 67.0
CharXiv Reasoning 88.4 88.9 81.6 89.9 84.8
BabyVision 76.3 39.9 51.5 81.2 83.6

표의 방향은 분명합니다. 1.1이 1위인 항목은 도구 오케스트레이션과 업무 대행 계열(MCP Atlas·JobBench·HLE·Finance Agent)에 몰려 있고, 코딩과 시각 추론에서는 Opus 4.8 또는 GPT-5.5에 밀립니다. 특히 JobBench 54.7 대 GPT-5.5의 38.3, MCP Atlas 88.1 대 75.3은 격차가 큽니다. 반대로 DeepSWE는 53.3 대 67.0으로 격차가 반대 방향입니다. “전반적으로 앞선다”가 아니라 잘하는 영역이 뚜렷하게 갈린 모델입니다.

이제 같은 회사의 1.1과 1.2를 직접 대조합니다. Meta 자체 멀티모달 리포트 기준입니다.

항목 1.1 1.2 방향
ZeroBench 46.0% 54.0% 1.2 우위
SimpleVQA 73.3% 75.0% 1.2 우위
CharXiv Reasoning 88.4% 87.6% 1.1 우위(1.2가 하락)
무도구 종합 60.2 59.8 1.1 우위
AA Index 51(기사) / 53(xhigh) 54 1.2 우위
AA SciCode 58% 56% 1.1 우위
AA HLE(무도구) 45% 44% 1.1 우위
AA 태스크당 비용 $0.29 $0.40 1.1 우위

여기서 핵심은 마지막 세 줄과 무도구 종합 항목입니다. 도구를 붙이지 않고 재면 1.1이 1.2보다 높습니다(60.2 대 59.8). 1.2의 향상은 도구를 쓰는 조건에서 나오고, 차트 QA에 해당하는 CharXiv는 오히려 0.8포인트 내려갔습니다. Artificial Analysis 측정에서도 SciCode와 HLE는 1.2에서 하락했습니다.

코딩 쪽 1.2의 개선폭에는 단서가 붙습니다. VentureBeat는 1.1에서 1.2로 오면서 Terminal-Bench가 6.7포인트, DeepSWE가 6.3포인트 올랐지만 그 향상 중 일부는 새 모델이 아니라 Muse Code라는 새 하네스(실행 환경)의 몫이라고 지적했습니다. 같은 매체 확인으로 1.2의 Terminal-Bench 2.1 82.9%는 Opus 5의 86.7%에 뒤지고, Meta 내부 코딩 벤치에서도 1.2 70.6% 대 Opus 5 79.4%로 밀립니다.

Vals AI의 독립 평가(추론 노력 xhigh)에서 1.1의 위치는 Vals Index 54.75%±1.15로 48개 모델 중 15위입니다. 세부는 MedScribe 88.89%(87개 중 1위), TaxEval v2 79.72%(141개 중 2위), Finance Agent v2 57.21%(51개 중 2위), Harvey Legal Agent 20.00%(52개 중 2위), Vibe Code Bench v1.1 72.16%±3.33(86개 중 5위)입니다. 일부 홍보성 요약이 “모두 1위”로 소개하지만 실측에서 1위는 MedScribe 하나이고 나머지는 2위입니다.

응답 속도는 OpenRouter 3일 라우팅 실측으로 1.1의 P50 지연 2.04초, 처리량 208 tok/s, 가동률 100.00%입니다. Artificial Analysis 측정에서는 출력 279.2 tok/s, TTFT 1.46초로 나옵니다.


상황별 추천

상황별 추천

목적별로 판단이 갈립니다. 아래는 위 수치를 그대로 적용한 결론입니다.

리포지토리 코딩·터미널 에이전트가 목적이라면 1.2로 올리는 것이 맞습니다. 가격이 같고 Terminal-Bench·DeepSWE가 개선됐기 때문입니다. 다만 태스크당 비용이 $0.29에서 $0.40으로 38% 정도 오르므로, 월 호출량이 큰 서비스라면 단가가 아니라 실제 토큰 사용량으로 재계산해야 합니다. 코딩 품질이 최우선이고 벤더를 바꿀 수 있다면 Opus 계열이 Meta 자체 표에서도 앞섭니다(Terminal-Bench 82.7 대 80.0, SWE-Bench Pro 69.2 대 61.5).

차트·문서 이미지 해석이 주 업무라면 1.1을 유지할 근거가 있습니다. CharXiv Reasoning 88.4 대 87.6, 무도구 종합 60.2 대 59.8로 1.1이 미세하게 높습니다. 차이가 1포인트 미만이라 결정적이지는 않으나, 굳이 옮길 이유도 없다는 뜻입니다.

MCP나 다중 도구 워크플로를 짜는 경우 1.1 계열의 강점 영역입니다. MCP Atlas 88.1, JobBench 54.7은 GPT-5.5(75.3, 38.3)와 격차가 큽니다. 반대로 리포지토리 단위 코딩만 본다면 GPT-5.5가 앞섭니다.

비용을 최우선으로 두는 경우 2026년 8월 22일 기준 Meta에서 가장 싼 선택은 1.1이 아니라 1.2의 Contributor 티어(muse-spark-1.2-contributor)입니다. 입력 $0.10 / 출력 $0.20 / 캐시 입력 $0.002로 입력 12배, 출력 21배 저렴합니다. 대가는 프롬프트와 응답을 Meta 학습에 쓰도록 허용하는 것이며, 사내 코드나 고객 데이터가 오가는 조직에서는 기본값이 아니라 명시적 선택 대상입니다.

소비자 앱만 쓰는 경우 1.1의 실질적 변화는 성능 수치보다 에이전트 기능입니다. 2026년 7월 24일 발표로 일정·메일 앱 연동, 슬라이드 생성, 데일리 브리핑이 붙었습니다. 다만 이 기능은 “select markets” 우선 배포이고 Meta가 대상 국가 목록을 공개하지 않았으므로 내 계정에서 안 보일 수 있습니다. WhatsApp 확대는 발표 당시 “in the coming weeks”로만 표기됐고 완료 여부는 확인되지 않았습니다.


자주 하는 실수

자주 하는 실수

조건이 다른 점수를 나란히 놓는 것. 가장 흔한 오류입니다. 두 숫자를 병기 없이 인용하면 17포인트가 조용히 왜곡됩니다. Terminal-Bench 2.1도 마찬가지로 값이 세 개 존재합니다 — Meta 공식 표 80.0, Artificial Analysis 하네스 78%, VentureBeat가 1.2 발표에서 역산한 기준선 76.2입니다. 하네스가 바뀌면 같은 이름이라도 비교가 성립하지 않습니다.

같은 기관 안에서도 값이 갈린다는 점을 놓치는 것. Artificial Analysis는 1.1의 Intelligence Index를 분석 기사에서 51, xhigh 설정 모델 페이지에서 53으로 적고 있습니다. 어느 쪽도 오류가 아니라 측정 설정과 시점이 다른 것이며, 인용할 때는 설정을 함께 밝히는 편이 안전합니다.

“최신이니 무조건 상위 호환”이라고 가정하는 것. 위 표에서 확인한 것처럼 1.1에서 1.2로 오면서 CharXiv 88.4→87.6, SciCode 58%→56%, HLE 45%→44%로 세 항목이 내려갔습니다. 버전 번호는 올랐지만 모든 축이 함께 오른 것은 아닙니다.

공개 문서의 내부 불일치를 확인하지 않는 것. 오디오 입력이 대표 사례입니다. Meta 문서의 서술 문장에는 “text, image, video, audio, and PDF”가 적혀 있으나 같은 문서의 모달리티 표에는 audio가 없습니다. 표 기준으로는 미지원이므로, 오디오가 필수인 서비스라면 프로덕션 투입 전 직접 실측이 필요합니다.

짚어둘 것이 하나 더 있습니다. Meta 문서상 1.1은 2026년 8월 22일 기준 Standard 티어 현역 모델로 남아 있고 폐기 공지나 가격 변경 표기가 없습니다. 그런데 Artificial Analysis는 1.1 페이지에 폐기 표시를 붙이고 기본 워크로드 외 벤치마킹을 중단했습니다. 계속 쓸 수는 있으나 제3자 추적이 끊기는 모델이라는 뜻이며, 앞으로 비교 자료를 구하기 어려워질 수 있습니다.


정리

가격과 컨텍스트가 같으므로 버전 선택은 워크로드 성격으로 결정됩니다. 코딩·터미널 에이전트는 1.2, 도구 없이 쓰는 차트·이미지 해석은 1.1, 비용이 최우선이고 데이터 학습 이용에 동의할 수 있다면 1.2 Contributor 티어가 각각의 답입니다. 오디오 입력 지원 여부와 Contributor 티어 실제 RPM은 2026년 8월 22일 기준 공개 자료가 상충하므로 직접 검증이 필요한 항목으로 남습니다.



참고 자료

조사 기준일: 2026년 08월 22일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1 (WebFetch로 원문 확인, 확인일 2026-08-22)
– Introducing Muse Spark 1.1 — https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/
– Meta AI Doesn’t Just Think, It Acts (뉴스룸, 2026-07-24) — https://about.fb.com/news/2026/07/meta-ai-muse-spark-doesnt-just-think-it-acts/
– Muse Spark 1.1 모델 페이지(벤치마크 표) — https://developer.meta.com/ai/models/muse-spark-1-1/
– Model API 가격·레이트 리밋 — https://dev.meta.ai/docs/pricing-rate-limits/
– Model API 모델 목록·모달리티 — https://dev.meta.ai/docs/models/
– Introducing Muse Code and Muse Spark 1.2 — https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2
– The Multimodal Intelligence of Muse Spark 1.2 — https://research.meta.ai/blog/multimodal-intelligence-of-muse-spark-1-2
– Meet Muse Spark 1.2 and Muse Code (개발자 블로그) — https://developer.meta.com/ai/resources/blog/build-with-muse-code/
Tier 1 후보이나 원문 대조 실패 (T1 미확인 처리)
– Muse Spark 1.1 Evaluation Report (PDF, 파싱 실패) — https://ai.meta.com/static-resource/muse-spark-1-1-evaluation-report
Tier 2 (WebFetch로 확인, 확인일 2026-08-22)
– Artificial Analysis — 1.1 모델 페이지 https://artificialanalysis.ai/models/muse-spark-1-1
– Artificial Analysis — 1.1 분석 기사 https://artificialanalysis.ai/articles/muse-spark-1-1-everything-you-need-to-know
– Artificial Analysis — 1.2 분석 기사 https://artificialanalysis.ai/articles/muse-spark-1-2
– Vals AI — https://www.vals.ai/models/meta_muse-spark-1.1
– TechCrunch (2026-07-09) — https://techcrunch.com/2026/07/09/meta-enters-the-crowded-ai-coding-battle-with-muse-spark-1-1/
– VentureBeat (2026-08-05) — https://venturebeat.com/orchestration/meta-enters-the-ai-coding-wars-with-muse-spark-1-2-and-muse-code-with-persistent-async-background-agents
– OpenRouter 1.1 — https://openrouter.ai/meta/muse-spark-1.1
– OpenRouter 1.2 — https://openrouter.ai/meta/muse-spark-1.2
– The Tribune (Glimmer 가중치 공개·1.2 예고) — https://www.tribuneindia.com/news/business/meta-opens-muse-glimmer-weights-zuckerberg-says-muse-spark-1-2-release-coming-soon/
– Kili Technology (evaluation awareness, 초기 Muse Spark 대상) — https://kili-technology.com/blog/llm-benchmarks-evaluation-awareness-muse-spark-report
접근 실패 (본문 미확인, 인용하지 않음)
– UPI 2026-08-10 (HTTP 403) — https://www.upi.com/Top_News/US/2026/08/10/meta-open-source-ai-model-muse-spark/7701786369775/
– CNBC 2026-08-10 (HTTP 403) — https://www.cnbc.com/2026/08/10/meta-muse-glimmer-open-weight-ai.html


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다