메타 뮤즈 글리머 로컬 실행 조건과 벤치마크 정리
뮤즈 글리머(Muse Glimmer)는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 오픈 웨이트 에이전트 모델입니다. 개인 컴퓨터 한 대에서 돌리는 것을 목표로 만들어졌고, 필요한 메모리와 실제 초당 토큰 수, 앞서는 항목과 뒤지는 항목을 공식 자료 기준으로 정리했습니다.

뮤즈 글리머(Muse Glimmer)는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 오픈 웨이트 에이전트 모델입니다. 가중치가 Apache 2.0 라이선스로 공개되어 있어 누구나 받아서 쓸 수 있습니다.
모델을 내 컴퓨터에서 직접 돌린다는 이야기는 이제 낯설지 않습니다. 그런데 발표문의 사양만 보고 모델을 받으면 막상 실행이 되지 않거나, 되더라도 답이 너무 느려서 쓰지 못하는 경우가 생깁니다. 어느 정도 사양에서 실제로 쓸 만한 속도가 나오는지가 발표문 앞쪽에 잘 적히지 않기 때문입니다.
메타는 그 수치를 모델 카드에 함께 올렸습니다. 공식 발표문과 모델 카드를 근거로, 2026년 8월 14일 기준으로 정리하겠습니다.

위 표는 메타가 모델 카드에 올린 정밀도별 요구 사양입니다. 같은 모델이라도 어느 판을 받느냐에 따라 필요한 메모리와 성능이 달라집니다.
뮤즈 글리머 발표에서 확인되는 사양
모델 카드에 적힌 값입니다.
| 항목 | 내용 |
|---|---|
| 모델 이름 | meta-models/Muse-Glimmer-30B |
| 파라미터 | 296억 개 (비전 인코더 18억 개 포함) |
| 구조 | dense 트랜스포머. 전문가 혼합 방식이 아니라 매번 전체 파라미터가 동작합니다 |
| 컨텍스트 | 131,072 토큰 |
| 지식 컷오프 | 2026년 1월 4일 |
| 입출력 | 텍스트와 이미지 입력, 텍스트 출력 |
| 라이선스 | Apache 2.0 |
| 학습 언어 | 100개 이상 |
| 받는 곳 | Hugging Face |
메타가 밝힌 목표는 "항상 켜 두는 로컬 에이전트"입니다. 인터넷이 끊겨도 쓸 수 있고 자료가 밖으로 나가지 않는 환경을 겨냥했습니다.
학습 언어 항목은 액면 그대로 받아들이지 않는 편이 좋습니다. 100개가 넘는 언어의 자료로 학습했다고 적혀 있지만, 모델 카드는 모든 언어를 평가하지는 않았고 지원이 약한 언어에서는 성능이 떨어질 수 있다고 함께 밝히고 있습니다.
내 컴퓨터에서 돌아가는지는 메모리가 정합니다
클라우드 API가 필요할 때마다 공방에 가서 장비를 빌려 쓰는 쪽이라면, 로컬 모델은 그 장비를 집에 들여놓는 쪽입니다. 들여놓으려면 놓을 자리부터 있어야 하듯, 로컬에서 모델을 돌리려면 메모리가 먼저입니다.
메타는 세 가지 판을 함께 냈습니다.
- 전체 정밀도(BF16): 64GB가 필요합니다. 미세 조정과 연구용입니다
- K-Quant-Dynamic: 32GB에서 돌아가고 성능이 0.2% 떨어집니다
- K-Quant-17GB: 24GB에서 돌아가고 성능이 1.0% 떨어집니다
압축한 판은 장비를 조금 깎아 좁은 자리에 맞춘 것과 같습니다. 자리를 줄인 만큼 성능도 조금 내려갑니다. 다만 24GB 판의 1.0%는 크지 않은 값이라, 개인 장비에서는 이쪽이 현실적인 선택입니다.
24GB는 RTX 4090이나 5090 같은 그래픽카드, 또는 통합 메모리가 넉넉한 맥이 해당합니다. 통합 메모리를 쓰는 맥은 전체 용량 가운데 일부만 GPU 쪽으로 잡히므로, 32GB 맥에서 32GB 판을 그대로 돌리기는 어렵습니다.
실행은 두 가지 방법이 모델 카드에 나와 있습니다.
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="meta-models/Muse-Glimmer-30B")서버 형태로 띄우려면 vLLM을 씁니다.
pip install vllm
vllm serve meta-models/Muse-Glimmer-30Bllama.cpp와 MLX, ExecuTorch 최적화, 그리고 Ollama와 LM Studio 지원은 앞으로 붙일 계획이라고 발표문이 밝히고 있습니다. 지금 쓸 수 있는 것은 위 두 가지입니다.
DFlash를 켜면 초당 토큰이 얼마나 늘어나는지
뮤즈 글리머가 앞세우는 속도의 근거는 DFlash입니다. 가벼운 보조 모델이 다음에 올 토큰 16개를 한 묶음으로 미리 제안하면, 본 모델이 그 묶음을 한꺼번에 확인해 맞는 것은 받아들이고 틀린 것만 고칩니다. 토큰을 하나씩 차례로 만드는 대신 여러 개를 미리 적어 두고 한 번에 검사하는 방식이라, 결과물은 같으면서 시간이 줄어듭니다.

위 표에서 눈여겨볼 것은 배수가 아니라 실제 초당 토큰 수입니다.
| 장비 | 적용 전 | 적용 후 | 배수 |
|---|---|---|---|
| RTX 5090 | 74.9 | 233.4 | 3.1배 |
| M5 Max | 26.6 | 50.2 | 1.8배 |
| M4 Max | 23.7 | 37.8 | 1.5배 |
DFlash를 켠 M4 Max의 초당 37.8토큰은 사람이 읽는 속도보다는 빠르지만, 긴 코드를 한 번에 받아 보기에는 기다림이 느껴지는 구간입니다.
같은 기법을 써도 장비에 따라 결과가 다릅니다. RTX 5090은 3.1배가 붙어 초당 233토큰까지 올라가는데, 맥북에서는 배수 자체가 작습니다. 배수만 적힌 발표문을 봤다면 맥에서도 세 배를 기대했을 텐데 실제로는 1.5배입니다.
메타가 배수 하나로 뭉뚱그리지 않고 장비별로 적어 둔 점은 참고할 만합니다. 받기 전에 내 장비가 표의 어느 줄에 가까운지 보고 기대치를 잡으면 실망할 일이 줄어듭니다.
벤치마크에서 앞서는 항목과 뒤지는 항목
메타는 같은 크기대의 Gemma4-31B, Qwen3.6-27B와 나란히 잰 결과를 공개했습니다. 25개가 넘는 항목이 있는데, 결과가 한쪽으로 기울지 않습니다.

앞서는 항목부터 보겠습니다.
| 평가 항목 | 뮤즈 글리머 | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| MCP Atlas (도구 호출) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA (검색) | 74.6 | 61.7 | 71.1 |
| SWE-Bench Pro (코드 수정) | 51.2 | 36.9 | 50.2 |
| AIME 2026 (수학) | 94.7 | 89.2 | 94.1 |
도구를 부르는 능력을 재는 MCP Atlas에서 격차가 가장 큽니다. 75.5점은 Qwen3.6-27B보다 13점, Gemma4-31B보다 21점 높습니다. 에이전트가 외부 도구를 정확히 골라 부르는 작업이라면 이 항목이 가장 직접적인 지표입니다.
뒤지는 항목도 함께 봐야 합니다.
| 평가 항목 | 뮤즈 글리머 | Qwen3.6-27B |
|---|---|---|
| TerminalBench 2.1 (터미널 작업) | 51.7 | 60.7 |
| OSWorld-Verified (화면 조작) | 65.9 | 75.6 |
| GDPVal-AA v2 (지식 노동) | 953 | 1141 |
| SWE-Bench Verified (코드 수정) | 76.0 | 77.2 |
터미널을 다루거나 화면을 직접 조작하는 작업에서는 Qwen3.6-27B에 뚜렷하게 밀립니다. 메타가 직접 고른 항목인데도 전 항목 우위가 아니라는 점은 그대로 읽는 편이 낫습니다.
정리하면 뮤즈 글리머는 도구를 부르고 자료를 찾는 쪽이 강하고, 터미널과 화면을 직접 다루는 쪽은 약합니다. 로컬 에이전트를 어떤 용도로 쓸지에 따라 판단이 달라집니다.
보안 항목도 함께 공개됐습니다. CI Memories는 모델이 사용자의 개인 정보를 규칙에 어긋나게 쓰는지 재는 항목인데, 뮤즈 글리머의 위반율은 26.4로 Qwen3.6-27B(53.4)보다 낮고 Gemma4-31B(12.1)보다는 높습니다. 프롬프트 공격이 통하는 비율을 재는 Siren AgentDojo에서도 28.4로 두 모델 사이에 있습니다.
로컬에서 돌릴 때 확인할 것
- 메모리부터 확인합니다. 24GB 미만이면 이 모델은 대상이 아닙니다. 32GB가 있으면 성능 저하가 0.2%인 판을 쓸 수 있어 24GB 판보다 유리합니다.
- 용도를 도구 호출 쪽과 터미널 쪽으로 나눠 봅니다. 앞쪽이면 같은 크기대에서 앞서고, 뒤쪽이면 Qwen3.6-27B를 함께 재 보는 편이 낫습니다.
- 초당 토큰을 장비 기준으로 잡습니다. 배수가 아니라 표의 실제 수치를 봅니다. 맥북이라면 표에 있는 M4 Max와 M5 Max 값이 기준이고, 그보다 낮은 등급은 더 느립니다.
- 지식 컷오프를 확인합니다. 2026년 1월 4일 이후의 내용은 모델이 알지 못하므로, 최신 자료가 필요한 작업에는 검색 도구를 붙여야 합니다.
- 한국어 작업은 직접 재 봅니다. 100개가 넘는 언어로 학습했다고 밝혔지만 모든 언어를 평가하지는 않았다고 모델 카드가 함께 적고 있습니다.
클라우드 API 대신 이 모델을 쓸 이유가 있나요?
작업 성격에 따라 다릅니다. 자료가 밖으로 나가면 안 되는 작업이나 인터넷이 불안정한 환경이라면 로컬에서 돌리는 것 자체가 이유가 됩니다. 호출량이 많아 API 요금이 부담스러운 경우도 마찬가지입니다.
반대로 품질이 가장 중요한 작업이라면 한 번 더 따져 볼 일입니다. 같은 크기대에서 앞선다는 것과 상위 모델과 견줄 만하다는 것은 다른 이야기입니다. 뮤즈 글리머의 비교 대상은 Gemma4-31B와 Qwen3.6-27B이지 그 위 등급의 모델이 아닙니다.
맥북에서 쓸 만한 속도가 나오나요?
M4 Max 기준으로 DFlash를 켜면 초당 37.8토큰이고, M5 Max는 50.2토큰입니다. 짧은 답을 주고받거나 도구를 부르는 작업에는 충분한 속도입니다. 다만 긴 코드를 한 번에 받아 보는 작업이라면 기다림이 느껴집니다. RTX 5090의 233.4토큰과 견주면 여섯 배 가까이 차이가 나므로, 같은 모델이라도 장비에 따라 쓰임새가 달라진다고 보는 편이 정확합니다.
3줄 요약:
- 뮤즈 글리머는 메타가 2026년 8월 10일 공개한 파라미터 296억 개 규모의 오픈 웨이트 모델이고, Apache 2.0 라이선스로 가중치가 공개되어 있습니다.
- 24GB에서 돌아가지만 성능이 1.0% 내려간 압축본이고, 32GB 판은 0.2%, 압축하지 않은 판은 64GB가 필요합니다.
- 도구를 부르는 MCP Atlas에서 75.5점으로 같은 크기대를 크게 앞서지만, 터미널 작업과 화면 조작에서는 Qwen3.6-27B에 뒤집니다.
Sources:
이 글이 도움이 되셨다면 공유해 주세요
메신저로 바로 보내거나 링크를 복사할 수 있습니다.

Written by
데이터로 설명하는 마케터
디지털마케터 뉴스레터
GA4, SEO, AI 마케팅 실무 인사이트를 월 1~2회 이메일로 보내드립니다.
다음으로 읽어볼 글

AI 추론 속도는 모델이 답을 만들어 내는 속도입니다. 2026년 8월 둘째 주에 나온 네 건의 발표를 놓고 각각이 속도를 어디서 얻는지, 발표된 배수가 실제 작업 시간에서 어떻게 줄어드는지를 공식 자료 기준으로 정리했습니다.
2026. 8. 14.
딥시크 V4 프로는 딥시크가 2026년 8월 12일 프리뷰를 끝내고 정식 버전으로 전환한 플래그십 모델입니다. 1.6조 파라미터 구조와 100만 토큰 컨텍스트, 압축 어텐션이 비용을 낮추는 방식, 공식 벤치마크의 비교 대상, 그리고 예고된 가격 인상까지 공식 문서 기준으로 정리했습니다.
2026. 8. 13.
OpenAI가 2026년 8월 10일 사이버보안 이니셔티브 Daybreak를 Blue와 Red 두 티어로 확장하고, 인가된 방어팀 전용 모델 GPT-5.6-Cyber를 공개했습니다. 두 티어의 차이와 접근 조건, 안전장치를 정리합니다.
2026. 8. 11.
RAG는 모델이 답하기 전에 학습 데이터 밖의 자료를 찾아 참고하게 만드는 방식이고, 파인튜닝은 예시를 학습시켜 모델이 답하는 방식을 바꾸는 작업입니다. 두 방식이 각각 무엇을 바꾸는지와 고르는 기준을 공식 문서 기준으로 정리합니다.
2026. 8. 8.뮤즈 글리머를 개인 컴퓨터에 받기 전에 가장 먼저 확인해야 할 것은 무엇일까요?