(출처: 메타)
중국산 오픈 웨이트 모델의 공세가 거센 가운데 간만에 메타에서 오픈 웨이트 모델을 출시했습니다. 메타의 Muse Glimmer는 30B dense 모델로 Qwen 3.6 27B와 Gemma 4 31B를 경쟁 모델로 등장했습니다. MoE 모델이 없어 노트북에서 사용하기에는 약간 어렵고 모델을 다 올릴 수 있는 24GB 이상의 GPU가 있거나 혹은 32GB 맥 모델에서 가장 이상적인 제품으로 보입니다.
흥미로운 대목은 MoE 구조로 개인 PC에서 쾌적하게 돌아갈 수 있도록 MoE 모델을 지원하진 않지만, DFlash 드래프터 모델이라는 소형 보조 모델을 사용한다는 것입니다. 이 모델은 텍스트 덩어리 전체를 예측하여 Muse Glimmer가 한 번에 정답을 확인하고, 정답은 유지하고 오답은 버릴 수 있도록 합니다. 정답 확인은 생성보다 훨씬 빠르기 때문에, Meta가 공개한 데이터에 따르면 RTX 5090 카드에서는 3.1배, M5 Max에서는 1.8배, M4 Max에서는 1.5배 빠른 응답 속도를 제공합니다. Dense 모델의 단점인 높은 사양과 느린 응답 속도를 개선한 대목으로 보입니다.
Muse Glimmer는 다단계 자율 에이전트 작업에 최적화되어 있습니다. 복잡한 도구 호출(Tool Calling) 시 환각 및 파라미터 누락 비율이 현저히 낮고 실행 실패 시 스스로 원인을 분석하고 복구하는 자율 복구 (Self-Recovery) 성능 향상됐습니다. 로컬 파일 및 시스템 접근 시 발생할 수 있는 프롬프트 주입(Prompt Injection) 방어 능력도 우수한 편입니다.
참고로 훨씬 큰 교사 모델인 뮤즈 스파크 (Muse spark)를 지식 증류해 만든 학생 모델로 Qwen이나 Gemma 로컬 모델과 비슷한 방식을 통해 개발했습니다. 지식 증류에 대해서는 앞서 영상에서 소개한 바 있으니 참조 바랍니다.
(지식 증류는 1:32부터)
현재 대규모 오픈 웨이트 모델은 중국 모델이 휩쓸고 있는 상태이고 로컬 모델에서도 Qwen 같은 증류 모델이 큰 인기를 끌고 있는 가운데 구글의 Gemma에 이에 Muse Glimmer가 등장해 서구권 오픈 웨이트 모델의 가뭄의 단비 같은 역할을 해줄 것으로 기대합니다.
참고
https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model


댓글
댓글 쓰기