오픈웨이트 모델에서 중국이 독보적으로 앞서가고 있는 가운데, 프랑스의 유럽 소버린 AI인 미스트랄 AI가 미스트랄 라지 4 (Mistral Large 4)를 공개했습니다. 최근 미국에서 공개된 리플렉션의 빔처럼 최상위 미국 프런티어 모델과 중국의 오픈웨이트 모델 대비 성능이 우수하진 않지만, 그래도 나름 준수한 성능을 보여주는데, 특히 법률과 규제 관련해서 우수한 성능을 보여줘 규제가 강한 유럽 모델 (?) 답다는 평가를 받고 있습니다.
르 촌크(Le Chonk)"라는 별칭이 붙은 미스트랄 라지 4 모델은 효율적인 희소 혼합 전문가(MoE) 아키텍처를 갖춘 대규모 최첨단 모델입니다. 이 모델은 1조 개의 매개변수를 가지고 있지만, 실제로 활성화되는 매개변수는 490억 정도입니다. 이 모델 유럽 서버에서 2개월 동안 4,000개의 NVIDIA Grace Blackwell GPU를 사용하여 모델을 처음부터 학습시켰다고 합니다. 주요 강점과 성능을 요약하면
사이버보안: 가장 눈에 띄는 강점. Artificial Analysis Cyber Index에서 상위권(약 50점, GLM-5.3-Flash와 동급, 일부 중국 모델에 뒤처짐). CyberGym-E2E에서 취약점 재현 후 패치 작업 82%(최고 수준), Cybench 93% 등. 폐쇄형 모델(Claude Opus 5.x, GPT-6 Astra 등)이 안전 필터 때문에 거절하는 “취약점 재현·분석·패치” 작업을 수행할 수 있도록 정책이 유연합니다. 멀웨어 분석, 취약점 우선순위 지정, 탐지 규칙 작성 등에도 유용하다고 합니다. 오픈웨이트 + 자체 배포로 주권적 보안 운영이 가능하다는 점이 강조됩니다. Mistral
에이전틱 코딩·워크플로우: DeepSWE v1.1에서 약 61.7~62%(Mistral 발표 기준, 일부 중국 오픈 모델과 비슷하거나 약간 앞섬). SWE-Atlas-QnA 59.4%, Terminal-Bench 4.0 28.3%. Coding Agent Index 합산 약 49.8%. AutomationBench(비즈니스 워크플로우) 59.9%. 장시간 에이전틱 작업(리포지토리 이해, 터미널 조작, 도구 사용)에 강합니다. 인간 평가에서도 코딩 품질이 상위권입니다.
멀티모달·비주얼 그라운딩: 복잡한 이미지(항공/위성 사진, 엔지니어링 도면, 차트, PDF 등)에서 정확한 좌표·객체 위치 파악에 최적화. Dense200 등에서 일부 폐쇄형 프론티어 모델을 능가한다는 주장. 지구 관측, 제조, 엔지니어링 분야에 특화.
지식 업무(금융·법률 등): Finch(금융/회계 워크플로우) 약 67%, Harvey’s Legal Agent Benchmark에서 오픈 모델 중 선두(기사와 독립 평가 모두 규제/법률 관련 실무 작업에서 강점 확인). 스프레드시트·문서 생성/편집, 장시간 지식 작업(AA-Briefcase)에서도 경쟁력 있음.
과학·수학: SciCode-Verified 등에서 오픈웨이트 중 상위. 복잡한 시뮬레이션·데이터 분석·정밀 추론에 강점.
Artificial Analysis Intelligence Index: 38점. “미국·중국 외에서 가장 지능적인 모델”로 평가되며, DeepSeek V4.1 Flash(약 39)나 GPT-6 Luna(max 38)와 비슷한 수준입니다. 전반적으로 중국 오픈웨이트 최상위(GLM-5.3, Kimi K3, MiMo 등)에는 약간 뒤처지고, 미국 폐쇄형 프론티어에는 더 뒤집니다.
실제 모델 가중치가 공개되는 10월 27일 이후 정확한 평가가 가능하겠지만, 사실 법률 같은 특수 분야를 제외하면 다른 분야에서 성능은 중국 최신 오픈 모델은 물론 미국 프런티어 AI 모델보다 낮은 것으로 생각됩니다. 하지만 우리 입장에서는 비웃기만 하기 어렵습니다. 당장 전 세계를 기준으로 삼았을 때 국내 AI 모델보다 미스트랄이 훨씬 유명하고 더 많은 다운로드를 기록했기 때문입니다.
초창기 Mistral 7B·Mixtral 시리즈가 Hugging Face에서 수천만~억 단위 다운로드를 기록하며 개발자 생태계에 깊게 침투했고, 이후에도 유럽 기업·공공기관(은행, Airbus, BMW, ASML, 프랑스 정부 등)에서 온프레미스·주권형 배포로 실제 사용되는 사례가 꾸준히 보고됩니다. 엔터프라이즈 계약, 포워드 디플로이먼트(엔지니어 파견), 제조·금융 특화 사례가 상대적으로 풍부합니다.
한국 모델은 벤치마크(특히 Artificial Analysis Intelligence Index에서 일부 모델이 Mistral Large 4의 38점을 상회)에서는 경쟁력 있는 수치가 나오지만, 글로벌 다운로드·개발자 마인드셰어·해외 엔터프라이즈 채택 규모에서는 아직 격차가 큽니다. LG EXAONE 일부 양자화 버전이나 Upstage Solar 시리즈가 Hugging Face에서 의미 있는 다운로드를 기록하긴 하나, Mistral의 역사적 누적이나 중국 오픈 모델(DeepSeek, Qwen 등)의 압도적 규모와 비교하면 차이가 큽니다.
따라서 3위처럼 의미 없는 숫자 (1,2위인 미국, 중국이 압도적이기 때문)에 집착하기보다 실제 기업과 사용자들이 많이 찾고 개발자들이 파생 모델을 적극 개발할 수 있는 실용적 모델을 개발하는 것이 더 중요합니다. 미스트랄이 보여주는 교훈은 “유럽 최고”라는 상징보다, 실제 기업이 선택하고 돈을 지불하는 모델이 되었다는 점입니다. 한국 모델들이 벤치마크에서 일부 앞서더라도, 그 모델이 실제로 많이 쓰이지 않는다면 “3위”는 내부 만족용 숫자에 그칠 수 있습니다.
참고
https://mistral.ai/news/mistral-large-4/

댓글
댓글 쓰기