지난 8월 14일 공개된 알리바바의 Qwen 3.8 27B Dense 모델이 27B 모델 가운데서도 놀라운 수준의 에이전트/코딩 성능으로 화제를 일으키고 있습니다. 개인적으로 받아서 사용 중인데, 실제 R 코딩에서도 연구 분석에 필요한 코딩 작업에 이전 모델보다 훨씬 나은 성능을 보여주고 있습니다. 지금까지 썼던 로컬 코딩 머신 가운데 가장 우월한 성능을 보여주고 있어 놀랐는데, 벤치마크 결과 및 실사용기 역시 같은 결론을 보여주고 있습니다.
Text Performance
SWE-bench Pro: Except for Opus4.6 Max, which uses the officially reported score, all models are evaluated with the Claude Code harness at temp=1.0, top_p=0.95, and a 256K context window. Problematic tasks were corrected, and all baseline models were re-evaluated on the refined benchmark.
NL2Repo-Bench: Evaluated with the Claude Code harness. To prevent reward hacking, we disable Bash commands that attempt to access the specific repository, such as pip download, pip install, and git clone.
DeepSWE 1.1: Evaluated with the Claude Code harness at temp=1.0, top_p=0.95, and a 256K context window.
QwenSWEBench: In-house coding benchmark for evaluating models' software engineering capabilities. Evaluated with the Claude Code harness. Reporting avg@3 with an 8-hour timeout, max_tokens=32,768, temperature=1.0, and a 256K context window.
CoWorkBench: In-house cowork benchmark for evaluating long-horizon tasks across computer science, finance, law, medical, and other productivity domains.
HLE: Judged by GPT-4o.
The best result in each row is shown in bold.
Empty cells (--) indicate that results are not yet available or not applicable.
VL Performance
MathVision, BabyVision, and CharXiv (RQ): Where both settings are available, cells report “Without CI” and “With CI” separately; otherwise, only the available setting is shown. A small number of incorrect ground-truth annotations in MathVision and CharXiv (RQ) were corrected following manual verification, and all reported scores on those benchmarks were computed using the corrected annotations.
MathVision: Qwen3.8-27B is evaluated using the fixed prompt: “Please reason step by step, and put your final answer within \boxed{}.” For the remaining models, we report the higher score from two prompt variants—one with and one without the \boxed{} formatting requirement.
WebArena-Verified: Scores are computed with the official WebArena-Verified grader under the OSWorld scaffold.
RecreationBench: An in-house, long-horizon application-recreation benchmark designed to evaluate hybrid-agent capabilities across five platforms: desktop (Ubuntu, macOS, and Windows), mobile (Android), and the web.
ClawEval-MM: Scores are reported as “Pass@3 / average score.” Pass@3 is the percentage of tasks passed in at least one of three trials; the average score is the mean benchmark score across the three trials.
Vision2Web: Scores are averaged across the frontend, webpage, and website categories. Evaluations use the Claude Code harness and are judged by gpt-5.4-2026-03-05.
SWE-MM: Scores are evaluated on the Claude Code harness using the public dev split of SWE-bench Multimodal, with the modifications described in Appendix 8.3 of the Claude Opus 4.7 system card.
Empty cells (--) indicate that results are not yet available or not applicable.
좀 구형 모델이지만, 앤스로픽의 오푸스 4.6과 견줄 수 있는 로컬 코딩 LLM이라는 평가가 나오고 있습니다. 개인적으로는 앱 개발을 하지 않고 R 코딩만 보조로 사용하는 수준인데, 한 눈에 봐도 코딩 실력이 Qwen 3.6 35B A3B나 Gemma 4 26B A4B와 비교해서 확실히 좋아진 느낌입니다. 과거 어느 쪽이 코딩 실력 좋은지 가지고 영상 제작한 적이 있는데, 역시 이런 분야는 조금만 지나면 더 좋은 모델 나와서 큰 의미가 없게 되는 것 같습니다.
아무튼 Qwen 3.8 27B 사용기를 보면 흥미로운 내용들이 많은데, 예를 들어 Qwen 3.8 27B만 가지고 로컬에서 앱 제작을 한 경우 훨씬 큰 모델인 DeepSeek-V4-Flash-0731보다 더 좋은 결과물이 나온 경우도 있다는 것입니다. DeepSeek-V4-Flash-0731 모델은 총 2,840억 개(284B)의 파라미터를 가진 혼합 전문가(MoE) 모델이며, 토큰 처리 시에는 이 중 130억 개(13B)의 파라미터를 활성합니다. 더 큰 대형 모델보다 우수한 코딩/에이전트 성능으로 관심을 끈 모델이기도 합니다.
아래 영상에서는 몇 가지 코딩/에이전트 테스트를 했는데, 영상만 보면 오히려 크기가 1/10 수준인 Qwen 27B가 좀 더 우월한 결과물을 보여준 것 같습니다. 다만 실제로는 벤치 결과에서 DeepSeek-V4-Flash-0731 전반적으로 우수한 결과물을 보여줘서 일부 예외적 경우 중심으로 볼 수 있을 것 같습니다.
[요약 보고서: Qwen 3.8 27B vs DeepSeek V4 Flash 코딩 성능 비교] - Gemma 4 요약
1. 테스트 개요
테스트 환경: Mac Studio에서 두 모델을 로컬로 실행 (pi.dev 에이전트 하네스 사용)
테스트 방식: 동일한 프롬프트를 사용하여 세 가지 난이도의 앱을 제작 (추가 질문 없이 모델이 스스로 결과물을 낼 때까지 진행)
비교 모델:
Qwen 3.8 27B: 상대적으로 크기가 작은 모델
DeepSeek V4 Flash: 최신 모델
2. 난이도별 테스트 결과
난이도 테스트 항목 결과 요약 승자
하 (Easy) 날씨 대시보드 (API 연동) Qwen은 도시 검색 시 위치 옵션(위도/경도)을 제공하여 더 전문적이고 사용자 경험(UX)이 좋았음. DeepSeek은 검색 기능이 미흡하고 일부 아이콘이 렌더링되지 않음. Qwen
중 (Medium) 타워 디펜스 게임 두 모델 모두 게임 플레이는 구현했으나 UI 디테일에서 차이가 있음. DeepSeek은 업그레이드/판매 기능 등 상세 기능을 잘 구현했고 레이아웃이 깔끔했으나, Qwen은 게임판(Canvas) 디자인이 더 정교함. 무승부
상 (Hard) 엑셀 스프레드시트 (수식 기능) 핵심 승부처. Qwen은 반복적인 디버깅(리프롬프팅)을 통해 결국 수식(예: A1+B1)이 작동하는 결과물을 만들어냄. DeepSeek은 여러 번의 수정 시도에도 불구하고 끝내 핵심 기능(입력 및 계산) 구현에 실패함. Qwen
3. 심화 테스트: 추론(Reasoning) 모드 비교
조건: 'Thinking' 옵션을 켜고 'Reasoning Effort'를 낮게 설정한 상태에서 **단 한 번의 시도(One-shot)**로 결과물을 도출하도록 함.
결과:
Qwen: 즉시 사용 가능한 수준의 작동하는 스프레드시트를 만들어냄 (수식 계산 성공).
DeepSeek: UI 레이아웃은 나쁘지 않았으나, 여전히 셀에 값을 입력하거나 선택하는 기능이 작동하지 않음.
4. 최종 결론
Qwen 3.8 27B의 강점:
구현 능력(Building)이 매우 뛰어남: 단순한 코딩을 넘어 에이전트로서 문제를 해결하고 결과물을 완성하는 능력이 탁월함.
복잡한 논리가 필요한 작업(스프레드시트 수식 등)에서 DeepSeek보다 훨씬 안정적이고 실용적인 결과물을 내놓음.
DeepSeek의 특징:
전반적인 계획(Planning)이나 UI 레이아웃 측면에서는 우수할 가능성이 있으나, 실제 작동하는 코드를 완성하는 '마무리 능력'에서는 Qwen에 밀리는 모습을 보임.
최종 평점: Qwen의 압승. 개발자가 로컬 환경에서 코딩 에이전트로 활용하기에 Qwen이 훨씬 더 강력한 대안이 될 수 있음.
____________________________________________________________________________
아무튼 실제 Qwen 3.8 27B만으로도 앱 개발이나 간단한 레트로 게임 구현에 성공하는 경우들이 다수 보고되는 점은 무시할 수 없는 결과로 보입니다. 개인적으로 실사용시 통계적인 요구 사항을 스스로 판단하고 R 코드를 작성하는 성능 역시 꽤 개선된 모습이 보입니다. 사실 전반적인 추론 능력은 이전 모델과 비교해서 엄청나게 개선된 건 아니지만, 사후 학습을 통해 에이전트/코딩 성능에 중점을 두고 개선한 것이 성능을 높인 비결이라고 합니다.
그리고 Dense 모델이 같은 크기의 MoE 모델보다 코딩 성능이 더 우수한 것도 체감 성능이 우수해 보이는 이유일 수 있습니다. Dense는 모든 파라미터가 매 토큰에 참여합니다. MoE는 총파라미터가 커도 활성 파라미터가 훨씬 적습니다. 코딩처럼 정밀한 문법·로직·다중 파일 의존성 처리에는 “모든 가중치가 항상 작동”하는 방식이 유리한 경우가 있습니다. 따라서 같은 세대에서는 Dense 모델이 좀 더 코딩에 유리한 결과를 보였습니다.
심지어 Qwen 3.8 27B는 전세대 플래그쉽인 Qwen3.5-397B-A17B(MoE, total 397B / active 약 17B)를 주요 코딩 벤치마크에서 앞섰습니다. (SWE-bench Verified: 77.2 vs 76.2, SWE-bench Pro: 53.5 vs 50.9, Terminal-Bench 2.0: 59.3 vs 52.5, SkillsBench: 48.2 vs 30.0) MoE가 유행인 가운데 Dense 모델도 꾸준히 나오는 이유를 보여주는 결과가 아닐 수 없습니다.
아무튼 이렇게 되면 오히려 딥시크 같은 중국 AI들도 위협받을 정도의 로컬 모델이 아닐까 생각합니다. 4.0 이후에서는 어떻게 될까 궁금해지기도 하네요.
참고

댓글
댓글 쓰기