딥시크 V4.1 플래시 - V4.0 프로 모델도 이긴 초저가 모델 등장

  (출처: 딥시크) ​ 중국 딥시크가 V4.0 버전을 내놓은지 얼마 되지도 않아 아키텍처를 대폭 개선한 DeepSeek V4.1 플래시를 선보였습니다. V4.1 플래시는 코딩 및 사이버 보안 측면에서 OpenAI의 GPT-5.6 Sol이나 앤스로픽 클로드 오푸스 5 같은 모델을 상당히 따라잡았습니다. 벤치 결과를 요약하면 ​ 주요 강점 영역 (코딩·에이전틱·사이버보안): ​ Terminal-Bench 2.1: 90.6 (Opus 5 89.1, GPT-5.6 Sol 88.8, 이전 V4 Flash 82.7) — 최고 수준. DeepSWE v1.1 (실제 GitHub 이슈 해결): 74.2 (Opus 5 74.0, Sol 73.0) — 약간 우위. CyberGym: 88.1 (Sol·GLM-5.3 84.5, Kimi K3 80.0) — 사이버보안에서 선두. Automation-Bench: 54.8 (Opus 5 50.3, Sol 45.8). Agent’s Last Exam: 31.8 (Opus 5 28.6, Sol 26.7). Codeforces Rating: 3471 (이전 모델 대비 상승). Vals.ai 독립 평가: 오픈웨이트 모델 중 Vals Index 1위 (57.86%), Code Migration·SkillsBench에서도 상위. 이전 V4 Flash 대비 큰 향상, 비용 대비 성능 우수. ​ 상대적으로 약한 영역: ​ Terminal-Bench 3.0/4.0 (더 긴 호라이즌): 30.0 / 31.2 (Opus 5가 43.3 / 51.8로 우위). ProgramBench, NL2Repo-Bench, SEC-Bench Pro, ExploitGym 등에서 Opus 5나 Sol에 뒤처짐. GPQA Diamond: 90.9 (Sol 94.1, Opus 5 93.4로 약간 낮음). HLE: 36.8 (도구 사용 시 63.9로 경쟁력 있음). ​ (그록 요약) ​ 놀라운 대목은 V4.0 프로 버전도 코딩, 에이전틱 임무에서 눌렀다는 것으로 이로 ...
최근 글