(출처: 딥시크) 중국 딥시크가 V4.0 버전을 내놓은지 얼마 되지도 않아 아키텍처를 대폭 개선한 DeepSeek V4.1 플래시를 선보였습니다. V4.1 플래시는 코딩 및 사이버 보안 측면에서 OpenAI의 GPT-5.6 Sol이나 앤스로픽 클로드 오푸스 5 같은 모델을 상당히 따라잡았습니다. 벤치 결과를 요약하면 주요 강점 영역 (코딩·에이전틱·사이버보안): Terminal-Bench 2.1: 90.6 (Opus 5 89.1, GPT-5.6 Sol 88.8, 이전 V4 Flash 82.7) — 최고 수준. DeepSWE v1.1 (실제 GitHub 이슈 해결): 74.2 (Opus 5 74.0, Sol 73.0) — 약간 우위. CyberGym: 88.1 (Sol·GLM-5.3 84.5, Kimi K3 80.0) — 사이버보안에서 선두. Automation-Bench: 54.8 (Opus 5 50.3, Sol 45.8). Agent’s Last Exam: 31.8 (Opus 5 28.6, Sol 26.7). Codeforces Rating: 3471 (이전 모델 대비 상승). Vals.ai 독립 평가: 오픈웨이트 모델 중 Vals Index 1위 (57.86%), Code Migration·SkillsBench에서도 상위. 이전 V4 Flash 대비 큰 향상, 비용 대비 성능 우수. 상대적으로 약한 영역: Terminal-Bench 3.0/4.0 (더 긴 호라이즌): 30.0 / 31.2 (Opus 5가 43.3 / 51.8로 우위). ProgramBench, NL2Repo-Bench, SEC-Bench Pro, ExploitGym 등에서 Opus 5나 Sol에 뒤처짐. GPQA Diamond: 90.9 (Sol 94.1, Opus 5 93.4로 약간 낮음). HLE: 36.8 (도구 사용 시 63.9로 경쟁력 있음). (그록 요약) 놀라운 대목은 V4.0 프로 버전도 코딩, 에이전틱 임무에서 눌렀다는 것으로 이로 ...
고든의 블로그 구글 분점
네이버 '고든의 블로그' 구글 분점입니다. 과학, 기술, 역사, IT, 밀리터리, 기타 여러가지 흥미로운 주제에 대한 글을 쓰고 있습니다. 방문하시는 분 모두 환영합니다.