OpenAI가 GPT-6 아스트라 (Astra)를 정식 공개하면서 인공 일반 지능(AGI) 시대가 도래했다고 자신 있게 발표했습니다. 이 주장은 독립적인 검증이 필요해 보이지만, 몇몇 분야에서 확실히 한 세대 수준으로 진보한 모습들이 보이고 있습니다. 예를 들어 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록해 AGI에서 기대할 수 있는 수준까지 점수가 높아졌습니다.
심지어 OpenAI는 GPT-6 Astra를 사용하는 사람들은 더 이상 마우스를 클릭하거나 키보드를 사용할 필요가 없다고 주장했습니다. GPT-6 Astra는 개발자가 AI 에이전트가 사용해야 하는 모든 애플리케이션에 대해 전용 API 대신 인간과 매우 유사한 방식으로 모든 소프트웨어를 탐색할 수 있습니다. 예를 들어 브라우저, 스프레드시트, 웹사이트 및 데스크톱 애플리케이션을 넘나들며 작업하고, 완성된 문서와 프레젠테이션을 제작하며, 단순히 사용자에게 완료 방법을 알려주는 것이 아니라 여러 단계를 거치는 워크플로를 구현할 수 있습니다.
실제 데모 영상에서 타이핑이 아니라 단순히 말로 업무 내용을 지시하면 이를 이해하고 여러 작업들을 시행하는 것을 볼 수 있습니다.
성능 벤치마크에서 GPT-6 Astra는 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록했습니다. 또한 FrontierMath Tier 4 v2에서 97.6%, DeepSWE v1.1에서 74.1%, BenchCAD에서 95.9%, GPQA Diamond에서 96%의 점수를 받았습니다. 인공지능 분석 지수(AGI)에서는 61.2점을 기록했는데 , 이는 GPT-5.6 Sol의 60.9점보다 약간 높은 수준입니다. 다만 ARC-AGI-3에서 기록한 놀라운 점수는 맞춤형 하네스의 도움을 받은 것으로 보입니다.
Computer Use (가장 큰 강점)
Professional Work
Coding
Academic / Science
Cybersecurity (Critical 수준 도달)
GPT-6 아스트라는 약 10조 개의 파라미터를 가진 오픈AI의 가장 강력한 내부 모델인 벨(Bel)을 기반으로 알려져 있습니다. 이 모델은 텍사스에 있는 스타게이트 데이터 센터 의 10만 개 GPU 클러스터 에서 학습되었습니다. 아스트라는 단순한 챗봇 스타일의 단일 답변에서 벗어나, 여러 개의 내부 하위 에이전트를 생성하고 관리하여 매우 복잡한 문제를 해결할 수 있습니다. 아스트라의 루트 에이전트는 매우 복잡한 문제를 더 작은 부분으로 나누고, 각 부분에 하위 에이전트를 할당한 다음, 종합적인 결과를 도출합니다.
실제로, 2026년 8월 초, OpenAI는 Astra가 수학 및 이론 컴퓨터 과학 분야의 오랜 난제 10건을 독자적으로 해결했거나 상당한 진전을 이루었다고 발표했습니다. Astra의 해법은 이후 형식 증명 보조 언어인 Lean 4를 통해 검증되었습니다.
다만 실제 가장 수요가 높은 코딩 벤치를 보면 경쟁자인 페이블 5.1을 크게 넘어서지 못하거나 오히려 약간 뒤진 부분도 존재합니다. 여기에 ARC-AGI-3 점수 역시 하네스(harness)를 이용했을 경우로 표준 조건에서는 이보다 낮은 점수를 기록해 AGI라고 부를 정도인지는 다소 의문입니다.
아무튼 그래도 성능을 높인 프론티어 모델이라는 점에서는 의의가 적지 않습니다. 주요 경쟁자인 구글도 제미나이 프로 모델을 업데이트 하지 못하는 상황이고 그록 4.5나 메타, MS의 AI도 두드러지지 못한 상황에서 앞서나가긴 하기 때문입니다. 다만 중국 AI 모델의 맹추격이 쉽지 않은 도전입니다. 현재 상황을 보면 1-2달 이내로 거의 따라잡은 중국 모델이 나와도 이상할 건 없어 보입니다.
참고

댓글
댓글 쓰기