OpenAI가 GPT-6 아스트라 (Astra)를 정식 공개하면서 인공 일반 지능(AGI) 시대가 도래했다고 자신 있게 발표했습니다. 이 주장은 독립적인 검증이 필요해 보이지만, 몇몇 분야에서 확실히 한 세대 수준으로 진보한 모습들이 보이고 있습니다. 예를 들어 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록해 AGI에서 기대할 수 있는 수준까지 점수가 높아졌습니다. 심지어 OpenAI는 GPT-6 Astra를 사용하는 사람들은 더 이상 마우스를 클릭하거나 키보드를 사용할 필요가 없다고 주장했습니다. GPT-6 Astra는 개발자가 AI 에이전트가 사용해야 하는 모든 애플리케이션에 대해 전용 API 대신 인간과 매우 유사한 방식으로 모든 소프트웨어를 탐색할 수 있습니다. 예를 들어 브라우저, 스프레드시트, 웹사이트 및 데스크톱 애플리케이션을 넘나들며 작업하고, 완성된 문서와 프레젠테이션을 제작하며, 단순히 사용자에게 완료 방법을 알려주는 것이 아니라 여러 단계를 거치는 워크플로를 구현할 수 있습니다. 실제 데모 영상에서 타이핑이 아니라 단순히 말로 업무 내용을 지시하면 이를 이해하고 여러 작업들을 시행하는 것을 볼 수 있습니다. 성능 벤치마크에서 GPT-6 Astra는 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록했습니다. 또한 FrontierMath Tier 4 v2에서 97.6%, DeepSWE v1.1에서 74.1%, BenchCAD에서 95.9%, GPQA Diamond에서 96%의 점수를 받았습니다. 인공지능 분석 지수(AGI)에서는 61.2점을 기록했는데 , 이는 GPT-5.6 Sol의 60.9점보다 약간 높은 수준입니다. 다만 ARC-AGI-3에서 기록한 놀라운 점수는 맞춤형 하네스의 도움을 받은 것으로 보입니다. 벤치마크 GPT-6 Astra 점수 비고 ExploitBench 100% 완벽 점수 ARC-AGI-3 98.6~99.9%...