기본 콘텐츠로 건너뛰기

GPT-6 아스트라 (Astra) 공개 - AGI 시대 도래?

 


OpenAI가 GPT-6 아스트라 (Astra)를 정식 공개하면서 인공 일반 지능(AGI) 시대가 도래했다고 자신 있게 발표했습니다. 이 주장은 독립적인 검증이 필요해 보이지만, 몇몇 분야에서 확실히 한 세대 수준으로 진보한 모습들이 보이고 있습니다. 예를 들어 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록해 AGI에서 기대할 수 있는 수준까지 점수가 높아졌습니다.

심지어 OpenAI는 GPT-6 Astra를 사용하는 사람들은 더 이상 마우스를 클릭하거나 키보드를 사용할 필요가 없다고 주장했습니다. GPT-6 Astra는 개발자가 AI 에이전트가 사용해야 하는 모든 애플리케이션에 대해 전용 API 대신 인간과 매우 유사한 방식으로 모든 소프트웨어를 탐색할 수 있습니다. 예를 들어 브라우저, 스프레드시트, 웹사이트 및 데스크톱 애플리케이션을 넘나들며 작업하고, 완성된 문서와 프레젠테이션을 제작하며, 단순히 사용자에게 완료 방법을 알려주는 것이 아니라 여러 단계를 거치는 워크플로를 구현할 수 있습니다.

실제 데모 영상에서 타이핑이 아니라 단순히 말로 업무 내용을 지시하면 이를 이해하고 여러 작업들을 시행하는 것을 볼 수 있습니다.

성능 벤치마크에서 GPT-6 Astra는 ExploitBench에서 100%, ARC-AGI-3에서 98.6%의 점수를 기록했습니다. 또한 FrontierMath Tier 4 v2에서 97.6%, DeepSWE v1.1에서 74.1%, BenchCAD에서 95.9%, GPQA Diamond에서 96%의 점수를 받았습니다. 인공지능 분석 지수(AGI)에서는 61.2점을 기록했는데 , 이는 GPT-5.6 Sol의 60.9점보다 약간 높은 수준입니다. 다만 ARC-AGI-3에서 기록한 놀라운 점수는 맞춤형 하네스의 도움을 받은 것으로 보입니다.

벤치마크

GPT-6 Astra 점수

비고

ExploitBench

100%

완벽 점수

ARC-AGI-3

98.6~99.9%

하니스에 따라 다름 (표준 하니스는 더 낮음)

FrontierMath Tier 4 v2

97.6%

거의 포화

GPQA Diamond

96%

-

BenchCAD

95.9%

-

DeepSWE v1.1

74.1%

-

OSWorld 2.0

72.6%

GPT-5.6 Sol 대비 성능↑ + 소요시간 약 47%↓

Artificial Analysis Intelligence Index

61.2

GPT-5.6 Sol(60.9)보다 소폭 높음

Computer Use (가장 큰 강점)

벤치마크

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1 / Opus 5

비고

OSWorld 2.0 (offline)

72.6%

65.7%

Opus 5: 70.2%

작업당 소요 시간 약 47% 감소 (≈40분 vs 75분)

ScreenSpot-Pro (도구 없음)

92.7%

76.9%

Fable 5: 87.3%

UI 요소 인식 크게 향상

Agents’ Last Exam

59.3%

53.6%

Opus 5: 55.5% / Fable 5.1: 48.7%

전문 업무 에이전트 최고점, 토큰 사용량 Opus 5 대비 약 65% 절감

Professional Work

벤치마크

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

비고

AutomationBench

41.4%

18.1%

31.4%

비즈니스 워크플로우 자동화에서 큰 격차

BenchCAD

95.9%

83.3%

84.3%

3D CAD 재구성 최고점, 비용도 대폭 절감

BrowseComp

91.5%

90.4%

- / Opus 5: 90.8%

웹 리서치 거의 포화 상태

Artificial Analysis Intelligence Index

61.2

60.9

65.7

종합 지수에서는 Claude가 앞섬

Coding

벤치마크

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

Opus 5 / Gemini 3.8

DeepSWE v1.1

74.1%

72.7%

67.4%

Opus 5: 73.7% / Gemini: 73.8%

Terminal-Bench 4.0

57.9%

37.3%

55.8%

Opus 5: 52.3%

FrontierCode 1.1 (Extended)

64.5%

60.6%

63.6%

거의 동률

AA Coding Agent Index

67

65.1

70 (Fable 5.1)

Claude가 소폭 우위

Academic / Science

벤치마크

GPT-6 Astra

GPT-5.6 Sol

Claude Fable 5.1

비고

FrontierMath Tier 4 (v2)

97.6%

83.0%

87.8%

거의 포화, 가장 인상적인 수치 중 하나

Terminal-Bench Science 0.1

64.6%

22.4%

52.6%

과학 연구 워크플로우에서 큰 격차

GPQA Diamond

96.0%

94.6%

93.7%

거의 모든 모델이 포화 구간

Humanity’s Last Exam (tools)

57.2%

-

65.0%

Claude가 우위

HealthBench Professional

63.4%

60.5%

56.6~60.9%

-

Cybersecurity (Critical 수준 도달)

벤치마크

GPT-6 Astra

GPT-5.6 Sol

Claude Opus 5

ExploitBench

100%

78.5%

70%

SRE-Bench (4 attempts)

99.2%

68.7%

-

SRE-Bench (1 attempt)

88.0%

55.9%

12.5%

ExploitGym

42.4%

30.3%

-

GPT-6 아스트라는 약 10조 개의 파라미터를 가진 오픈AI의 가장 강력한 내부 모델인 벨(Bel)을 기반으로 알려져 있습니다. 이 모델은 텍사스에 있는 스타게이트 데이터 센터 의 10만 개 GPU 클러스터 에서 학습되었습니다. 아스트라는 단순한 챗봇 스타일의 단일 답변에서 벗어나, 여러 개의 내부 하위 에이전트를 생성하고 관리하여 매우 복잡한 문제를 해결할 수 있습니다. 아스트라의 루트 에이전트는 매우 복잡한 문제를 더 작은 부분으로 나누고, 각 부분에 하위 에이전트를 할당한 다음, 종합적인 결과를 도출합니다.

실제로, 2026년 8월 초, OpenAI는 Astra가 수학 및 이론 컴퓨터 과학 분야의 오랜 난제 10건을 독자적으로 해결했거나 상당한 진전을 이루었다고 발표했습니다. Astra의 해법은 이후 형식 증명 보조 언어인 Lean 4를 통해 검증되었습니다.

다만 실제 가장 수요가 높은 코딩 벤치를 보면 경쟁자인 페이블 5.1을 크게 넘어서지 못하거나 오히려 약간 뒤진 부분도 존재합니다. 여기에 ARC-AGI-3 점수 역시 하네스(harness)를 이용했을 경우로 표준 조건에서는 이보다 낮은 점수를 기록해 AGI라고 부를 정도인지는 다소 의문입니다.

아무튼 그래도 성능을 높인 프론티어 모델이라는 점에서는 의의가 적지 않습니다. 주요 경쟁자인 구글도 제미나이 프로 모델을 업데이트 하지 못하는 상황이고 그록 4.5나 메타, MS의 AI도 두드러지지 못한 상황에서 앞서나가긴 하기 때문입니다. 다만 중국 AI 모델의 맹추격이 쉽지 않은 도전입니다. 현재 상황을 보면 1-2달 이내로 거의 따라잡은 중국 모델이 나와도 이상할 건 없어 보입니다.

참고

https://wccftech.com/openai-wows-with-the-agi-era-gpt-6-astra-with-preliminary-benchmarks-showing-remarkable-performance-gains-as-sam-altman-says-releases-will-now-be-paced-by-safety-considerations-and-not-capabilit/

https://openai.com/index/gpt-6-astra/

댓글

이 블로그의 인기 게시물

100 테슬라급 자기장 도달

 미국의 로스 알라모스 국립 연구소 (Los Alamos National Laboratory) 에서 과학자들이 지금까지 인간이 개발한 가장 강력한 자기장을 발생시키는 장치 개발에 도전하고 있습니다. 자기장의 세기를 나타내는 방법으로 자기력선의 밀도를 나타내기 위해 단위 면적당 자기력선의 수를 표시하는 단위인 테슬라 (T) 가 있습니다. (1T = 1Wb/㎡  웨버 (Wb) 는 자속의 단위)   의료용으로 사용되는 초전도체를 이용한 MRI 의 경우 1.5 - 3 테슬라급의 강력한 자기장으로 인체 내부를 볼 수 있게 만들지만 과학 연구용으로 이보다 더 강력한 자기장이 필요할 수 있습니다. 최근에 등장한 90 테슬라급 자기장에 이어 이번에 로스 알라모스 국립 연구소에서는 100 테슬라급인 100.75 T 를 실현 했다고 합니다.   이를 구현한 것은 18000 파운드 (8.16 톤 정도) 의 코일과 여기에 에너지를 공급할 1200 메가줄 (Megajoule) 급 모터 제네레이터등의 설비입니다.  (   The 1,200-megajoule motor generator that powers the magnetic pulse.  )  이와 같은 연구를 통해 알아내고자 하는 것은  Quantum Phase transitions and new ultra high field magnetic states Electronic Structure determination Topologically protected states of matter  로 요약할 수 있다고 합니다.   아무튼 수 T 급 MRI 만 해도 자기장의 힘이 엄청난데 100 T 라니 엄청난 자기장이네요. 이는 지구 자기장 세기보다 200만배 강력한 (물론 좁은 범위에서 작용하는 자기장이라 지구 전체...

고대 양서류 이야기 (2) - 악어를 닮은 거대 양서류들

  페름기에는 다양한 양막류가 진화해서 앞서 소개한 육상형 템노스폰딜리는 점차 설 자리를 잃게 됩니다. 하지만 양서류는 본래 자신의 서식지인 물과 습지에서 여전히 번성을 누렸습니다. 당시에는 악어류 같은 대형 양서형 파충류도 없던 시절이었기 때문에 이와 비슷한 생태학적 지위는 여전히 양서류의 몫이었습니다. 이들에 대한 이야기는 제 책인 포식자에서 비교적 간단히 다뤘는데, 오늘은 여기에 대한 보충 설명입니다.  책 정보:  http://book.naver.com/bookdb/book_detail.nhn?bid=13347200 Yes 24:  http://www.yes24.com/24/goods/58772859 11번가:  http://books.11st.co.kr/product/SellerProductDetail.tmall?method=getSellerProductDetail&prdNo=1977867160 알라딘:  http://www.aladin.co.kr/shop/wproduct.aspx?ItemId=134877825 교보문고:  http://www.kyobobook.co.kr/product/detailViewKor.laf?ejkGb=KOR&mallGb=KOR&barcode=9788970447988&orderClick=LAG&Kc= 인터파크 :  http://book.interpark.com/product/BookDisplay.do?_method=detail&sc.prdNo=279593764&sc.saNo=003002003&bid1=search_auto&bid2=detail&bid3=prd_img&bid4=001 영풍문고:  http://www.ypbooks.co.kr/book.yp?bookcd=100843205&gubun=NV ...

이빨이 다시 진화한 개구리

  ( CT scans of Gastrotheca guentheri skulls revealed what appeared to be identical rows of teeth on both the upper and lower jaws, which researchers later confirmed through dissection. Credit: Florida Museum/Daniel Paluh )  개구리는 2억년 전 진화 과정에서 이빨을 잃어버리고 큰 턱과 혀를 이용해 곤충 같은 작은 먹이를 잡아 먹는 방향으로 진화했습니다. 파충류나 포유류 같은 다른 사지류와의 경쟁에서 밀려 양서류가 쇠퇴하고 멸종하던 시기에도 개구리는 여전히 생존할 수 있었던 비결입니다.   이빨이 없는 덕분에 큰 혀를 발사하기 편해졌을지는 모르지만, 이빨이 없으면 종종 불편할 때가 있습니다. 씹는 대신 삼키기 때문에 음식을 씹을 수 없다는 점은 문제되지 않지만, 필사적으로 달아나려는 먹이를 잡기 힘들기 때문입니다. 이런 이유 때문에 일부 개구리는 이빨 같이 보이는 엄니 (fang)을 지니고 있으나 이는 사라진 이빨이 다시 난 것이 아니라 다른 부분이 진화한 것입니다.   이는 돌로의 법칙 ( Dollo's Law )으로 알려져 있습니다. 진화 과정에서 퇴화한 부분이 다시 생겨나지 않으며 대신 필요하면 다른 부분이 진화해 그 역할을 대신한다는 것입니다. 예를 들어 아가미가 사라진 사지 동물은 다시 물에 들어온다고 해도 아가미가 다시 생기진 않습니다. 대신 고래처럼 폐가 커져서 그 기능을 대신하게 됩니다.   하지만 모든 법칙엔 예외가 있기 마련입니다. 남미에서 발견된 멸종 위기 개구리 중 하나인 구엔터 유대류 개구리 ( Gastrotheca guentheri, Guenther's marsupial frog, dentate marsupial frog)는 완전한 형태의 이빨을 지니고 있습니다. 참고로 유대류 개구리라는 명칭은...