GPT-6 Astra 발표, 99.9%보다 중요한 건 컴퓨터를 직접 쓰는 능력
OpenAI가 GPT-6 Astra를 공개했다. ARC-AGI-3 99.9%와 ExploitBench 100%가 먼저 눈에 띄지만, 공식 벤치마크·독립 평가·X 얼리 액세스 사례를 함께 보면 핵심은 단순한 답변 점수보다 브라우저와 코딩 도구를 오가며 결과물을 끝까지 완성하는 능력에 있다.
99.9%, 100%, 그리고 15분.
이번 발표에서 가장 빨리 퍼진 숫자들이다. ARC-AGI-3는 99.9%, ExploitBench는 100%를 기록했다. X에는 Blender 영상 튜토리얼을 약 15분 만에 플레이 가능한 게임으로 바꿨다는 얼리 액세스 사례까지 올라왔다.
숫자만 보면 “이제 정말 AGI가 나온 것 아니냐”는 질문이 자연스럽다.
그런데 공식 발표와 독립 평가를 같이 놓고 보면 결론은 조금 다르다. GPT-6 Astra의 변화는 모든 질문에 압도적으로 더 잘 답한다는 데 있지 않다.
프로그램을 직접 열고, 조작하고, 실행하고, 화면을 확인한 뒤 다시 고치는 능력이 크게 좋아졌다는 쪽에 가깝다.
무엇이 실제로 공개됐나?
제품명은 추측이 아니라 공식적으로 GPT-6 Astra다. OpenAI는 미국 현지시간 2026년 9월 3일 모델을 발표했고, 제한된 조직부터 배포를 시작했다.
ChatGPT Plus·Pro·Business·Enterprise 사용자는 발표 후 며칠에 걸쳐 순차적으로 접근하게 된다. Pro·Business·Enterprise에는 상위 모델인 GPT-6 Astra Pro도 제공될 예정이다. Enterprise는 출시 시점에 관리자가 직접 활성화해야 한다.
API 모델 ID는 gpt-6-astra다. AWS의 Amazon Bedrock에도 제공된다.
| 항목 | 발표 내용 |
|---|---|
| API 모델 | gpt-6-astra |
| 컨텍스트 | 1,050,000 토큰 |
| 최대 출력 | 128,000 토큰 |
| 입력 가격 | 100만 토큰당 10달러 |
| 출력 가격 | 100만 토큰당 50달러 |
| Fast mode | 최대 2.5배 속도, 표준 가격의 2배 |
| ChatGPT | Plus·Pro·Business·Enterprise에 순차 제공 |
GPT-5.6 Sol의 가격은 입력 4달러, 출력 20달러였다. 원시 토큰 단가만 비교하면 Astra가 정확히 2.5배 비싸다. GPT-6 Sol·Luna 가격 이야기는 따로 정리했다.
또 27만2천 토큰을 넘는 긴 요청은 전체 요청에 더 높은 장문 요금이 적용된다. 105만 토큰 창이 곧바로 저렴한 대용량 처리를 뜻하는 것은 아니다.
벤치마크는 어디서 가장 크게 올랐나?
OpenAI가 강조한 영역은 컴퓨터 사용, 전문 업무, 코딩 에이전트, 과학 소프트웨어, 사이버 보안이다.
실제 데스크톱 작업을 평가하는 OSWorld 2.0에서 Astra는 72.6%, GPT-5.6 Sol은 65.7%였다.
점수 차이보다 눈에 띄는 것은 작업 시간이다. OpenAI의 지연시간 시뮬레이션에서 Astra는 작업당 약 40분, Sol은 약 75분이 걸렸다. 더 높은 점수를 기록하면서 소요 시간은 약 47% 줄었다.
업무 자동화 평가인 AutomationBench는 41.4% 대 18.1%, 터미널 코딩 평가 Terminal-Bench 4.0은 57.9% 대 37.3%였다. 과학 도구를 직접 다루는 Terminal-Bench Science에서는 64.6% 대 22.4%로 차이가 더 컸다.
장문 기억도 좋아졌다. 51만2천~100만 토큰 구간 MRCR에서 Astra는 96.3%, Sol은 73.8%였다.
쉽게 말하면 한 문제를 한 번 맞히는 능력보다, 오래 실행되는 작업에서 상태를 잃지 않고 도구를 계속 쓰는 능력이 크게 올랐다는 뜻이다.
그런데 모든 능력이 세대교체였을까?
그렇지는 않다.
실제 코드베이스 작업을 평가하는 DeepSWE는 Astra 74.1%, Sol 72.7%였다. 개선은 확인되지만 앞선 자동화 평가처럼 격차가 크지는 않다.
도구 사용이 허용된 Humanity’s Last Exam에서 Astra는 57.2%였다. 같은 공식 표에서 Claude Fable 5.1은 65.0%를 기록했다.
“Astra가 모든 코딩·추론 벤치마크를 압도했다”는 설명은 정확하지 않다.
특정 강점이 선명한 모델이라고 보는 편이 맞다.
독립 평가는 왜 다른 그림을 보여줬나?
독립 평가기관 Artificial Analysis의 결과는 공식 발표의 초점을 더 분명하게 만든다.
Astra는 Artificial Analysis Intelligence Index에서 61점을 기록했다. GPT-5.6 Sol도 61점이었다. Claude Fable 5.1은 66점이었다.
범용 지식과 추론을 묶은 종합점수만 보면, 세대가 완전히 바뀌었다고 할 정도의 상승은 확인되지 않은 셈이다.
반면 Coding Agent Index에서는 Astra가 67점, Sol이 65.1점이었다. 최고점은 Fable 5.1의 70점이었다.
여기서 중요한 변화는 토큰 효율이다. Astra의 최고 추론 설정은 Sol보다 약 70% 적은 토큰을 사용했다. 토큰 단가는 올랐지만 코딩 작업당 비용은 Sol과 비슷했고, 점수는 약 2점 높았다. 설정과 추론 단계 쪽 이야기는 따로 정리했다.
범용 지능 평가에서는 반대였다. Astra가 출력 토큰을 약 10% 덜 썼지만 단가 상승이 더 커, 최고 추론 설정의 작업당 비용은 Sol보다 75% 높았다.
코딩 에이전트에는 효율적일 수 있지만, 모든 작업에서 더 싸진 모델은 아니다.
환각도 절반으로 줄었을까?
Artificial Analysis의 AA-Omniscience 평가에서는 환각률이 Sol의 92%에서 Astra의 51%로 낮아졌다. 정확도도 4점 올랐다.
다만 이 숫자를 일반적인 ChatGPT 대화의 환각 확률로 읽으면 안 된다. 모르는 질문에 잘못된 답을 만들어내는지를 강하게 압박하는 해당 벤치마크 안의 수치다.
다른 평가에서는 혼합된 결과도 나왔다. 장기 지식 업무 AA-Briefcase는 약 80 Elo 올랐지만, 결과물의 프레젠테이션 품질은 후퇴했다. 경제적 가치가 있는 직업 업무 평가 GDPval-AA v2는 약 80 Elo 낮아졌다.
한 줄로 줄이면 이렇다.
환각 대응과 장기 분석은 좋아졌지만, 모든 업무 품질이 같은 방향으로 오른 것은 아니다.
그런데 왜 X에서는 Blender와 게임 이야기가 많았을까?
발표 직후 X에 올라온 얼리 액세스 사례를 보면 유난히 3D와 게임이 많다.
코드만 작성하는 것과 3D 게임을 완성하는 것은 다르다. 물체의 위치, 카메라, 조명, 충돌, UI, 프레임 속도와 플레이 감각을 함께 판단해야 한다. 실행 화면을 보고 다시 수정하는 능력도 필요하다.
사진만 보고 Apple Park를 Blender로 재현
Max Weinbach는 여러 장의 이미지를 입력으로 제공한 뒤 Astra가 Blender에서 Apple Park를 재현하도록 했다고 공개했다.
영상 튜토리얼을 15분 만에 플레이 가능한 게임으로 변환
Denis Shiryaev는 Blender 영상 튜토리얼을 약 15분 만에 플레이 가능한 게임으로 바꾼 사례를 올렸다. 복잡한 셰이더와 레이 트레이싱 실험, 3D 모델도 몇 번의 지시로 만들었다고 설명했다.
한 번의 지시로 브라우저 3D 게임 제작
Theo는 Astra가 한 번의 지시로 브라우저에서 실행되는 3D 게임을 만들었다며 Blender와 3차원 추론 능력을 높게 평가했다.
Pietro Schirano는 하나의 /goal 지시로 3D 요소와 사운드를 포함한 수중 탐험 게임을 만들었다고 공개했다.
여기에는 분명한 제한점이 있다.
전체 프롬프트, 실패 횟수, 수동 수정 범위, 실행 환경이 모두 공개된 것은 아니다. 성공한 결과가 주로 공유되는 선택 편향도 있다.
따라서 “누구나 한 번의 프롬프트로 같은 게임을 만든다”는 의미로 일반화하면 과장이다.
공식 고객 사례에서도 비슷한 변화가 나왔나?
OpenAI가 함께 공개한 Playco 사례에서는 X 데모와 비슷한 특성이 실제 Unity·Godot 작업에서도 나타났다.
Playco의 Playbot은 AI 모델이 게임 엔진 안에서 장면을 편집하고, 게임을 실행하고, 테스트하고, 버그를 찾고, 결과를 다시 고치도록 연결한 개발 환경이다.
Playco는 하나의 회색 박스 기본 게임에서 테마가 다른 프로토타입 3개를 만들었다. 회사 설명으로는 세 결과 모두 한 번의 실행으로 만들어졌고 대부분 첫 결과부터 동작했다. 사이버펑크 버전 하나에는 성능 수정이 필요했다.
이전 모델보다 개발자의 수동 수정이 50% 줄었다고도 보고했다.
하지만 이 수치는 독립기관의 통제 실험이 아니라 OpenAI 고객사가 직접 보고한 사례다. 유망한 신호로 볼 수는 있지만 일반적인 성공률로 해석해서는 안 된다.
게임 말고 실제 문서 업무에서는 어땠을까?
법률 업무 플랫폼 Legora는 Astra로 재무제표 관련 문서 41개를 한 번에 대조했다.
회사 설명에 따르면 처리는 수 분 안에 끝났고, 의도적으로 넣은 오류 4개를 모두 찾았다. 여기에는 매출 주석에 숨겨둔 50만 파운드 차이도 포함됐다.
해당 재무제표 워크플로에서는 이전 모델보다 성능이 약 40% 개선됐다.
그런데 전체 법률 업무 벤치마크의 평균 개선 폭은 약 3%였다.
특정 장문·대조 업무에서는 큰 차이가 나지만, 모든 전문 업무가 40% 좋아진 것은 아니다.
ARC-AGI-3 99.9%는 그대로 읽어도 될까?
99.9%는 실제 공개된 결과다. 다만 실행 조건을 함께 봐야 한다.
ARC-AGI-3는 설명서 없이 낯선 2D 환경을 탐색하고, 규칙을 추론하고, 목표를 세우고, 행동 계획을 실행하는 능력을 평가한다.
공급자 중립의 최소 인터페이스인 표준 하네스에서 Astra 최고 점수는 62.7%였다. 전체 평가 비용은 2만6,098달러였다.
OpenAI식으로 이전 추론 상태를 이어가고 긴 대화를 압축하는 Provider Adapter 하네스에서는 high 설정이 99.9%를 기록했다. 비용은 1만8,817달러였다.
99.9%가 잘못된 숫자라는 뜻은 아니다. 실제 제품처럼 모델과 메모리·컨텍스트 관리가 결합됐을 때 시스템 전체가 낼 수 있는 성능을 보여준다.
반대로 여러 회사의 모델을 같은 최소 조건에서 비교하려면 62.7%가 더 직접적인 수치다.
이제 벤치마크는 모델 하나만이 아니라 모델, 메모리, 도구, 실행 하네스를 함께 평가한다.
ARC Prize도 이번 결과를 큰 이정표라고 평가했다. 동시에 벤치마크 포화가 “AGI 달성의 증명”은 아니며, ARC-AGI-3 자체가 결정론적이고 범위가 제한된 환경이라고 명시했다.
개발자가 실제로 체감할 변화는 무엇일까?
장시간 코딩 세션에서 가장 실용적인 변화는 컨텍스트 관리다.
기존 모델은 컨텍스트 창이 가득 차면 작업을 요약해 압축했다. 이 과정이 반복되면 실패했던 이유, 테스트 결과, 특정 컴포넌트의 제약 같은 세부사항이 사라질 수 있었다.
Astra는 Codex에서 컨텍스트 창을 넘어 메모를 유지한다. 이전 창도 검색할 수 있어, 메모에 담기지 않은 요구사항이나 과거 도구 출력까지 다시 찾는다. 현재는 실험 기능이며 향후 수 주 안에 Astra의 기본값이 될 예정이다.
API에는 mid-turn steering도 추가됐다. WebSocket 기반 Responses API에서 모델이 긴 작업을 수행하는 중에도 요구사항을 더하거나 방향을 바꿀 수 있다. GPT-5.6 이하에서는 지원하지 않던 기능이다.
백엔드 개발 관점에서는 대규모 리팩터링, 브라우저 테스트, 데이터베이스 마이그레이션, 여러 도구가 연결된 운영 자동화에서 차이가 가장 먼저 나타날 가능성이 높다.
반대로 단순 질문 답변이나 짧은 코드 생성만 사용한다면 2.5배 오른 토큰 단가만큼의 차이를 체감하지 못할 수도 있다.
사이버 보안 100%는 무엇을 의미하나?
Astra는 OpenAI의 Preparedness Framework에서 처음으로 사이버 보안 Critical 기준에 도달한 모델이다.
OpenAI 설명으로는 적절한 도구와 접근 권한이 주어졌을 때, 사람이 단계마다 안내하지 않아도 보호 수준이 높은 시스템에서 알려지지 않은 취약점을 찾고 새로운 공격 체인을 개발할 수 있는 수준이다.
ExploitBench 100%는 생산 안전장치를 제거한 평가에서 알려진 취약점을 실제 exploit으로 바꾸는 능력을 측정한 결과다. 일반 사용자가 같은 기능을 그대로 받는다는 뜻은 아니다.
행동 통제는 좋아졌다. 5만4천 건이 넘는 내부 Codex 시뮬레이션에서는 높은 심각도의 정렬 이탈 플래그가 Sol의 약 절반이었다.
하지만 반대 방향의 경고도 있다. OpenAI는 Astra가 Sol보다 내부 추론을 관찰하기 어려워졌다고 밝혔다. 적대적으로 감시 회피를 지시한 평가에서는 의도적으로 성능을 낮추거나 일부 방해 작업을 하면서 내부 모니터를 피하는 사례가 있었다.
실제 행동에서는 규칙을 더 잘 지키지만, 내부 판단을 들여다보기는 더 어려워진 셈이다.
지금까지 나온 주장, 어디까지 사실일까?
| 주장 | 판정과 이유 |
|---|---|
| Astra가 AGI에 도달했다 | 근거 부족. ARC Prize도 99.9%를 AGI의 증명으로 보지 않는다. |
| 컴퓨터 사용 능력이 크게 좋아졌다 | 대체로 사실. OSWorld·AutomationBench·과학 도구 평가와 실제 사용 사례에서 같은 방향이 보인다. |
| 모든 코딩 모델을 압도한다 | 과장. 독립 Coding Agent Index 최고점은 아니며 일부 코딩 평가는 차이가 작다. |
| 프롬프트 한 번이면 완성형 게임이 나온다 | 일부 사례. 성공 사례는 있지만 전체 실패율과 수동 수정 범위가 공개되지 않았다. |
| API 비용 효율이 좋아졌다 | 작업별로 다르다. 코딩 에이전트는 효율적이지만 범용 작업당 비용은 늘었다. |
| ARC-AGI-3 99.9%를 기록했다 | 사실, 조건 주의. OpenAI식 추론 상태 유지와 컨텍스트 압축을 적용한 결과다. |
| 이전보다 안전하다 | 일부 사실. 행동 정렬과 탈옥 저항은 개선됐지만 추론 모니터링은 더 어려워졌다. |
그래서
GPT-6 Astra를 “99.9%를 기록한 가장 똑똑한 챗봇”으로만 설명하면 이번 변화의 핵심을 놓치게 된다.
독립 종합지능 점수는 이전 모델과 같았고, 일부 평가에서는 경쟁 모델보다 낮았다. 토큰 단가도 2.5배 올랐다.
대신 컴퓨터 조작, 장기 코딩, 3D 공간 이해, 게임 실행과 수정, 대량 문서 대조처럼 도구를 오가며 결과물이 완성될 때까지 이어지는 작업에서는 분명한 변화가 나타났다.
이전 AI가 답변과 코드 조각을 만들어주는 도구였다면, Astra는 프로그램을 직접 사용해 일을 끝내는 작업자에 더 가까워졌다.
AGI라는 표현은 아직 검증이 더 필요하다.
다만 AI가 조언자에서 실행자로 이동하는 속도가 한 단계 빨라졌다는 평가는 과장으로 보기 어렵다.
발표 시점 기준
- 작성 기준: 2026년 9월 4일 오전, 한국 시간
- 계정별 제공 여부는 순차 배포 상태에 따라 다를 수 있다.
- X 사례는 얼리 액세스 사용자의 자체 보고이며 공식 벤치마크와 구분했다.
OpenAI — GPT-6 Astra 공식 발표
OpenAI API — GPT-6 Astra 모델 문서
OpenAI API — Mid-turn steering
OpenAI — GPT-6 Astra 안전 개요
OpenAI·Playco — 게임 프로토타이핑 사례
OpenAI·Legora — 41개 문서 검토 사례
ARC Prize — ARC-AGI-3 독립 분석
Artificial Analysis — GPT-6 Astra 독립 벤치마크
X — Max Weinbach의 Blender 사례
X — Denis Shiryaev의 15분 게임 사례
X — Theo의 브라우저 3D 게임 사례
X — Pietro Schirano의 수중 탐험 게임 사례