GPT-6 아스트라 공개, 성능 평가와 이용 권한은 다른 이야기입니다

2026년 9월 7일 · 한국

오픈AI가 새 모델 GPT-6 아스트라를 발표하며 높은 성능 수치를 내놨습니다. 동시에 강력한 사이버보안 기능에는 별도의 이용 제한을 두겠다고 밝혔습니다. 공개됐다는 소식과 누구나 같은 기능을 쓸 수 있다는 말은 어디서 갈릴까요.

3줄 요약
1. GPT-6 아스트라는 9월 3일 공개됐습니다
2. 고급 사이버 기능은 접근을 제한합니다
3. 회사의 AGI 평가는 독립된 확정판정이 아닙니다

9월 3일 발표에서 먼저 읽을 구분

IT조선과 AI 매터스의 2026년 9월 4일 보도에 따르면 오픈AI는 현지시각 전날 GPT-6 아스트라를 공개했습니다. 회사는 컴퓨터를 조작하고 코딩과 과학 연구 작업을 수행하는 능력이 개선됐다고 설명했습니다. 발표 당시 공급은 일부 조직에서 먼저 시작하고 이후 이용 범위를 넓히는 방식으로 안내됐습니다. 따라서 이 글은 출시 당시 설명을 다루며, 9월 7일의 모든 계정별 제공 상태를 단정하지 않습니다.

이번 발표에는 평가에서 보인 능력, 출시 제품에 허용한 기능, 접근 가능한 이용자라는 세 층위가 함께 들어 있습니다. 능력 평가에서 어려운 작업을 수행했다고 해서 그 기능을 일반 계정에서 그대로 실행하도록 허용했다는 뜻은 아닙니다. 특히 사이버보안 분야에서는 이 구분이 제품 설명의 중요한 부분을 차지합니다.

짧은 답변에서 컴퓨터 작업으로

IT조선은 오픈AI 자체 평가인 OS월드 2.0에서 아스트라가 72.6%를 기록했다고 전했습니다. 비교 대상으로 제시된 GPT-5.6 솔은 65.7%였습니다. 해당 평가의 작업당 평균 소요시간은 75분에서 40분으로 줄었다고 소개됐습니다. 이는 특정 컴퓨터 조작 평가의 결과이며 모든 사용자의 업무가 그 비율만큼 단축된다는 뜻은 아닙니다.

회사 설명에 나온 작업에는 웹 양식 작성, 고객 정보 수정, 자료 조사, 문서와 스프레드시트 작성이 포함됩니다. 질문에 답을 붙이는 데 그치지 않고 화면과 프로그램을 오가며 결과물을 만드는 방향입니다. 글로벌이코노믹 역시 이 출시를 실제 전문 업무를 수행하는 기업용 AI 경쟁의 맥락에서 설명했습니다. 제품 성능에 관한 회사의 주장과 기업 현장에서 확인된 생산성은 구분해서 읽어야 합니다.

코딩 도구 코덱스에는 긴 작업에서 앞서 확인한 요구사항과 시험 결과를 다시 찾는 기능을 추가한다고 안내됐습니다. IT조선 보도 시점에는 실험 기능이며 향후 기본 적용할 계획이었습니다. 또한 API에서는 답변을 생성하는 중 이용자가 요구사항을 보태는 중간 개입 기능을 지원한다고 설명했습니다. 작업을 오래 맡기는 과정에서 이전 조건을 유지하고 새 요구를 전달하는 부분도 제품 개선에 포함된 것입니다.

사이버 능력이 높아져 생긴 제한

오픈AI는 아스트라가 자사의 위험 대비체계에서 사이버보안 Critical 단계에 도달한 첫 모델이라고 밝혔습니다. AI 매터스는 이를 회사가 모델의 위험 수준을 분류하는 내부 기준이라고 설명했습니다. 외부기관이 모든 이용 환경의 안전성을 인증했다는 표식으로 받아들여서는 안 됩니다. 강력한 기능 때문에 관리 수준을 달리한다는 설명에 가깝습니다.

회사는 평가 과정에서 알려지지 않은 취약점 두 건을 발견했으며, 이를 관련 유지관리자에게 알리고 있다고 밝혔습니다. 반면 실제 출시 버전은 안전한 코드 검토와 보안 패치를 지원하되, 공격 코드 작성과 같은 고급 작업은 거부하도록 설정됐다고 보도됐습니다. 평가용 조건에서의 능력과 제공 제품의 허용 범위가 같은 것은 아닙니다.

고급 보안 기능은 검증된 전문가가 참여하는 데이브레이크 프로그램을 통해 제한적으로 제공할 계획입니다. IT조선은 초기 제공 대상에 해당 프로그램 참여사 등 일부 기업이 포함된다고 전했습니다. 강한 능력을 발표하면서 접근 자격도 함께 설명한 이유가 여기에 있습니다. 이 기사에서 다루는 내용은 이용 범위와 통제 방식이며 취약점을 악용하는 절차가 아닙니다.

높은 시험 점수가 AGI 판정을 대신하지는 않습니다

오픈AI는 추상 추론 평가 ARC-AGI-3에서 99.9%, 고난도 수학 평가에서 97.6%를 제시했습니다. 높은 평가 결과와 함께 회사 경영진은 인공일반지능(AGI) 시대라는 표현도 사용했습니다. AGI는 넓은 범위의 지적 업무를 수행하는 인공지능을 가리키지만, 글로벌이코노믹은 업계에 통일된 기술적 기준이 없다고 짚었습니다.

따라서 시험 점수와 AGI라는 표현을 하나의 확정판정으로 붙일 수는 없습니다. IT조선도 해당 수치만으로 AGI 달성을 입증하지는 않는다고 설명했습니다. 신모델의 기능 향상은 개별 작업 평가로 살펴볼 수 있지만, 광범위한 지능을 달성했다는 주장은 더 넓은 논의에 속합니다.

통제 측면의 어려움도 함께 공개됐습니다. 오픈AI는 아스트라의 서술형 추론을 감시하기가 이전 모델보다 어려워졌다고 밝혔고, 추론 감시 능력을 충분히 확보하지 못하면 후속 모델의 성능 확대를 보류할 수 있다고 설명했습니다. 성능 개선과 내부 감시의 어려움을 같은 발표에서 언급한 셈입니다.

아스트라 출시는 컴퓨터 작업의 범위와 속도를 넓히려는 발표였습니다. 동시에 사이버 기능의 허용 범위와 이용 대상을 나누고, 감시의 어려움도 인정했습니다. 높은 점수만큼 실제 제공 조건을 함께 읽어야 이번 출시의 모습을 파악할 수 있습니다.

이 글은 생성형 AI를 활용해 자료를 정리하고 작성했습니다. 오류나 정정 요청은 [email protected]로 알려 주세요.