한국정보기술진흥원2026 제7회 청소년 IT경시대회 개최안내

OpenAI, 차세대 모델 'GPT-6 아스트라' 공개...컴퓨터 사용과 수학에서 최고 기록, 사이버 역량은 처음으로 '심각' 등급 도달

OpenAI가 GPT-6 아스트라를 공개했다.
gpt6_astra_대표이미지.png
자료: OpenAI
[한국정보기술신문] OpenAI가 새로운 최상위 인공지능(AI) 모델 'GPT-6 아스트라(GPT-6 Astra)'를 공개했다. 회사는 이 모델을 일부 조직에 먼저 제공한 뒤 며칠에 걸쳐 챗GPT 플러스, 프로, 비즈니스, 엔터프라이즈 이용자와 OpenAI API, 마이크로소프트 애저, 아마존웹서비스(AWS) 베드록으로 순차 확대한다고 밝혔다. OpenAI는 아스트라가 사전 학습과 강화 학습, 정렬 연구를 수년간 쌓아 올린 결과라고 설명했다. 정렬은 AI가 사람의 의도에서 벗어나지 않도록 행동을 맞추는 기술을 뜻한다.
OpenAI는 이번 발표에서 성능 수치보다 '실제 업무 수행 능력'을 앞세웠다. 아스트라는 사람이 마우스와 키보드로 하던 작업을 직접 처리하고, 문서와 스프레드시트, 발표자료를 만들며, 소프트웨어 취약점을 찾아내는 영역에서 이전 모델을 크게 앞섰다. 동시에 사이버 보안 역량이 OpenAI 자체 안전 기준의 최고 위험 단계에 처음으로 도달하면서 회사는 기능 확대와 함께 여러 겹의 통제 장치를 내놓았다.

컴퓨터를 직접 다루는 능력, 시간은 절반으로

OpenAI는 아스트라가 온라인 양식 작성, 고객관계관리(CRM) 시스템의 기록 갱신, 일정 관리 같은 반복 업무를 처리할 수 있다고 밝혔다. 웹에서 자료를 찾아 이메일이나 문서 편집기에서 요약본 초안을 쓰고, 과학 데이터를 분석해 그래프를 그리며, 직접 만든 웹사이트가 제대로 작동하는지 점검하는 일까지 맡을 수 있다는 설명이다.
수치로도 차이가 나타났다. 컴퓨터 조작 능력을 재는 평가인 'OSWorld 2.0' 지연 시간 모의실험에서 아스트라는 작업당 약 40분에 72.6%를 기록했다. 직전 모델인 GPT-5.6 솔은 약 75분에 65.7%였다. 작업당 걸리는 시간을 약 47% 줄이면서 정확도는 오히려 높인 셈이다. 화면 속 요소를 정확히 짚어내는 능력을 보는 '스크린스팟-프로'에서는 92.7%로 솔의 76.9%를 크게 웃돌았다. OpenAI는 코딩 도구 코덱스(Codex)의 실행 구조도 함께 개선해 실제 작업 완료 속도가 솔 대비 1.9배 빨라졌다고 밝혔다.

문서와 설계, 연구까지...전문 업무로 확장

아스트라는 기존 템플릿의 형식과 문체를 지키면서 발표자료와 문서, 스프레드시트를 만들 수 있도록 훈련됐다. OpenAI는 아스트라가 당면한 작업에 필요 없는 정보를 늘어놓지 않고 중요한 맥락만 결과물에 담도록 학습했다고 설명했다. 여러 각도에서 찍은 이미지를 보고 3차원 설계 코드를 만들어 내는 평가에서는 95.9%를 기록해 Sol을 앞섰다.
지시가 모호할 때의 행동도 달라졌다. OpenAI는 아스트라가 일상적인 정보 공백은 맥락으로 메우되, 답에 따라 결과가 크게 달라지는 대목에서는 되묻는다고 밝혔다. 코덱스에서는 이용자의 답을 기다리는 동안에도 다른 작업을 이어 갈 수 있다.
외부 기업들도 평가를 내놨다. 실라스 알베르티(Silas Alberti) 코그니션 리서치 부문 수석부사장은 "GPT-6 아스트라의 뛰어난 컴퓨터 사용과 글쓰기, 코드베이스 이해 능력 덕분에 도입 직후부터 테스트 과정이 개선됐다"고 밝혔다. 알렉스 마슈라보프(Alex Mashrabov) 힉스필드AI CEO는 "아스트라는 저희가 테스트한 다른 모델보다 토큰을 최대 20% 적게 쓰면서도 가장 복잡한 크리에이티브 작업을 완수한다"고 말했다.

80년 묵은 소수 문제 기록 경신

수학 분야에서는 실제 미해결 문제 진전에 기여한 사례가 공개됐다. OpenAI에 따르면 아스트라는 소수(素數) 사이 간격에 관한 두 가지 결과를 도출했다. 첫째는 아무리 큰 수로 나아가도 서로 가까이 붙어 있는 소수 쌍이 무한히 존재한다는 정리로, 10여 년간 그 간격의 한계값은 246이었고 최근 240으로 개선됐다. 아스트라는 이를 186까지 좁혔다. 둘째는 소수 사이가 유난히 크게 벌어지는 경우에 관한 것으로, 80년 넘게 바뀌지 않던 항을 개선했다. OpenAI는 두 결과의 증명과 검증 자료를 함께 공개했다.
난이도가 가장 높은 수학 평가인 '프런티어매스 4단계'에서는 97.6%로 솔의 83.0%를 크게 웃돌았고 대학원 수준 과학 추론을 재는 'GPQA 다이아몬드'에서는 96.0%를 기록했다. 그레그 캄라트(Greg Kamradt) ARC 프라이즈 재단 관계자는 추상 추론 평가 'ARC-AGI-3'에 대해 "아스트라는 전체 레벨의 96%에서 인간 행동 효율성 기준치를 넘어섰다"고 평가했다.

사이버 보안 역량, 처음으로 최고 위험 등급

샘_올트먼_오픈AI.png
OpenAI 최고경영자가 행사에서 발언하고 있다
가장 민감한 대목은 사이버 보안이다. OpenAI는 아스트라가 자사 대비 태세 프레임워크(Preparedness Framework)상 사이버 보안 부문에서 '심각(Critical)' 기준에 도달했다고 밝혔다. 알려진 취약점을 실제 공격 코드로 바꿔 내는지 보는 '익스플로잇벤치'에서 아스트라는 100%를 기록했다. 솔은 78.5%였다. 소스 코드 없이 프로그램의 동작 원리를 역으로 분석하는 'SRE-벤치'에서는 한 번에 88.0%, 네 번 안에 99.2%를 풀었다. 솔은 각각 55.9%와 68.7%였다.
평가 과정에서 아스트라는 알려지지 않은 취약점 두 건을 새로 찾아내 실제로 사용했다. OpenAI는 두 취약점 모두 해당 소프트웨어 관리자에게 알렸다고 밝혔다. 이런 능력은 방어자가 약점을 먼저 찾아 고치는 데 쓰일 수 있지만 공격에 악용될 여지도 함께 커진다.
이에 따라 OpenAI는 이번에 배포하는 아스트라가 보안 코드 검토와 패치 작업은 돕되, 개념 증명 공격 코드 제작처럼 더 높은 수준의 요청은 거부하도록 했다. 회사는 'OpenAI Daybreak' 프로그램을 통해 취약점 검증과 악성코드 분석 등으로 허용 범위를 몇 주에 걸쳐 넓힐 계획이라고 밝혔다.

"정렬 수준 가장 높다"...감시 가능성은 되레 낮아져

OpenAI는 아스트라를 자사 모델 가운데 정렬 수준이 가장 높은 모델로 소개했다. 부적절한 행동을 유도하도록 설계한 내부 안전성 평가에서 아스트라의 문제 발생 비율은 2.4%로, 솔의 22.0%보다 크게 낮았다. 코덱스의 자동 검토를 일부러 우회할 수 있게 설정한 실험에서도 아스트라는 한 번도 우회를 시도하지 않았다.
한국정보기술신문 인공지능분과 김현서 기자 news@kitpa.org

함께 읽으면 좋은 기사

과기정통부, HD현대삼호 조선소에 'AI 기지국' 깔아 용접·도장 로봇 실증...10일 영암 현장 점검, 4족보행 로봇이 작업 환경 스스로 인식해 용접

과기정통부, HD현대삼호 조선소에 'AI 기지국' 깔아 용접·도장 로봇 실증...10일 영암 현장 점검, 4족보행 로봇이 작업 환경 스스로 인식해 용접

인공지능 4
수컷 초파리 뇌 신경 16만6000개, 연결 전부 그렸다...구글·HHMI 제널리아 10년 협업, 시냅스 1억2500만 개 담은 역대 최대 뇌 지도 공개

수컷 초파리 뇌 신경 16만6000개, 연결 전부 그렸다...구글·HHMI 제널리아 10년 협업, 시냅스 1억2500만 개 담은 역대 최대 뇌 지도 공개

인공지능 4
엔비디아 "상용 로보택시 주요 사업, 모두 자사 플랫폼 위에서 돌아간다"...학습·모의실험·차량용 '세 대의 컴퓨터' 구조 공개, 우버 28개 도시·현대차기아도 협력

엔비디아 "상용 로보택시 주요 사업, 모두 자사 플랫폼 위에서 돌아간다"...학습·모의실험·차량용 '세 대의 컴퓨터' 구조 공개, 우버 28개 도시·현대차기아도 협력

인공지능 4
애플, 첫 폴더블 아이폰 '아이폰 듀오' 공개...펼치면 7.6인치·접으면 5.4인치 두 화면, 1999달러부터 10월 16일 예약 판매

애플, 첫 폴더블 아이폰 '아이폰 듀오' 공개...펼치면 7.6인치·접으면 5.4인치 두 화면, 1999달러부터 10월 16일 예약 판매

반도체 5
OpenAI, 차세대 모델 'GPT-6 아스트라' 공개...컴퓨터 사용과 수학에서 최고 기록, 사이버 역량은 처음으로 '심각' 등급 도달

OpenAI, 차세대 모델 'GPT-6 아스트라' 공개...컴퓨터 사용과 수학에서 최고 기록, 사이버 역량은 처음으로 '심각' 등급 도달

인공지능 3
홍익대 김주영, 성능 다른 기기도 함께 학습하는 연합학습 기법 개발해 대학생 IT논문경진대회 AI융합응용 금상...베이지안 사후분포로 중요한 부분 골라 학습, 저성능 기기도 참여하며 전체 성능 유지

홍익대 김주영, 성능 다른 기기도 함께 학습하는 연합학습 기법 개발해 대학생 IT논문경진대회 AI융합응용 금상...베이지안 사후분포로 중요한 부분 골라 학습, 저성능 기기도 참여하며 전체 성능 유지

인공지능 · 인터뷰 4
충남과학고 성지원, 변이에도 안 변하는 '바이러스 약점' 찾는 파이프라인 개발해 청소년 IT학술대회 대상...알려진 표적에 기대지 않고 서열만으로 치료 표적 후보 추천, 여러 ssRNA 바이러스로 확장 가능성 확인

충남과학고 성지원, 변이에도 안 변하는 '바이러스 약점' 찾는 파이프라인 개발해 청소년 IT학술대회 대상...알려진 표적에 기대지 않고 서열만으로 치료 표적 후보 추천, 여러 ssRNA 바이러스로 확장 가능성 확인

학제간융합 · 인공지능 · 인터뷰 4
고색고 최우석, 딥페이크 탐지 AI '99% 정확도'의 속뜻 파고들어 청소년 IT학술대회 대상...영상·음성 함께 쓴 모델이 영상만 쓴 모델보다 낫다는 증거 못 찾아, 높은 점수와 실제 관계 학습은 별개임을 통계로 확인

고색고 최우석, 딥페이크 탐지 AI '99% 정확도'의 속뜻 파고들어 청소년 IT학술대회 대상...영상·음성 함께 쓴 모델이 영상만 쓴 모델보다 낫다는 증거 못 찾아, 높은 점수와 실제 관계 학습은 별개임을 통계로 확인

인공지능 · 디지털인문학 · 인터뷰 4
대구한의대 조소혜·국민대 류서현, '취향 넓히는' 책 추천법으로 대학생 IT논문경진대회 디지털인문학 대상...작품을 정서·속도 등 여러 축으로 쪼개 '부분 전환 추천' 중간지대 제안, 읽는 순서 따라 추천 달라지는 방향의존성도 확인

대구한의대 조소혜·국민대 류서현, '취향 넓히는' 책 추천법으로 대학생 IT논문경진대회 디지털인문학 대상...작품을 정서·속도 등 여러 축으로 쪼개 '부분 전환 추천' 중간지대 제안, 읽는 순서 따라 추천 달라지는 방향의존성도 확인

디지털인문학 · 인터뷰 4
서울과학고 이승준, 양자컴퓨터로 '고차 포트폴리오' 최적화해 청소년 IT학술대회 금상...큐비트 4배·회로 깊이 161배 줄여 현재 기기서도 동작, 자원 줄이고도 고전 방식 대비 승률 51%

서울과학고 이승준, 양자컴퓨터로 '고차 포트폴리오' 최적화해 청소년 IT학술대회 금상...큐비트 4배·회로 깊이 161배 줄여 현재 기기서도 동작, 자원 줄이고도 고전 방식 대비 승률 51%

인공지능 · 정보기술 4
마케팅 전문가 세스 고딘 "아마존 검색광고는 소비자에게서 훔치는 것"...검색광고를 '아마존세'라 비판, "검색 품질 떨어뜨리고 비용은 결국 소비자 몫"

마케팅 전문가 세스 고딘 "아마존 검색광고는 소비자에게서 훔치는 것"...검색광고를 '아마존세'라 비판, "검색 품질 떨어뜨리고 비용은 결국 소비자 몫"

정보기술 3
SK하이닉스 CPO 기술 로드맵, 국제 학술지 '네이처 일렉트로닉스' 게재...AI 경쟁 무대 '칩에서 시스템으로'

SK하이닉스 CPO 기술 로드맵, 국제 학술지 '네이처 일렉트로닉스' 게재...AI 경쟁 무대 '칩에서 시스템으로'

반도체 2