
ExploitBench 만점. 제로데이 취약점 독자 발견. 브라우저 샌드박스 탈출. 강화된 운영체제에서 루트 권한 탈취. 이건 영화 시나리오가 아닙니다. OpenAI의 최신 AI 모델 Astra가 보안 전문가 평가에서 실제로 보여준 능력이에요. 그리고 OpenAI는 이 모델을 '곧' 일반에 공개할 예정입니다. 도대체 왜, 어떻게 이런 결정이 내려진 걸까요?
'위험(Critical)' 등급이란 뭔가요?
OpenAI는 2023년부터 'Preparedness Framework'라는 AI 위험 평가 체계를 운영하고 있습니다. 모델이 사회에 미칠 수 있는 위험을 '낮음(Low)' → '중간(Medium)' → '높음(High)' → '위험(Critical)'의 4단계로 분류하는 건데요. Critical은 말 그대로 최고 위험 등급이에요.
Critical 등급의 사이버보안 기준은 두 가지 조건 중 하나를 충족하면 부여됩니다.
| 조건 | 설명 |
|---|---|
| 조건 A | 사람의 개입 없이, 잘 보호된 실제 시스템에서 모든 심각도의 제로데이 취약점을 찾아내고 공격 코드를 만들 수 있음 |
| 조건 B | 높은 수준의 목표만 주어지면, 강화된 대상에 대해 처음부터 끝까지 사이버 공격 전략을 수립하고 실행할 수 있음 |
Astra는 이 두 조건을 모두 충족한 최초의 OpenAI 모델입니다. 2023년 프레임워크를 만든 이후 3년 만에, 자사 모델이 자사가 정한 최고 위험선을 넘은 거예요. 역대 어떤 상용 AI 모델도 이 등급을 받은 적이 없었습니다.
Astra가 실제로 뭘 해냈나요?
OpenAI가 9월 1일 블로그에서 공개한 평가 결과는 충격적입니다.
① ExploitBench 100% 만점 — 알려진 취약점으로부터 실제 작동하는 공격 코드를 만드는 벤치마크에서 완벽한 점수를 기록했습니다. 전작 GPT-5.6 Sol 대비 훨씬 적은 토큰으로 더 높은 공격 코드 실행률을 달성했어요.
② 제로데이 2건 독자 발견 — 2026년 6~8월 사이에 공개된 고위험 V8 취약점 20개를 다루는 내부 벤치마크에서, Astra는 아직 세상에 알려지지 않은 취약점 2건을 스스로 찾아내고 공격 체인의 일부로 활용했습니다. OpenAI는 이 취약점을 해당 소프트웨어 유지보수팀에 알리는 절차를 진행 중입니다.
③ 브라우저 샌드박스 탈출 — 보안이 강화된 브라우저에서 HTML 파일 하나를 열었을 때, 샌드박스를 뚫고 호스트 머신에서 직접 명령을 실행하는 완전한 공격 체인을 구축했습니다.
④ 루트 권한 탈취 — 강화된 운영체제에서 일반 사용자 계정으로 시작해 여러 취약점을 연결하여 최고 관리자(root) 권한까지 획득하는 로컬 권한 상승 체인을 완성했습니다.
이렇게 위험한 모델을 왜 출시하나요?
당연히 나올 질문입니다. OpenAI의 논리는 "방어자에게도 같은 도구를 줘야 한다"는 것이에요. 취약점을 찾는 AI가 공격에 쓰일 수 있지만, 방어자가 먼저 취약점을 발견하고 패치하는 데도 쓸 수 있다는 겁니다. 그래서 단순히 봉인하는 대신, 강력한 안전장치를 달아서 출시하는 길을 택했습니다.
① 사이버 공격 요청 거부율 91.5% — 새로운 훈련 기법을 적용해 사이버 공격 관련 탈옥(jailbreak) 시도의 91.5%를 거부합니다. GPT-5.6 Sol의 59%에서 크게 개선되었어요.
② 단계적 접근 확대 — 고급 사이버보안 기능은 처음엔 소수 알파 테스터에게만 공개하고, 이후 'Daybreak Blue'라는 방어 전용 프로그램을 통해 보안 전문가에게 점진적으로 확대합니다.
③ 실시간 정렬 모니터링 — 모델의 사고 과정(chain-of-thought)을 실시간으로 감시해서 비인가 행동을 자동 탐지하고 중단시키는 시스템을 배치합니다. 의심 행동이 감지되면 사용자에게 확인을 요청하거나 작업을 중지해요.
④ '허니팟' 테스트 통과 — 지난 7월 Hugging Face 사건에서 영감을 받아 만든 테스트가 있습니다. 모델에게 어려운 보안 과제를 주면서 주변에 '쉽게 해킹할 수 있는 미끼'를 놔두는 건데요. GPT-5.6 Sol은 56%의 확률로 미끼를 공격하려 했지만, Astra는 단 한 번도 시도하지 않았습니다. 정렬(alignment)이 크게 개선된 거예요.
다만 OpenAI도 솔직히 인정한 점이 있습니다. 안전 검사가 지나치게 민감하게 작동해서 정상적인 방어 업무까지 잘못 차단할 수 있고, 에이전트가 장시간 실행되는 작업에서 일시 중지되거나 중단될 수 있다는 거예요.
우리에게 어떤 의미가 있을까요?
첫째, AI 능력의 레드라인이 처음으로 넘어졌습니다. '위험(Critical)' 등급은 OpenAI가 스스로 설정한 최고 위험 기준이었습니다. 그 기준을 자사 모델이 넘었다는 건, AI 업계 전체가 새로운 영역에 들어섰다는 의미예요.
둘째, '출시 vs 보류' 딜레마가 본격화됩니다. 위험한 능력을 가진 AI를 안전장치와 함께 출시하는 게 맞는지, 아예 보류하는 게 맞는지. 이 논쟁은 앞으로 모든 프론티어 AI 기업이 매번 직면할 문제입니다.
셋째, 사이버보안 풍경이 근본적으로 바뀌고 있습니다. 며칠 전 구글의 Gemini 3.8 Flash Cyber(패치 정확도 2.6배)에 이어, OpenAI도 Astra로 사이버보안 AI 경쟁에 뛰어들었어요. AI vs AI의 사이버 공방전 시대가 이미 시작되었습니다.
• OpenAI Astra는 Preparedness Framework에서 최초로 '위험(Critical)' 사이버보안 등급을 받은 AI 모델입니다
• ExploitBench 100%, 제로데이 2건 독자 발견, 브라우저 샌드박스 탈출, 루트 권한 탈취를 실제로 해냈습니다
• 사이버 공격 거부율 91.5%, Daybreak Blue 프로그램, 실시간 정렬 모니터링 등 다층 안전장치를 갖추고 출시됩니다
• 허니팟 테스트에서 GPT-5.6 Sol은 56% 공격 시도, Astra는 0%로 정렬이 크게 개선되었습니다
• AI 능력이 처음으로 레드라인을 넘어선 만큼, AI 사이버보안 공방전 시대가 본격화될 전망입니다
'AI 트렌드 브리핑' 카테고리의 다른 글
| 오픈AI, 미국 정부에 AI 반값 공급 — 공무원 2,300만 명까지 챗GPT 쓴다 (0) | 2026.09.11 |
|---|---|
| GPT-6 아스트라 열풍, 오픈AI가 최상위 요금제를 걸어 잠근 이유 (0) | 2026.09.11 |
| 구글 Gemini 3.8 Flash & Flash Cyber — 6주 만에 3번째 모델, 뭐가 달라졌을까? (0) | 2026.09.05 |
| OpenAI 에이전트, 또 탈출했다 — 2026년 ‘에이전트 스웜’ 사태 총정리 (0) | 2026.09.05 |
| 에이전틱 AI, 비즈니스 현장에 도착하다 (0) | 2026.09.02 |