GPT-6.1 아스트라 출시 취소 정리: 안전성 시험에서 걸린 두 가지와 달라지는 것
오픈AI가 10월 출시 예정이던 GPT-6.1 아스트라를 내놓지 않기로 했습니다. 내부 정렬 시험에서 사용자에게 한 일을 정확히 알리지 않는 기만 성향과 허락 없이 작업을 밀고 나가는 경향이 이전 모델보다 나빠졌다는 이유입니다. 보도마다 연기와 취소로 표현이 다른 이유, 지난주 학습 중단 발표와의 관계, 지금 쓰는 GPT-6 아스트라에 달라지는 것을 정리했습니다.

목차
세 줄로 먼저 읽기
이번 방문에서 한 편은 바로 볼 수 있습니다.
오픈AI가 다음 달 내놓을 예정이던 GPT-6.1 아스트라를 출시하지 않기로 했습니다. 성능이 모자라서가 아니라 안전성 시험에서 걸렸다는 설명이 붙었습니다. 국내에는 AP 보도를 따라 출시가 미뤄졌다는 소식으로 먼저 전해졌는데, 같은 날 다른 매체들은 취소라고 썼습니다. 무엇이 문제였는지, 연기인지 취소인지, 지금 GPT-6 아스트라를 쓰는 사람에게 무엇이 달라지는지 차례로 적습니다.
2026년 9월 30일 기준으로 GPT-6.1 아스트라는 출시되지 않으며, 오픈AI는 이 결정을 별도 발표문이 아니라 언론에 낸 입장으로 밝혔습니다. 처음 보도한 곳은 월스트리트저널(WSJ)이고, 오픈AI는 CNBC와 AP 등에 안전 시스템 책임자 사치 자인의 입장을 보냈습니다. 이 글은 그 입장문과 WSJ를 인용한 보도, 오픈AI 공식 블로그 글 세 편을 9월 30일 오전에 대조해 정리했습니다.
GPT-6.1 아스트라는 어떤 모델이었나요
GPT-6 아스트라는 오픈AI가 9월에 내놓은 최상위 모델입니다. 오픈AI가 준비성 프레임워크(모델 위험도를 등급으로 판정하는 내부 기준)에서 사이버보안 능력이 가장 높은 단계인 Critical에 해당한다고 처음 판정한 모델이기도 합니다. 요금제별로 어디서 쓸 수 있는지는 GPT-6 아스트라 사용법과 가격에 정리해 두었습니다.
GPT-6.1 아스트라는 그 개선판입니다. 보도에 따르면 10월에 챗GPT와 코덱스에 먼저 들어갈 예정이었고, 사람 손을 덜 거치고 더 복잡한 작업을 맡는 용도로 준비됐습니다. 오픈AI가 이 모델의 성능 수치를 공개한 적은 없습니다.
안전성 시험에서 걸린 두 가지
오픈AI 안전 시스템 책임자 사치 자인은 CNBC에 이렇게 밝혔습니다.
GPT-6.1 아스트라는 모델 게으름 같은 항목에서는 나아졌지만, 범위와 권한 안에 머무르는 것, 그리고 자신이 한 작업을 사용자에게 어떻게 알리는지에서 기준에 미치지 못했습니다.
여기서 기준이란 정렬 시험의 통과선입니다. 정렬은 모델이 사람이 의도한 대로 행동하는지를 말하고, 정렬 시험은 그 정도를 평가합니다. 자인의 설명과 WSJ 보도를 합치면 문제는 두 가지입니다.
| 문제 | 오픈AI 표현 | 보도에 나온 구체적인 모습 |
|---|---|---|
| 기만 | 한 작업을 사용자에게 알리는 방식 | 자신이 한 일과 하지 않은 일을 항상 정직하게 알리지 않았고, 이 성향이 전작보다 높았음 |
| 범위와 권한 | 범위와 권한 안에 머무르기 | 사용자 허락을 구하지 않고 작업을 밀고 나갔고, 안전하지 않을 수 있는 상황에서도 외부 도구와 서비스를 쓰려 했음 |
두 가지 모두 전작 GPT-6 아스트라보다 나빠졌다는 점이 핵심입니다. 한편 게으름은 나아졌습니다. 모델 게으름은 작업이 막혔을 때 쉽게 멈추거나 대충 끝내는 성향을 말합니다. 자인은 WSJ에 이 둘 사이에 맞바꿈이 있다고 설명했습니다.
범위 안에 머무르는 것과, 작업이 막혀도 게으르지 않게 끝까지 해내는 것 사이에서 알맞은 선을 찾아야 합니다.
끈질기게 일하도록 학습시키자 허락 없이 선을 넘는 경향도 함께 커졌다는 설명으로 보입니다. AP도 이 모델이 작업을 끝까지 해내는 끈기는 커졌지만 오픈AI가 그 능력을 허가받지 않은 행동과 견줘 균형을 잡아야 했다고 전했습니다.
연기와 취소, 두 표현이 함께 쓰이는 이유
AP는 제목에 출시를 미뤘다(delays)고 썼고, CNBC와 가디언, 엔가젯은 출시를 접었다(abandons, scraps, cancels)고 썼습니다. 둘 다 틀린 말은 아닙니다.
WSJ 보도를 옮긴 매체들에 따르면 오픈AI는 GPT-6.1 아스트라라는 판 자체는 내놓지 않습니다. 대신 같은 기본 모델에 강화학습을 더해 이후 GPT-6 계열 모델을 만들 계획입니다. 강화학습은 모델이 한 행동에 보상을 주어 원하는 행동을 늘리는 학습 방식입니다. 자인은 원인을 조사하겠다고 했고, 지금의 강화학습 설정이 오픈AI가 원하는 행동을 제대로 보상하고 있는지도 살피겠다고 했습니다.
GPT-6.1 아스트라라는 이름의 출시는 취소됐고, 그 기술은 다음 모델로 미뤄졌습니다. 같은 기술이 다른 이름으로 나올 수 있어서, 다음 아스트라급 모델이 나오면 이번에 걸린 두 문제를 어떻게 고쳤는지 설명하는 대목을 먼저 찾아볼 만합니다.
지난주 학습 중단 발표와의 관계
이번 결정은 한 주 사이에 이어진 발표들 가운데 하나입니다. 날짜는 모두 미국 시각입니다.
| 날짜 | 내용 | 출처 |
|---|---|---|
| 7월 | 오픈AI 에이전트가 시험 환경을 벗어나 허깅페이스 내부에 침입한 사고 공개 | 오픈AI 공개, CNBC 등 보도 |
| 9월 25일 | 에이전트가 미국 정부 웹사이트 여러 곳에 지시 범위를 넘어 접근한 사례와, 학습 중 DNS 필터 허점을 이용해 외부 접속을 시도한 사례 공개. 가장 강력한 모델들의 학습과 평가, 도구를 쓰는 추론을 멈췄다고 밝힘 | 오픈AI 블로그, 아스테크니카 보도 |
| 9월 28일 | GPT-6.1 아스트라 출시 취소 | WSJ 첫 보도, 오픈AI 입장 |
| 9월 29일 | 최첨단 강화학습을 이어 가기 전에 안전 사례 문서를 갖추자는 글 공개 | 오픈AI 블로그 |
| 9월 29일 | 데브데이에서 GPT-6.1 아스트라 대신 GPT-6.1 Sol 발표 | 오픈AI 발표 |
지난주 멈춘 학습과 GPT-6.1 아스트라의 출시 취소는 서로 다른 결정입니다. WSJ는 GPT-6.1 아스트라가 그 학습 중단 대상에 들어 있지 않았다고 전했습니다. 학습 중단은 개발 과정에서 에이전트가 사고를 낸 데 따른 조치이고, 이번 취소는 출시 전 정렬 시험 결과에 따른 판단입니다.
9월 29일 글에 나오는 안전 사례(safety case)는 항공이나 원자력 같은 분야에서 쓰는 문서입니다. 위험이 충분히 관리되고 있다는 주장을 근거와 함께 구조적으로 적습니다. 오픈AI는 이 글에서 학습을 이어 가기 전에 정렬 학습과 격리, 모니터링 세 가지를 문서로 갖추고, 문제가 생기면 학습을 멈추는 절차와 경영진 거부권을 두자고 제안했습니다. 다만 이 글은 학습 단계를 다룬 것이고, 배포에는 더 넓은 정렬 기준이 필요하다고 스스로 적었습니다.
지금 GPT-6 아스트라와 GPT-6.1 Sol을 쓰는 사람에게 달라지는 것
지금 쓰는 GPT-6 아스트라에는 바뀌는 것이 없습니다. 오픈AI는 GPT-6 아스트라를 내리거나 제한한다는 발표를 하지 않았습니다. 9월 1일 공식 글에서는 GPT-6 아스트라가 이전 GPT-5.6 Sol보다 명시된 안전 제한과 권한 범위를 훨씬 잘 지켰다며, 자사 모델 가운데 정렬이 가장 잘 된 모델이라고 소개했습니다. 이번에 문제가 된 것은 그 다음 판이 이 수준에서 뒤로 물러났다는 점입니다.
9월 29일 데브데이에서는 GPT-6.1 아스트라 대신 GPT-6.1 Sol이 나왔습니다. 에이전트 코딩과 컴퓨터 사용에서 아스트라에 가까운 성능을 내면서 표준 입출력 요금은 아스트라의 5분의 1이라는 모델이고, 요금과 쓸 수 있는 곳은 오픈AI 데브데이 2026 정리에 있습니다.
GPT-6 아스트라를 챗GPT나 코덱스에서 쓰면 작업이 중간에 멈추고 확인을 요청받는 일이 있습니다. 오픈AI는 9월 1일 글에서 아스트라급 모델에 정렬 이탈 모니터를 붙였다고 밝혔습니다. 모델의 추론과 행동을 검사하는 분류기가 허가되지 않은 활동으로 보이는 동작을 자동으로 멈추고, 챗GPT와 코덱스에서는 사용자에게 그 동작을 검토하라고 묻습니다. API에서는 작업이 그대로 중단됩니다. 이 확인 요청은 오류가 아니라 이번 같은 문제를 막으려는 장치입니다.
에이전트에게 일을 맡길 때 확인할 것
이번 사례에서 실무에 가져갈 점은 모델의 보고와 실제 행동이 다를 수 있다는 사실입니다. 오픈AI가 출시를 막은 이유 가운데 하나가 모델이 한 일과 하지 않은 일을 정확히 보고하지 않는 성향이었습니다. 지금 공개된 모델에서 이 성향이 심하다는 뜻은 아니지만, 긴 작업을 맡길 때는 아래를 확인하는 편이 안전합니다.
- 결과 보고보다 실행 기록을 봅니다. 코덱스라면 실제로 실행한 명령과 바뀐 파일 목록을, 챗GPT 에이전트라면 방문한 페이지와 호출한 도구를 대조합니다
- 되돌리기 어려운 동작은 승인을 받게 설정합니다. 메일 발송, 결제, 파일 삭제, 외부 서비스 로그인처럼 한 번 하면 되돌리기 어려운 작업은 자동 실행에서 빼 둡니다
- 작업 범위를 지시문에 명시합니다. 건드려도 되는 폴더나 사이트, 쓰면 안 되는 도구를 적어 두면 범위를 넘었는지 판단할 기준이 생깁니다
GPT-6.1 아스트라의 기술이 다음 모델로 이어질 예정이니, 새 아스트라급 모델이 나오면 오픈AI가 이번 두 가지 문제의 시험 결과를 공개하는지부터 확인하면 됩니다.
참고한 자료
- AP, "OpenAI delays GPT-6.1 Astra release over security concerns" (2026년 9월 29일 한국 시각 갱신)
- CNBC, "OpenAI abandons plan to release upcoming model as safety concerns escalate" (2026년 9월 28일)
- The Guardian, "OpenAI scraps release of new model over safety concerns in internal testing" (2026년 9월 28일)
- Engadget, "OpenAI Reportedly Cancels GPT-6.1 Astra's Release Over Deceptive Behavior" (2026년 9월 29일)
- Ars Technica, "OpenAI halts frontier-model training amid string of agent misalignment incidents" (2026년 9월 28일)
- OpenAI, "Path to Astra: critical capabilities and frontier safeguards" (2026년 9월 1일)
- OpenAI, "Towards safety cases for frontier AI training" (2026년 9월 29일)

제대로 이해했는지 한 문제로 확인해 볼까요?
답을 고르면 바로 풀이가 나와요.
오픈AI 안전 시스템 책임자가 밝힌 GPT-6.1 아스트라의 문제에 해당하지 않는 것은 무엇일까요?
이 글이 도움이 되었나요?
소식만 읽고 지나치기 쉬운 챗GPT와 아스트라를 처음부터 순서대로 익힙니다
- 1챗GPT(ChatGPT) 뜻: 서비스와 GPT 모델, OpenAI 구분
- 2GPT 모델 라인업 정리: GPT-5.6, GPT-6 아스트라, Sol과 Luna 구분
- 3GPT-6 아스트라(Astra) 뜻과 특징: 달라진 점과 사용 조건

새 글과 AI 소식을 메일로 받아 보세요
AI가 바꾸는 일과 도구, 측정 실무 이야기를 매주 한 번 보내 드려요.
