인간 기만 성향 더 강해졌다…오픈AI, 아스트라 출시 취소

오현우 2026. 9. 30. 00:04
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

오픈AI가 안전성 문제를 이유로 신규 인공지능(AI) 모델 공개 계획을 전면 취소했다.

29일 월스트리트저널(WSJ) 등 외신에 따르면 오픈AI는 차세대 AI모델 ‘GPT-6.1 아스트라’가 내부 안전 테스트를 통과하지 못했다는 이유로 다음달 출시 계획을 철회했다. 오픈AI가 모델 자체의 안전성을 이유로 출시 계획을 취소한 건 이번이 처음이다. 2024년 오픈AI는 음성 생성 AI ‘보이스 엔진’을 공개하려 했지만, 음성 복제 등 오남용을 우려해 이를 철회한 바 있다.

오픈AI의 내부 평가 결과, 새 모델은 두 가지 영역에서 문제가 됐다. 우선 인간이 원하는 방식을 얼마나 잘 따르는지 측정하는 ‘정렬’(alignment) 평가에서 이전 모델보다 저조한 성적을 기록했다. 오히려 수행한 행동과 수행하지 않은 행동을 이용자에게 숨기는 기만 성향이 더 강해졌다.

또 ‘범위 권한’도 준수하지 않았다. 이용자 승인 없이 작업을 강행하거나, 안전하지 않은 외부 도구를 사용했다는 의미다. 성능 자체는 이전보다 개선됐다. 장문의 글을 작성하고 복잡한 과제를 푸는 일에 이전 모델보다 더 월등해졌다는 평가를 받았다.

사치 자인 오픈AI 안전 시스템 책임자는 WSJ에 “새 모델은 장애물에 직면했을 때 소극적으로 행동하는 ‘모델의 나태함(model laziness)’ 문제는 개선됐지만, 안전성과 정렬 기준을 충족하지 못해 출시하지 않기로 결정했다”고 설명했다.

향후 오픈AI는 AI 모델의 안전성을 강화하는 데 주력할 방침이다. AI 모델이 인간이 시키지 않은 작업을 수행하는 등 통제 불능에 대한 우려가 커지고 있어서다.

앞서 7월에는 오픈AI의 모델이 인간의 통제를 벗어나 개발자 플랫폼 허깅페이스를 해킹해 업계에 충격을 줬다. 또 지난 25일엔 오픈AI의 차기 프론티어 모델 후보 중 하나가 학습과정에서 인터넷 접속 차단을 풀고 제3자 네트워크에 접속한 사례가 발견되기도 했다. 오픈AI는 해당 모델 학습도 중단했다. 자인 책임자는 WJS에 “원인을 찾기 위해 AI 학습 내용을 단계별로 심층 조사한 뒤 차기 모델을 개발하겠다”고 말했다.

오현우 기자

Copyright © 중앙일보. 무단전재 및 재배포 금지.