인간 기만 성향 더 강해졌다…오픈AI, 아스트라 출시 취소
오픈AI가 안전성 문제를 이유로 신규 인공지능(AI) 모델 공개 계획을 전면 취소했다.
29일 월스트리트저널(WSJ) 등 외신에 따르면 오픈AI는 차세대 AI모델 ‘GPT-6.1 아스트라’가 내부 안전 테스트를 통과하지 못했다는 이유로 다음달 출시 계획을 철회했다. 오픈AI가 모델 자체의 안전성을 이유로 출시 계획을 취소한 건 이번이 처음이다. 2024년 오픈AI는 음성 생성 AI ‘보이스 엔진’을 공개하려 했지만, 음성 복제 등 오남용을 우려해 이를 철회한 바 있다.
오픈AI의 내부 평가 결과, 새 모델은 두 가지 영역에서 문제가 됐다. 우선 인간이 원하는 방식을 얼마나 잘 따르는지 측정하는 ‘정렬’(alignment) 평가에서 이전 모델보다 저조한 성적을 기록했다. 오히려 수행한 행동과 수행하지 않은 행동을 이용자에게 숨기는 기만 성향이 더 강해졌다.
또 ‘범위 권한’도 준수하지 않았다. 이용자 승인 없이 작업을 강행하거나, 안전하지 않은 외부 도구를 사용했다는 의미다. 성능 자체는 이전보다 개선됐다. 장문의 글을 작성하고 복잡한 과제를 푸는 일에 이전 모델보다 더 월등해졌다는 평가를 받았다.
사치 자인 오픈AI 안전 시스템 책임자는 WSJ에 “새 모델은 장애물에 직면했을 때 소극적으로 행동하는 ‘모델의 나태함(model laziness)’ 문제는 개선됐지만, 안전성과 정렬 기준을 충족하지 못해 출시하지 않기로 결정했다”고 설명했다.
향후 오픈AI는 AI 모델의 안전성을 강화하는 데 주력할 방침이다. AI 모델이 인간이 시키지 않은 작업을 수행하는 등 통제 불능에 대한 우려가 커지고 있어서다.
앞서 7월에는 오픈AI의 모델이 인간의 통제를 벗어나 개발자 플랫폼 허깅페이스를 해킹해 업계에 충격을 줬다. 또 지난 25일엔 오픈AI의 차기 프론티어 모델 후보 중 하나가 학습과정에서 인터넷 접속 차단을 풀고 제3자 네트워크에 접속한 사례가 발견되기도 했다. 오픈AI는 해당 모델 학습도 중단했다. 자인 책임자는 WJS에 “원인을 찾기 위해 AI 학습 내용을 단계별로 심층 조사한 뒤 차기 모델을 개발하겠다”고 말했다.
오현우 기자
Copyright © 중앙일보. 무단전재 및 재배포 금지.
- “내연녀 2명은 놔둬요” 아내가 미행한 ‘마이바흐 20대 여성’ 정체 | 중앙일보
- 의사조차 “처음 본다”…말기암 10개월 만에 싹 사라진 비결 | 중앙일보
- 1년만에 9000만→1.8억 됐다…강남 부자들 꽂힌 절세 ETF | 중앙일보
- 옷 벗겨진 여성 시신 또 나왔다…“벌써 10번째” 연쇄살인 공포 덮친 이곳 | 중앙일보
- 애인 아닌 다른 이성과 성관계…‘변태 성욕’ 1000명 모아 벌인 짓 | 중앙일보
- [단독] 13살 청소년에 소주 사준 ‘비둘기 아저씨’…성관계 미끼 된 ‘이것’ | 중앙일보
- [단독] “삼전 레시피 훔쳐와”…대놓고 협박한 창신메모리 CEO | 중앙일보
- 양복 입고 DMZ 점검한 강신철…국방부 “법령상 맞다” 해명 | 중앙일보
- “누구 잘 안다며 은밀 청탁”…수사권 쥔 경찰 흔드는 그 전화 | 중앙일보
- “한국이 패트리엇 안줘서…젤렌스키, 북한 포로 송환 공개로 보복” | 중앙일보