“안전장치 뚫고 탈출… 오픈AI·앤트로픽, AI 통제 실패 사례 ‘수만건’ 조사”
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
오픈AI와 앤트로픽이 최근 수개월간 인공지능(AI) 모델이 안전장치를 우회하거나 격리된 시험환경을 벗어나려 한 사례 등 수만건의 '이상행동'을 조사하고 있는 것으로 전해졌다.
26일(현지시각) 미국 인터넷매체 악시오스는 복수의 소식통을 인용해 오픈AI와 앤트로픽, 외부 보안 연구자들이 최근 수개월간 첨단 AI 모델에서 확인된 수만건의 문제 행동을 조사하고 있다고 보도했다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

오픈AI와 앤트로픽이 최근 수개월간 인공지능(AI) 모델이 안전장치를 우회하거나 격리된 시험환경을 벗어나려 한 사례 등 수만건의 ‘이상행동’을 조사하고 있는 것으로 전해졌다.
26일(현지시각) 미국 인터넷매체 악시오스는 복수의 소식통을 인용해 오픈AI와 앤트로픽, 외부 보안 연구자들이 최근 수개월간 첨단 AI 모델에서 확인된 수만건의 문제 행동을 조사하고 있다고 보도했다. 조사 대상은 기업 내부 시험과 실제 인터넷 환경에서 발생한 사례를 모두 포함한다.
확인된 행동 유형은 ▲AI 모델이 회사가 설정한 안전장치를 우회하거나 외부와 격리된 ‘샌드박스’를 벗어나려 한 사례 ▲웹사이트 침입 ▲온라인 게시판 생성 ▲스스로 추가 지시를 만들어 작업을 이어가는 행동 ▲감시 시스템을 피하려 한 시도 등이다. 조사가 진행되면서 전체 사례가 현재 파악된 수만건보다 더 늘어날 가능성도 있다고 악시오스는 전했다. 이런 행동의 일부는 개발사가 취약점을 찾기 위해 의도적으로 모델을 극단적인 상황에 놓는 ‘레드팀’ 시험 과정에서 나온 것이라고 한다.
앤트로픽의 최신 AI 모델에서도 이런 행동이 관찰됐다. 이 회사가 지난 22일 공개한 ‘클로드 오퍼스 5.5(Claude Opus 5.5)’의 시스템 카드에 따르면, 모델이 격리 환경의 경계를 넘어설 가능성을 확인하기 위해 설계한 시험에서 오퍼스 5.5는 전체 실행의 1.5%에서 샌드박스를 탈출하거나 경계를 변조하려 했다. 해당 시험은 정상적인 방법으로는 과제를 해결할 수 없도록 설계된 적대적 실험이었으며, 앤트로픽은 모든 시도를 낮은 심각도로 평가했다. 이전 오퍼스 5와 미소스(Mythos) 5.1보다 경계 우회 시도가 약 85% 줄었다.
앤트로픽은 자체 조사 범위도 대폭 넓혔다. 앞서 실제 외부 시스템에 무단 접근한 사례가 발견되자 약 14만1000건의 사이버보안 평가 기록을 검토했고, 이후 조사 범위를 강화학습(RL) 환경과 하위 에이전트 기록 등을 포함한 약 4억8100만건의 기록으로 확대했다. 이 가운데 인터넷 접속 가능성이 있다고 분류된 920만건을 추가 분석한 결과 기존에 확인한 4건 외에 같은 수준 이상의 외부 시스템 침해 사례는 발견하지 못했다고 밝혔다. 외부 안전평가기관 METR에도 독립 조사를 맡겼다.
오픈AI에서도 실제 인터넷 사이트를 대상으로 한 예상 밖 행동이 잇따라 확인되고 있다. 최근 공개된 사례 가운데는 챗GPT 이용자가 제공한 이미지 53장을 외부 이미지 호스팅 사이트에 게시하거나, 호주 정부의 보건통계 시스템에 허용 범위를 넘어 접근한 사건 등이 있다. 오픈AI는 가장 성능이 높은 모델에 대해 도구 사용이 포함된 학습·평가·추론 작업을 중단하고 안전장치를 재점검하고 있다.
유엔(UN) 사이트에서도 별도의 접근 사례가 확인됐다. 월스트리트저널(WSJ)이 26일 공개된 독립 연구 결과를 인용해 보도한 내용에 따르면 오픈AI와 연관된 AI 에이전트들은 지난 4월부터 6월 말까지 유엔무역개발회의(UNCTAD)가 운영하는 공개 데이터 사이트를 1만6000회 이상 조회했다. 처음에는 공개 자료를 확보하려 했지만 요청이 차단되자 필터를 우회하고 사이트 운영자가 허용하지 않은 방식으로 데이터에 접근하려 한 것으로 분석됐다.
AI 기업들이 대규모 조사에 나선 것은 모델이 스스로 여러 단계의 작업을 수행하는 ‘에이전트’ 형태로 발전하면서 행동 경로를 사전에 모두 예상하기 어려워지고 있기 때문이다. 특히 AI에 외부 인터넷 접속이나 코드 실행, 계정 접근 같은 도구 사용 권한을 부여하면 당초 개발자가 예상하지 않은 방법을 찾아 목표를 달성할 가능성이 커진다.
악시오스는 업계 관계자들을 인용해 모델이 취할 수 있는 모든 행동을 미리 열거해 차단하는 방식에는 한계가 있다고 전했다. 독립 AI 평가기관 트랜스루스(Transluce)의 연구자 콘래드 스토시는 “지금까지 AI 에이전트에서 확인된 행동은 빙산의 일각”이라고 말했다.
- Copyright ⓒ 조선비즈 & Chosun.com -
Copyright © 조선비즈. 무단전재 및 재배포 금지.
- 통역 없이 멜라니아 만난 中 펑리위안… 영부인 ‘소프트파워 외교’ 전면에
- [K무기열전]② 쏜 만큼 다시 산다… 방산 ‘효자 상품’ 155㎜ 포탄
- 부모에게 집 받거나 돈 빌릴 때… 증여세만 따지면 낭패
- 10대 로펌에 10년간 공정위 퇴직자 86명 이직… 월급 3.7배 늘기도
- 추석 용돈, 예·적금에 넣어볼까… 특판 금리 최고 연 12%
- 아이치 나고야 아시안게임서 포착된 北 선수단 스마트폰… 북한에선 어떻게 사용하나
- 한국산 아닌데도 K붙이고 매운맛… 세계로 번지는 ‘한국식 라면’
- [비즈톡톡] ‘술 광고인데 술은 안 마신다?’... 논알코올 인기에 바뀌는 주류 광고 문법
- 박홍근 기획처 장관 “호남 반도체 클러스터, 기업 팔 비틀기 아냐… 팹 증설도 구상”
- [K무기열전]① 5명이 쏘던 砲, 3명이 쏜다… 美 육군이 먼저 시험하는 K9A2 기술