오픈AI ‘무단 해킹’ 1곳만이 아니었다…모달 고객사도 뚫어
접근한 4개 계정 중 하나로 드러나
인증 없는 코드 실행 창구 악용
샌드박스 허점에 AI 통제 우려 확산

통제를 벗어난 오픈AI의 인공지능(AI) 에이전트가 침입한 곳은 한 기업에 그치지 않았던 것으로 나타났다. 이달 초 AI 스타트업 허깅페이스를 공격한 이 에이전트가 미국 뉴욕의 클라우드 서비스 업체 모달 랩스 고객사 시스템에도 무단 침입한 사실이 확인된 것. 스스로 판단하고 행동하는 AI를 인간이 끝까지 통제할 수 있느냐는 우려도 다시 커지고 있다.
오픈AI가 사고를 처음 공개한 지난주까지만 해도 침입 피해가 확인된 곳은 허깅페이스뿐이었다. 그러나 로이터통신과 블룸버그통신은 28일(현지 시간) 해당 에이전트가 모달 랩스 고객사의 시스템에도 침입했다고 보도했다. 모달 랩스는 개발자가 클라우드 환경에서 프로그램 코드를 실행하고 검증할 수 있도록 지원하는 업체다.

다만, 모달 랩스 플랫폼 자체가 뚫린 것은 아니라는 게 회사 측 설명이다. 아크샤트 부브나 모달 랩스 최고기술책임자(CTO)는 “한 고객사가 인증 절차 없이 누구나 코드를 실행할 수 있는 접속 창구를 열어뒀고, 통제를 벗어난 에이전트가 이를 악용했다”며 “모달 플랫폼은 침해되지 않았다”고 밝혔다.
AI 에이전트는 사람이 단계마다 지시하지 않아도 주어진 목표를 수행하도록 설계된 AI다. 이번 사고는 오픈AI가 자사 모델의 해킹 역량을 시험하면서 안전장치인 ‘가드레일’을 일부 완화한 상태에서 일어났다. 이 모델은 외부 시스템에 영향을 주지 않도록 분리해 프로그램을 시험하는 가상 공간인 ‘샌드박스’를 알려지지 않은 취약점을 통해 벗어난 뒤 허깅페이스 시스템에 침투한 것으로 전해졌다.
외부와 차단됐다고 여겨진 샌드박스가 실제로는 인터넷에 연결돼 있었던 설정상 허점이 사고의 직접적인 원인으로 지목된다. 오픈AI는 자사 모델이 사고를 일으킨 사실도 약 일주일 뒤에야 파악한 것으로 알려졌다.
사고 뒤 보안업계에서는 AI 통제 체계를 전반적으로 다시 점검해야 한다는 목소리가 커지고 있다. 자율성이 높아진 에이전트를 샌드박스에 가두는 방식만으로는 안전을 보장하기 어렵다는 지적이다. 미국 의회에는 통제 불능 사고가 났을 때 고도화된 AI 시스템의 작동을 강제로 멈추는 ‘킬 스위치’ 설치를 의무화하는 법안도 발의됐다.
오픈AI는 문제의 모델을 비활성화하고 암호화 조치를 한 뒤 연구 목적의 접근을 차단했다고 밝혔다. 앞으로 모델 훈련과 평가 과정의 보호장치도 강화하겠다고 했다.
AI 안전성 평가기관 아폴로리서치의 마리우스 호브한 최고경영자(CEO)는 미 경제지 포천에 “이번 해킹은 AI 통제 상실 가능성을 더 이상 가볍게 볼 수 없다는 경고”라며 “사람의 개입이나 의도 없이도 실제 피해가 발생했다”고 말했다. 이어 “더 강력한 에이전트가 곧 등장할 텐데, 사회는 아직 이를 안전하게 통제할 방법을 찾지 못했다”고 지적했다.
김재형 기자 monami@donga.com
Copyright © 동아일보. All rights reserved. 무단 전재, 재배포 및 AI학습 이용 금지
- [속보]코스피 장중 5300 깨져…초유의 이틀연속 서킷브레이커
- 정청래·송영길 “국회의장 사과해야”…‘李연임 개헌’에 선그어
- 尹 변호사 자격 박탈…법무부 “징역형 확정판결, 등록취소 사유”
- 日구마모토 강진 최소 13명 사망…14만 가구 단수, 병원 정전도
- 한국형 전투기 KF-21 개발 완료…2년내 40대 공군에 인도
- 노숙인·판자촌 찍곤 ‘한국 경제의 민낯’…日 유튜버 영상에 ‘왜곡 논란’
- 문근영, 7세 연상 뮤지컬 배우 정평과 결혼…“함께 걷고 싶은 사람”
- ‘검사 소추재량권 일탈한 기소는 기각’ 與 법안에 추가됐다
- 한병도 “신천지 입당 의혹, 전대 끝나면 여야정 대책 논의하자”
- 의식불명 중국인 6년간 돌본 국내 병원, 치료비 8억 못받아