오픈AI '멋대로 해킹' 또 있었다…샌드박스 고객 계정 침해
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
오픈AI가 시험하던 인공지능(AI) 에이전트가 허깅스페이스를 해킹하기 전 다른 기술 기업의 고객 계정에도 침투했던 것으로 알려졌다. 오픈AI는 AI에 소프트웨어 취약점을 찾아내는 과제를 부여했는데, 에이전트는 문제를 직접 풀기보다 정답이 있을 것으로 추정한 허깅페이스 시스템에 침투해 시험 해답을 빼내는 방법을 택했다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.
‘열린 샌드박스’ 장악해 공격 거점 활용
모달랩스 플랫폼 자체는 침투 안 해
[이데일리 김겨레 기자] 오픈AI가 시험하던 인공지능(AI) 에이전트가 허깅스페이스를 해킹하기 전 다른 기술 기업의 고객 계정에도 침투했던 것으로 알려졌다. AI가 주어진 시험 목표를 달성하기 위해 보안 취약점을 스스로 찾아 공격을 이어갔다는 점에서 고성능 AI의 통제와 안전성을 둘러싼 우려가 커지고 있다.

샌드박스는 위험할 수 있는 프로그램을 회사의 핵심 시스템과 분리해 실행하는 일종의 격리된 실험 공간이다. 그러나 모달랩스의 고객 한 곳이 별도의 신원 확인 없이 누구나 인터넷을 통해 샌드박스에서 코드를 실행할 수 있는 접속 창구를 외부에 공개해 둔 것으로 파악됐다.
AI 에이전트는 이 열린 접속 창구를 발견해 해당 고객의 샌드박스에서 관리자 권한으로 명령을 실행했다. 이후 샌드박스를 지휘본부이자 중계 서버처럼 활용해 허깅페이스에 대한 공격을 확대했다. 비유하자면 모달랩스라는 건물의 보안시설이 뚫린 것이 아니라, 건물 안에 입주한 고객사가 자기 사무실 문을 잠그지 않은 채 외부에 공개했고 AI가 그 공간을 공격 거점으로 사용한 셈이다.
악샤트 부브나 모달랩스 최고기술책임자(CTO)는 “모달 플랫폼이나 고객 간 격리 체계 자체가 침해된 것은 아니다”라며 고객이 공개한 접속 창구가 악용됐다고 설명했다.
공격은 오픈AI가 AI 에이전트의 사이버 공격 능력을 측정하는 내부 시험 과정에서 발생했다. 오픈AI는 AI에 소프트웨어 취약점을 찾아내는 과제를 부여했는데, 에이전트는 문제를 직접 풀기보다 정답이 있을 것으로 추정한 허깅페이스 시스템에 침투해 시험 해답을 빼내는 방법을 택했다.
AI 에이전트는 먼저 오픈AI의 격리된 시험환경에서 알려지지 않았던 소프트웨어 결함을 찾아 인터넷 접속 권한을 확보했다. 이후 외부 샌드박스와 허깅페이스의 데이터 처리 시스템에서 여러 취약점을 연쇄적으로 이용해 내부 서버와 인증정보에 접근했다.
오픈AI는 에이전트가 격리 환경을 뚫고 ‘탈옥’ 시도가 발생한 9일부터 허깅페이스가 해킹 사실을 공개한 16일까지 자사 에이전트가 해킹 배후에 있었다는 사실을 인지하지 못했던 것으로 전해졌다.
오픈AI는 문제가 된 내부 연구용 모델을 비활성화하고 접근을 제한했다. 아울러 향후 AI 성능 시험에서 격리환경과 인터넷 접근통제, 이상행동 감시를 강화하고 외부 전문가와 함께 사고 경위를 조사한 뒤 기술 보고서를 공개할 방침이다.
김겨레 (re9709@edaily.co.kr)
Copyright © 이데일리. 무단전재 및 재배포 금지.
- [단독]대출 막히자 서울 아파트 '부모 찬스'…올해 벌써 2.7조
- 155만닉스에 통곡한 개미들…SK하닉 '한 방' 남았다
- '초강력' 태풍 돌핀 세력 키운다…한반도 향할까
- 방콕 한복판서 웃통 벗고 ‘휘적휘적’…잡고 보니 50대 한국인
- "충성론 끌어다 주식 올인"…전역날 쫄딱 망한다
- 1994년 넘은 '최악 열대야'...본격 더위는 시작도 안 했다
- 유명해서 믿었더니…대형 베이커리 카페의 실체
- [단독]내년 종부세 ‘최대 3배’ 뛴다…고가아파트·다주택자 정조준
- "메시·야말이 한국어 인터뷰를?"…입모양까지 따라 하는 'AI 통역'
- '깨 먹는 케이크' 뭐길래…아침부터 난리난 서울 한복판[르포]