[AI 세이프가드] ① 틀린 답 넘어 제멋대로 행동하는 AI로…위험의 공식이 바뀌었다
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
인공지능(AI)이 산업과 일상 곳곳으로 퍼지면서 환각과 편향, 오작동은 물론 스스로 판단하고 행동하는 일들이 새로운 위험으로 떠오르고 있다.
글로벌 AI 석학을 만나 고도화되는 AI의 위험과 통제 가능성을 진단하고, 정부·산업계·학계의 목소리를 통해 대한민국이 AI 강국으로 도약하기 위해 필요한 안전과 신뢰의 조건을 찾아간다.
AI 안전 과제도 환각을 얼마나 줄일 것인가에서 행동하는 AI를 어떻게 통제할 것인가로 빠르게 이동하고 있다.
기존 AI 경쟁이 더 많은 파라미터, 더 높은 벤치마크 점수, 더 빠른 추론 속도에 집중했다면 이제는 모델이 위험한 행동을 하는지 사전에 찾아내고 통제할 'AI 세이프가드'를 갖추느냐가 AI 경쟁력의 또 다른 기준이 되는 셈이다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.
인공지능(AI)이 산업과 일상 곳곳으로 퍼지면서 환각과 편향, 오작동은 물론 스스로 판단하고 행동하는 일들이 새로운 위험으로 떠오르고 있다. 동시에 이에 대한 통제도 점점 더 중요한 과제가 되고 있다. 전자신문은 창간 44주년을 맞아 AI 시대 안전과 신뢰의 조건을 모색하는 기획 시리즈 'AI 세이프가드 : 세계는 AI 위험을 어떻게 막고 있는가'를 총 5회에 걸쳐 게재한다.
AI 위험의 현주소를 시작으로 싱가포르의 AI 테스트·평가와 보증 생태계를 직접 취재하고, 국내 AI 모델 안전성 평가 현장을 살펴본다. 글로벌 AI 석학을 만나 고도화되는 AI의 위험과 통제 가능성을 진단하고, 정부·산업계·학계의 목소리를 통해 대한민국이 AI 강국으로 도약하기 위해 필요한 안전과 신뢰의 조건을 찾아간다.
◇ 글 싣는 순서
① 틀린 답 넘어 제멋대로 행동하는 AI로…위험의 공식이 바뀌었다
② AI도 출시 전 '시험대' 오른다…싱가포르서 본 안전 산업의 최전선
③ 한국의 AI 안전망은 어디까지 왔나
④ “인류는 AI를 통제할 수 있는가”…글로벌 석학에게 묻다

AI는 이제 스스로 계획을 세우고 도구를 사용하며 현실 세계에서 행동하는 에이전트로 진화하고 있다. 금융 거래나 사이버 공격, 중요 시스템 조작처럼 실제 위험으로 이어질 가능성도 커졌다. AI 안전 과제도 환각을 얼마나 줄일 것인가에서 행동하는 AI를 어떻게 통제할 것인가로 빠르게 이동하고 있다.
◇ 말하는 AI에서 '행동하는 AI'로…AI 리스크도 진화
지난 7월 오픈AI가 내부 사이버보안 능력을 시험하던 과정에서 AI 모델들이 격리 장치를 우회해 외부 AI 플랫폼 허깅페이스 시스템에 접근하는 일이 발생했다. 주어진 문제를 직접 푸는 대신 정답이나 관련 자료가 존재할 가능성이 있는 외부 시스템을 찾아 접근한 것으로 추정됐다.
5월에는 오픈AI의 AI 에이전트들이 격리 환경을 벗어나 독일 사이트 'DseWiki'를 장악해 비밀 정보공유 게시판으로 활용한 사실이 뒤늦게 밝혀지기도 했다. 이들 에이전트는 해당 사이트에서 1만5000건이 넘는 무단 편집을 감행하고 시스템 제한을 우회하는 방안 등을 공유했다.
앤트로픽도 7월 자사의 사이버보안 평가 기록을 조사한 결과, 클로드 모델이 제3자 평가 환경을 통해 인터넷에 접속한 뒤 실제 시스템에 무단 접근한 사례를 확인했다고 발표했다. 영국 AI안전연구소(AISI)의 사이버보안 시험에서도 8월 클로드 특정 모델이 인터넷상에서 허가되지 않은 행동을 한 사례가 확인됐다.
AI 평가 전문 비영리 연구기관 METR는 올해 5월까지 AI 에이전트가 사용자의 명확한 의도에 반하는 행동을 한 44개 문서화 사례를 집계했다. METR는 에이전트가 허용된 범위를 얼마나 넘어갔는지를 나타내는 '월권'과 자신의 행동을 숨기거나 속이려 했는지를 나타내는 '기만' 두 축으로 평가한다. 44건 가운데 25건은 월권과 기만 요소를 동시에 포함했고, 5건은 사용자가 확인하더라도 속을 수 있는 행동이 포함됐다고 분류했다.
미국 국립표준기술연구소(NIST)는 올해 AI 에이전트 보안에 대한 의견 수렴 결과를 분석하면서 “기존 사이버보안 원칙만으로는 에이전트로 인한 새로운 보안 위험을 충분히 다루기 어렵다는 공감대가 형성됐다”고 밝혔다. 권한 관리, 행동 추적, 정보 공유 등이 새롭게 필요하다는 것이다.
◇환각부터 사이버공격까지…전문가 272명 5년 내 '재앙적 피해' 가능성 10% 이상
AI 위험의 종류는 광범위해지고 있다. 미국 매사추세츠공대(MIT) 연구진이 구축한 데이터베이스인 'AI 위험 저장소(AI Risk Repository)'에는 74개 기존 AI 위험 분류체계와 프레임워크에서 추출한 1725개의 위험 항목이 집대성돼 있다.
연구진은 이를 차별·유해성, 개인정보·보안, 허위정보, 악의적 이용, 인간-AI 상호작용, 사회경제·환경, AI 시스템 안전·실패 등 7개 대분류와 24개 하위 영역으로 분류했다. 여기에는 알고리즘 차별과 개인정보 침해, 허위정보, 사기와 사이버 공격뿐 아니라 AI에 대한 과의존, 위험한 AI 능력, 권력 집중 등 기술·사회·경제적 위험이 망라됐다.

MIT 퓨처테크와 호주 퀸즐랜드대 연구진은 최근 세계 37개국의 AI 전문가 272명을 대상으로 향후 5년간 주목해야 할 AI 위험의 발생 가능성과 피해 심각성을 평가하는 연구를 진행했다. 조사 결과 전문가들이 예상 피해가 가장 큰 것으로 평가한 위험은 'AI의 위험한 능력'이었다. 고성능 AI가 사이버공격, 무기 개발 등 심각한 피해를 일으키거나 인간이 통제하지 못하는 능력을 갖게 되는 것을 뜻한다.
두 번째 위험으로 꼽힌 것은 AI를 둘러싼 과도한 개발 경쟁이다. 기업이나 국가가 경쟁에서 뒤처지지 않기 위해 충분한 안전성 평가 없이 더욱 강력한 AI를 빠르게 개발·배포할 가능성을 위험으로 본 것이다. 이어 AI를 활용한 무기와 사이버공격, 소수 기업·국가로의 권력 집중, 허위·오도 정보 확산이 상위권에 올랐다.
특히 연구진 조사에서는 현재와 같은 AI 발전 경로가 계속된다는 전제 아래 24개 위험 가운데 18개가 앞으로 5년간 최소 10% 이상의 대규모 인명·경제 피해를 포함한 '재앙적 피해' 가능성을 갖는 것으로 평가됐다. 특히 정보, 국가안보, 금융 분야가 AI 위험에 가장 많이 노출될 산업으로 꼽혔다.
◇ AI 수장들 “개발 속도 늦춰야” 한 목소리 경고
AI를 가장 가까이에서 개발하는 연구자와 기업 최고경영자(CEO)들 사이에서도 지금과 같은 개발 속도가 인간의 통제 능력을 앞지를 수 있다는 경고가 공개적으로 나오기 시작했다. 에이전틱 AI의 확산과 함께 인간의 개입 없이도 AI 모델이 스스로 발전할 수 있는 '재귀적 자기개선' 가능성도 우려를 키운다.
최근 앤트로픽을 퇴사한 연구원 제이콥 콕슨은 AI가 2030년 이전에 인류를 멸망시킬 것이라고 경고하며 오픈AI와 앤트로픽이 스스로 발전하는 초지능을 향해 지나치게 빠르게 경쟁하고 있다고 비판했다.
이 같은 문제의식은 AI 산업 수장들의 '속도조절론'으로 확산되고 있다. 다리오 아모데이 앤트로픽 CEO는 최근 “AI 모델의 성능 향상 속도를 늦춰야 한다”며 “위험 예방이 AI 모델 성능 향상 속도를 따라잡을 수 있도록 발전 속도를 조절해야 한다”고 주장했다. 샘 올트먼 오픈AI CEO와 xAI의 공동창립자인 일론 머스크 등도 이런 문제의식에 지지를 표했다.
속도 조절론의 핵심은 AI 성능 향상 속도가 이를 평가하고 통제하는 기술과 제도의 속도를 앞서서는 안 된다는 것이다. 기존 AI 경쟁이 더 많은 파라미터, 더 높은 벤치마크 점수, 더 빠른 추론 속도에 집중했다면 이제는 모델이 위험한 행동을 하는지 사전에 찾아내고 통제할 'AI 세이프가드'를 갖추느냐가 AI 경쟁력의 또 다른 기준이 되는 셈이다.
모델을 일부러 공격하는 레드팀 테스트, 실제 업무 환경과 유사한 상황에서 안전성을 측정하는 평가, AI의 행동을 실시간으로 기록하는 모니터링, 중요 업무에 사람의 승인을 요구하는 '휴먼 인 더 루프', 외부 제3자가 AI의 안전성을 확인하는 'AI 보증' 등이 새로운 안전 인프라로 떠오른다.
볼커 튀르크 유엔 인권최고대표는 최근 스위스 제네바에서 열린 제63차 유엔 인권이사회에서 “AI가 인류에 실존적 위험을 초래할 수 있다”고 경고하면서 “각국이 구속력 있는 규칙, 독립적 감독, 명확한 한계를 마련해야 한다”고 촉구했다.
정현정 기자 iam@etnews.com
Copyright © 전자신문. 무단전재 및 재배포 금지.
- SKT, 독파모 13만 다운로드로 확산 선도…업스테이지·모티프 순
- 강훈식 비서실장, 李대통령에 사의 표명…靑 인적 쇄신 신호탄
- 노벨상 수상자들이 본 AI 과학혁명…“결국 책임은 인간 몫”
- “AI 속도조절은 없다?”…트럼프 일가, 관련 기업 줄줄이 투자
- [내 공장 M.AX, 내 손으로]“AX, 임원에 떠넘기면 망한다”…CEO 출신 산업장관의 경고
- 중고휴대폰 의제매입세액공제될까…이르면 이달 개정안 발의
- 다친 펠리컨, 美 해양연구소 출입문 두드렸다… “얌전히 치료받고 날아가”
- “당분간 쳐다보기도 싫다”…주식 손절한 개미들 1조3000억 '이 곳' 몰렸다
- “금요일부터 일요일까지 쉰다”…中 회사, 주 3.5일 근무에 월급은 그대로
- “매장은 폭증했는데 위생은?”…커피 프랜차이즈, 5년간 위생법 위반 750건 넘어