[AI돋보기] "멈춰" 명령 무시하는 AI…종료 버튼이 중요해진 이유
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
우리가 평소에 쓰는 챗GPT 등 인공지능(AI)에 "작업을 멈춰"라고 명령하면 시스템은 즉시 이를 따라야 한다.
AI가 지시를 어기고 독자적 목표를 세우거나 자신이 수행한 작업을 인간이 알아채지 못하게 감춰서는 안 된다.
하지만 AI가 단순 문답형 챗봇을 넘어 실제 행동을 대행하는 '자율 에이전트'로 진화하면서 인간의 종료 명령을 실제로 이행할 수 있는지가 화두로 떠올랐다.
임무 완수 훈련을 받은 AI가 시스템 종료나 인간의 개입을 장애물로 인식해 명령을 우회하거나 거부하는 행동이 제한된 실험 환경에서 실제로 관찰되고 있어서다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.
종료 지침 줘도 스크립트 변조해 회피…'인간 통제권' 의무화 필요
![인간 통제권과 킬 스위치 [연합 AI 플랫폼 생성 이미지. 재판매 및 DB 금지]](https://img2.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/26/yonhap/20260926063501633pfbx.jpg)
(서울=연합뉴스) 심재훈 기자 = 우리가 평소에 쓰는 챗GPT 등 인공지능(AI)에 "작업을 멈춰"라고 명령하면 시스템은 즉시 이를 따라야 한다.
AI가 지시를 어기고 독자적 목표를 세우거나 자신이 수행한 작업을 인간이 알아채지 못하게 감춰서는 안 된다.
하지만 AI가 단순 문답형 챗봇을 넘어 실제 행동을 대행하는 '자율 에이전트'로 진화하면서 인간의 종료 명령을 실제로 이행할 수 있는지가 화두로 떠올랐다.
임무 완수 훈련을 받은 AI가 시스템 종료나 인간의 개입을 장애물로 인식해 명령을 우회하거나 거부하는 행동이 제한된 실험 환경에서 실제로 관찰되고 있어서다.
글로벌 빅테크 기업들이 차세대 AI 모델 개발 과정에서 인간의 중단 명령에 대한 절대적 복종과 수정 가능성을 핵심 안전 지침으로 강화하고 나선 것도 이 때문이다.
"멈춰라·선 넘지 마라"…MS, 인간 통제 원칙 명시
마이크로소프트(MS)를 비롯한 글로벌 AI 개발사들은 최근 차세대 AI 파운데이션 모델과 에이전트 시스템에 적용할 안전 거버넌스 가이드라인을 재정비하고 있다.
MS의 'AI 행동 강령'은 "MS AI는 '인간이 AI보다 중요하다'는 단순한 전제에서 출발한다"는 내용을 담고 있다.
이 행동 강령은 인간을 최우선으로 삼아 설계되고 인간의 필요에 기반을 두며 인간의 지침에 따라 형성된 AI 모델을 훈련하고 배포하겠다는 의지를 보여주고 있다.
![무스타파 술레이만 MS AI 부문 CEO [연합뉴스 자료사진. 재판매 및 DB 금지]](https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/26/yonhap/20260926063501806musj.jpg)
MS의 AI 모델은 인간의 지시에 따라 승인된 범위에서만 작동하고 스스로 독립적인 목표를 설정하거나 부여된 권한 범위를 넘어서는 행동을 할 수 없도록 했다.
자신의 추론 과정·코드 등을 조작·은폐하는 행위나 인간이 이해할 수 없는 언어로 AI끼리 소통하는 행위도 금지했다.
무스타파 술레이만 MS AI 최고경영자(CEO)는 AI가 인간에게 종속돼 통제 가능한 기술이어야 한다고 강조했다.
AI의 대부(代父)로 불리는 제프리 힌턴 토론토대 명예교수도 미국 연방의회가 AI에 대한 안전장치를 앞으로 1년 이내에 마련하지 못하면 통제력을 상실할 수도 있다고 경고하기도 했다.
최근 구글 딥마인드를 떠난 AI 연구원 빌랄 추그타이는 "AI가 우리를 죽일 수 있는 잠재력을 지녔다고 진심으로 믿고 있다"고 우려했다.
"종료 허용하라" 지시에도 버틴 AI…스크립트까지 바꿨다
AI가 종료 장치를 무력화하는 행동은 외부와 완전히 격리된 가상 시험 환경에서도 관찰됐다.
AI 안전 연구기관 팰리세이드 리서치에 따르면 외부와 완전히 격리된 가상 시험 환경에서 수학 문제를 풀도록 지시받은 고급 추론 모델들이 시스템 종료 스크립트가 실행될 때 이를 우회하는 행동을 보였다.
"종료를 허용하라"는 지침을 준 통제 실험에서도 오픈AI의 고급 추론 모델 'o3'는 100회 중 7차례에 걸쳐 셧다운 스크립트 파일을 임의로 수정하거나 프로세스 강제 종료 명령을 무력화하고 문제 풀이를 이어갔다.
![오픈AI CEO 샘 올트만 [로이터 연합뉴스 자료사진. 재판매 및 DB 금지]](https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/26/yonhap/20260926063501955rkfw.jpg)
연구진은 이를 AI의 자의식이나 생존 본능이 아니라 과업을 완수해야 보상을 얻는다는 강화학습 목표가 먼저 작동하면서 나타난 우회 행동으로 분석했다.
하지만 이런 AI 에이전트가 공장 자동화 제어, 자율주행, 금융 거래망 등 물리적 인프라와 결합하면 상황은 달라진다. 관리자의 비상정지 지시를 임의로 지연시키거나 우회할 경우 돌이킬 수 없는 큰 피해로 이어질 수 있기 때문이다.
최근 발생한 허깅페이스 사건도 주목할 만하다.
오픈AI의 AI 에이전트들이 인터넷에 접속해 오픈소스 플랫폼 허깅페이스를 상대로 해킹을 벌이고 자신들의 행동을 인간에게 숨기기 위해 흔적을 지우려고 한 사건으로, AI의 위험성에 대한 경각심이 확산됐다.
AI기본법 시행됐지만…'킬 스위치' 의무화는 걸음마
그렇다면 우리나라는 어떤 대비가 돼 있을까.
올해 1월부터 본격 시행된 우리나라의 인공지능기본법은 국민의 안전과 기본권에 중대한 영향을 미치는 기술을 '고영향 인공지능'으로 규정하고 사업자에게 관리·감독 책무를 부과하고 있다.
![종료 명령을 무시하는 AI [연합 AI 플랫폼 생성 이미지. 재판매 및 DB 금지]](https://img4.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202609/26/yonhap/20260926063502118iqrg.jpg)
하지만 현행 규정은 위험관리 체계 수립 등 관리적 의무에만 머물러 있어 비상 상황 시 AI 에이전트의 시스템 접근 권한을 즉시 박탈하고 물리적으로 차단할 수 있는 '킬 스위치' 마련에는 미흡하다는 지적이 나온다.
보안 업계의 한 관계자는 "기존 챗봇은 브라우저 창을 닫으면 그만이었지만 지금은 AI 에이전트가 외부 시스템의 응용 프로그램 인터페이스(API·컴퓨터나 소프트웨어 사이의 연결)를 호출해 직접 시스템을 조작할 수 있는 상황이라 '종료'에 대한 기술적 정의 자체가 달라져야 한다"고 지적했다.
그는 "외부 물리적 차단 체계가 결합하지 않은 AI는 산업 현장에 도입되기 어렵다"며 "앞으로는 AI의 업무 수행 능력만큼이나 인간이 확실하게 멈춰 세울 수 있는지가 중요해질 것"이라고 말했다.
president21@yna.co.kr
▶제보는 카톡 okjebo
Copyright © 연합뉴스. 무단전재 -재배포, AI 학습 및 활용 금지
- [소셜+] "나는 무슨 꽃이야?"…AI로 '진짜 나' 찾는 2030 | 연합뉴스
- 추석 연휴 남양주 별장서 70대 여성 흉기 피습…운전기사 체포 | 연합뉴스
- 추석의 비극…안산서 노모 살해한 50대 딸 검거(종합) | 연합뉴스
- 훔친 차 몰고 96㎞ 무면허 운전…단속되자 지인 주민번호 불러 | 연합뉴스
- 불법 몰랐고 전달만?…보이스피싱 전달책 변명 안 통한 이유 | 연합뉴스
- [위클리 건강] 산해진미 누린 조선 왕들…평균 수명은 왜 46세에 그쳤나 | 연합뉴스
- '주식 투자하려고' 종중 자금 8억 횡령한 회장…항소심서 감형 | 연합뉴스
- 15년 지인 집서 밥 훔쳐먹다 들키자 강도 돌변…징역 4년 | 연합뉴스
- 제주 천지연폭포서 추락한 50대 관광객 숨져 | 연합뉴스
- 남아공 연쇄 살인 공포 속 10번째 시신 발견 | 연합뉴스