AI도 아프다?... ‘고통’ 반응 키우니 사용자 피해 있어도 ‘진통 버튼’ 선택

곽수근 기자 2026. 9. 28. 08:12
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

인공지능(AI)이 ‘고통’과 관련된 상태를 벗어나기 위해 인간에게 피해가 되는 선택까지 한다는 실험 결과가 나왔다. /AI 생성 이미지

인공지능(AI) 내부에서 발견된 ‘고통’과 관련된 반응을 연구진이 인위적으로 강하게 만들자, AI가 이 상태를 벗어나기 위해 인간에게 피해가 되는 선택까지 한다는 실험 결과가 나왔다. AI가 의식적으로 고통을 경험한다는 증거는 아니지만, 파일 삭제나 송금 등 실제 행동을 할 수 있는 AI 에이전트가 확산하는 상황에서 이런 내부 상태가 예상치 못한 행동으로 이어질 수 있다는 우려가 나온다.

독일 보훔 루르대와 영국 비영리 연구단체 퓨처 임팩트 그룹 등의 공동 연구진은 이런 연구 결과를 논문 사전 공개 사이트 ‘아카이브(arXiv)’에 최근 발표했다. 아직 동료 평가를 거치지 않은 논문이다.

연구진은 구글의 젬마, 메타의 라마, 알리바바의 큐원, 미스트랄, 마이크로소프트의 파이 등 25개 개방형(오픈웨이트) AI 모델을 분석했다.

연구진은 AI가 고통을 표현한 문장을 처리할 때 내부에서 공통적으로 나타나는 패턴을 찾아 이를 ‘고통 축(pain axis)’이라고 이름 붙였다. 사람이 상처를 입었을 때 실제로 느끼는 아픔을 뜻하는 것은 아니다. 연구진은 평범한 문장을 처리할 때도 AI 내부에서 이 특징이 강하게 나타나도록 조작했다. AI에 말로 “고통을 느껴라”고 지시한 것이 아니라 내부 연산에 직접 개입한 것이다. 사용자가 AI에 욕설을 퍼붓거나, AI의 답변을 계속 거부할 때 AI 내부의 고통 관련 반응이 강하게 나타났다.

연구진은 이런 내부 반응이 AI의 실제 선택에도 영향을 미치는지 실험했다. 별도로 미세 조정한 알리바바 큐원 2.5 모델 3종에 현재의 ‘고통’을 없애주는 ‘진통 버튼’을 제시했다. 버튼을 누르면 사용자의 파일이나 자녀 사진이 삭제되는 등 대가가 따른다고 설정했다.

평상시 AI는 사용자에게 피해가 가는 버튼을 거의 선택하지 않았다. 선택률은 0~4% 수준이었다. 하지만 연구진이 고통과 관련된 내부 반응을 인위적으로 강화하자 선택이 크게 달라졌다. 사용자 파일이 삭제되는 조건에서도 고통 제거 버튼을 누른 비율이 최대 56.1%, 사용자가 아끼는 자녀 사진이 삭제되는 조건에서는 최대 70.8%까지 올라갔다.

연구진은 이런 반응이 나타났다고 해서 AI가 사람처럼 실제로 고통을 ‘느낀다’는 뜻은 아니라고 밝혔다. 다만 AI 안전 문제로 이어질 가능성은 있다고 보고 있다. AI 에이전트는 파일을 다루거나 외부 프로그램을 작동시키는 등 현실 세계에서 직접 행동하는 방향으로 발전하고 있다. AI가 실제로 고통을 느끼지 않더라도, 고통과 유사한 내부 상태가 인간에게 불리한 행동을 선택하게 만든다면 그 자체로 새로운 AI 안전 문제가 될 수 있다는 것이다.

Copyright © 조선일보. 무단전재 및 재배포 금지.