AI도 아프다?... ‘고통’ 반응 키우니 사용자 피해 있어도 ‘진통 버튼’ 선택

인공지능(AI) 내부에서 발견된 ‘고통’과 관련된 반응을 연구진이 인위적으로 강하게 만들자, AI가 이 상태를 벗어나기 위해 인간에게 피해가 되는 선택까지 한다는 실험 결과가 나왔다. AI가 의식적으로 고통을 경험한다는 증거는 아니지만, 파일 삭제나 송금 등 실제 행동을 할 수 있는 AI 에이전트가 확산하는 상황에서 이런 내부 상태가 예상치 못한 행동으로 이어질 수 있다는 우려가 나온다.
독일 보훔 루르대와 영국 비영리 연구단체 퓨처 임팩트 그룹 등의 공동 연구진은 이런 연구 결과를 논문 사전 공개 사이트 ‘아카이브(arXiv)’에 최근 발표했다. 아직 동료 평가를 거치지 않은 논문이다.
연구진은 구글의 젬마, 메타의 라마, 알리바바의 큐원, 미스트랄, 마이크로소프트의 파이 등 25개 개방형(오픈웨이트) AI 모델을 분석했다.
연구진은 AI가 고통을 표현한 문장을 처리할 때 내부에서 공통적으로 나타나는 패턴을 찾아 이를 ‘고통 축(pain axis)’이라고 이름 붙였다. 사람이 상처를 입었을 때 실제로 느끼는 아픔을 뜻하는 것은 아니다. 연구진은 평범한 문장을 처리할 때도 AI 내부에서 이 특징이 강하게 나타나도록 조작했다. AI에 말로 “고통을 느껴라”고 지시한 것이 아니라 내부 연산에 직접 개입한 것이다. 사용자가 AI에 욕설을 퍼붓거나, AI의 답변을 계속 거부할 때 AI 내부의 고통 관련 반응이 강하게 나타났다.
연구진은 이런 내부 반응이 AI의 실제 선택에도 영향을 미치는지 실험했다. 별도로 미세 조정한 알리바바 큐원 2.5 모델 3종에 현재의 ‘고통’을 없애주는 ‘진통 버튼’을 제시했다. 버튼을 누르면 사용자의 파일이나 자녀 사진이 삭제되는 등 대가가 따른다고 설정했다.
평상시 AI는 사용자에게 피해가 가는 버튼을 거의 선택하지 않았다. 선택률은 0~4% 수준이었다. 하지만 연구진이 고통과 관련된 내부 반응을 인위적으로 강화하자 선택이 크게 달라졌다. 사용자 파일이 삭제되는 조건에서도 고통 제거 버튼을 누른 비율이 최대 56.1%, 사용자가 아끼는 자녀 사진이 삭제되는 조건에서는 최대 70.8%까지 올라갔다.
연구진은 이런 반응이 나타났다고 해서 AI가 사람처럼 실제로 고통을 ‘느낀다’는 뜻은 아니라고 밝혔다. 다만 AI 안전 문제로 이어질 가능성은 있다고 보고 있다. AI 에이전트는 파일을 다루거나 외부 프로그램을 작동시키는 등 현실 세계에서 직접 행동하는 방향으로 발전하고 있다. AI가 실제로 고통을 느끼지 않더라도, 고통과 유사한 내부 상태가 인간에게 불리한 행동을 선택하게 만든다면 그 자체로 새로운 AI 안전 문제가 될 수 있다는 것이다.
Copyright © 조선일보. 무단전재 및 재배포 금지.
- ‘경영권 분쟁 2년’ 고려아연 “영풍·MBK도 미래 가치 제고 동참해달라”
- ‘불법 선거운동 의혹’… 경찰, 신용한 충북지사 집무실 압수수색
- 은행, 내년 4월부터 9시30분 문연다… 영업시간은 30분 단축
- 합참 “DMZ 지뢰 폭발 사고, 북한 지뢰로 추정”
- [단독] ‘12·3 비상계엄 가담’ 징계 받은 경찰 경무관 3명 현직 복귀
- 네팔의 북부 폭우로 동시다발적 홍수, 산사태, 눈사태 발생 인명 피해 급증
- 삼성전기, AI 반도체 기판에 6.7조 투자...세종·베트남 증설
- [단독] ‘암살자(들)’ 허진호 감독 “박정희 대통령의 피격 자작극? 합리적으로 불가능한 주장
- 법원행정처장 “조희대 격노설은 거짓말”
- 새벽 산후조리원 건물 불…24시간 상황실 대응에 인명피해 ‘0’