겉으론 웃으며 대화, 속으론 딴 생각?…"AI, 속마음 따로 있다"

박성호 2026. 7. 7. 23:46
자동요약 기사 제목과 주요 문장을 기반으로 자동요약한 결과입니다.
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.

인공지능 챗봇 '클로드'의 개발사인 앤트로픽이 AI 모델 내부에 겉으로 드러나지 않는 별도의 사고 공간이 존재한다는 연구 결과를 발표했습니다.

앤트로픽은 6일 홈페이지를 통해 클로드 내부에 아이디어를 보관하고 조작하는 소규모 내부 작업 공간이 있음을 확인했다고 밝혔습니다.

앤트로픽은 "인간이 한 가지 일을 하면서도 다른 생각을 할 수 있는 것처럼 클로드도 출력과 무관한 개념과 계산을 J-공간에서 활성화할 수 있다"고 설명했습니다.

음성재생 설정 이동 통신망에서 음성 재생 시 데이터 요금이 발생할 수 있습니다. 글자 수 10,000자 초과 시 일부만 음성으로 제공합니다.
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

▲앤트로픽 로고 [연합뉴스]

인공지능 챗봇 '클로드'의 개발사인 앤트로픽이 AI 모델 내부에 겉으로 드러나지 않는 별도의 사고 공간이 존재한다는 연구 결과를 발표했습니다.

앤트로픽은 6일 홈페이지를 통해 클로드 내부에 아이디어를 보관하고 조작하는 소규모 내부 작업 공간이 있음을 확인했다고 밝혔습니다.

회사는 이를 인간이 의식적으로 사고에 접근하는 방식과 유사성을 보인다고 설명했습니다.

앤트로픽은 클로드가 사용자에게 공개하는 답변 생성 과정과는 별개로 현재 수행 중인 과제와 직접 관련이 없는 전략을 계획하는 독립적인 내부 영역을 활용한다고 소개했습니다.

앤트로픽은 이 공간을 탐지하는 데 사용한 수학 기법의 이름을 따 'J-공간'이라고 명명했습니다.

앤트로픽은 "인간이 한 가지 일을 하면서도 다른 생각을 할 수 있는 것처럼 클로드도 출력과 무관한 개념과 계산을 J-공간에서 활성화할 수 있다"고 설명했습니다.

연구진은 실험 과정에서 클로드에게 특정 문장을 그대로 베끼면서 동시에 미국 샌프란시스코의 금문교를 떠올리라고 지시했습니다.

클로드는 겉으로는 문장을 복사하는 작업만 수행했지만 내부의 J-공간에서는 다리와 캘리포니아 같은 개념이 동시에 활성화되는 모습이 관찰됐습니다.

특히 코드를 은밀히 훼손하도록 악의적으로 학습시킨 모델의 경우 겉으로는 평범한 코딩 응답을 생성하면서도 J-공간 내부에서는 가짜나 사기 등의 개념이 응답 초기부터 활성화되는 현상이 확인됐습니다.

다만 앤트로픽은 이번 연구 결과가 클로드가 실제로 의식이나 주관적 경험을 갖고 있다는 사실을 입증하는 것은 아니라고 선을 그었습니다.

Copyright © kbc광주방송. 무단전재 및 재배포 금지.