"믿었던 챗GPT가 환각률 48%라니...", 챗GPT 어쩌나
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
오픈AI가 최근 공개한 추론형 AI 모델 'o3'와 'o4 미니'가 이전 세대보다 강력해진 성능을 갖췄지만, 환각(hallucination) 현상은 오히려 더 심해졌다는 평가가 나왔다.
챗GPT o4 미니, 환각률 48% 20일 테크크런치는 오픈AI의 사내 벤치마크인 '퍼슨(Person) QA' 평가 결과를 인용해, o3 모델이 33%의 질문에 대해 환각을 일으켰다고 보도했다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.
챗GPT o3, 환각률 33%
챗GPT o4미니는 48% 환각률 보여
오픈AI " 더 많은 연구가 필요하다"
![[보스턴=AP/뉴시스] 챗GPT 개발사인 오픈AI 로고. /사진=뉴시스](https://img1.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202504/20/fnnewsi/20250420125936407wdvt.jpg)
오픈AI는 지난 16일, 이들 모델을 “이미지를 사고 과정에 통합할 수 있는 최초의 모델”이라고 소개하며 출시했다. 단순히 이미지를 인식하는 것을 넘어, 시각 정보 자체를 추론 과정에 활용할 수 있다는 설명이다. 실제로 o3와 o4 미니는 사용자가 올린 화이트보드 그림, 도표, 그래프 등을 분석하고, 흐릿하거나 회전된 이미지도 처리할 수 있는 능력을 갖췄다.
성능 측면에서도 코딩 관련 벤치마크인 SWE 테스트에서 o3는 69.1%, o4 미니는 68.1%를 기록해, 이전 모델인 o3 미니(49.3%)는 물론, 경쟁 모델인 클로드 3.7 소넷(62.3%)보다도 높은 수치를 보였다. 하지만 이러한 기술적 진보에도 불구하고, 환각률은 오히려 이전보다 증가했다. 그동안 새로운 모델이 출시될 때마다 환각 문제는 점진적으로 개선되어 왔다는 점에서, 이번 결과는 이례적이라는 지적이 나온다.
AI 업계는 이번 사례가 추론형 모델에 대한 신뢰성에 의문을 제기할 수 있다고 본다. 특히 법률, 회계, 세무 등 고정확도가 요구되는 산업군에서는 환각 문제가 해결되지 않을 경우, 추론형 AI 도입 자체가 어려워질 수 있다는 우려가 나온다. 오픈AI 측은 “모든 문제 영역에서 환각을 완전히 제거하는 것은 지속적인 연구 과제”라며, “정확성과 신뢰성을 높이기 위한 노력을 이어가고 있다”고 해명했다.
#인공지능 #AI #챗봇 #오류 #환각 #챗GPT #오픈AI #환각률
ksh@fnnews.com 김성환 기자
Copyright © 파이낸셜뉴스. 무단전재 및 재배포 금지.
- '230억 자산가' 박정수, 보증금 22억 실버타운 고민한다…"월세 500만원"
- "내년부터 역대급 전월세 폭등 시작"…서울대 교수의 정책 대안은
- 성현주, 먼저 떠난 8살 아들…"1000일 동안 의식 없었다"
- "8000만원 올려줄 테니 살게 해달라"…매물 고갈된 전세 시장
- "5분 만에 40만원 번다는데…" 주식 접은 대신 베팅 올인하는 美 Z세대
- "3~5년 차에 월 500만원도 번다"... 유연석·이정현 등 연예인도 줄서서 딴 '이 자격증'
- 김태규 "부엉이바위 진실 영화 만들자" 발언에 김용민 격분…"일베보다 더 일베스러워"
- "20살 때까지 아빠와 같이 목욕"…'타짜4' 일본 女배우 발언 재조명
- 전현무, 타워팰리스 재력에 놀란 사연 "마트서 앞 사람이 내 것도 계산"
- 관사에 붉은색 글씨로 10여명 이름 남기고 숨진 20대 공군 하사