같은 AI도 시험 따라 순위 8계단 출렁···하정우 "독파모, 새 지표 필요"

김도영 기자 2026. 10. 11. 09:00
자동요약 기사 제목과 주요 문장을 기반으로 자동요약한 결과입니다.
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.

독자 인공지능(AI) 파운데이션 모델의 경쟁력을 벤치마크 점수뿐 아니라 글로벌 개발자의 선택과 산업 현장의 활용으로 검증해야 한다는 지적이 나온다. 평가 종류가 늘어나고 같은 모델도 문항과 채점 방식에 따라 순위가 달라져 단일 벤치마크만으로 실제 성능을 가늠하기 어려워졌기 때문이다.

독자 AI 모델의 평가 방식을 다변화해야 한다는 주장은 기존 벤치마크가 실제 경쟁력을 온전히 보여주기 어렵다는 문제의식에서 출발한다.

음성재생 설정 이동 통신망에서 음성 재생 시 데이터 요금이 발생할 수 있습니다. 글자 수 10,000자 초과 시 일부만 음성으로 제공합니다.
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

기존 평가 빠르게 포화···문항·채점 방식 따라 모델 순위 달라져
업계 "벤치마크가 마케팅이 된 수준"···단일 평가로 성능 판단 어려워
하정우 "글로벌 개발자 선택·산업 활용도 반영"···K-AI 평가 다변화 필요
하정우 국가인공지능전략위원회 상근부위원장이 6일 서울 코엑스에서 열린 'AI 산업 정책 토크쇼'에서 발표하고 있다. / 사진=김도영 기자

[시사저널e=김도영 기자] 독자 인공지능(AI) 파운데이션 모델의 경쟁력을 벤치마크 점수뿐 아니라 글로벌 개발자의 선택과 산업 현장의 활용으로 검증해야 한다는 지적이 나온다. 평가 종류가 늘어나고 같은 모델도 문항과 채점 방식에 따라 순위가 달라져 단일 벤치마크만으로 실제 성능을 가늠하기 어려워졌기 때문이다. 대형 모델 개발에 그치지 않고 경량화와 서비스 적용, 비용·보안까지 평가 범위를 넓혀야 한다는 분석이다.

11일 관련업계에 따르면 정부는 지난해부터 독자 AI 파운데이션 모델 개발에 그래픽처리장치(GPU)와 데이터 등을 지원하며 국산 모델의 성능을 끌어올리는 데 집중해왔다. 하정우 국가인공지능전략위원회 상근부위원장은 지난 6일 서울 코엑스에서 열린 'AI 산업 정책 토크쇼'에서 "빠르게 변화하는 흐름 속에서 앞으로는 성과를 평가하는 기준도 달라져야 한다"며 벤치마크 점수를 넘어 실제 글로벌 경쟁력을 확인할 새로운 지표가 필요하다고 강조했다.

독자 AI 모델의 평가 방식을 다변화해야 한다는 주장은 기존 벤치마크가 실제 경쟁력을 온전히 보여주기 어렵다는 문제의식에서 출발한다. 모델마다 수학과 코딩, 추론, 한국어 등 강점을 보이는 영역이 다르고 평가 문항과 채점 조건도 제각각이다. 기업이 자사에 유리한 결과를 골라 홍보할 수 있다는 지적도 나온다. 한 AI업계 관계자는 "지금 벤치마크 평가가 거의 마케팅이 돼버린 수준"이라며 "기준이나 평가 요소가 워낙 다양하기 때문에 하나의 벤치마크 평가만으로 성능 수준을 가늠할 수 없다"고 말했다.

기존 평가의 변별력도 빠르게 떨어지고 있다. 스탠퍼드대 인간중심AI연구소(HAI)는 'AI 인덱스 2026'에서 모델 발전 속도를 평가 체계가 따라잡지 못하면서 벤치마크 신뢰성을 둘러싼 의문이 커졌다고 분석했다. 수년간 활용할 목적으로 설계된 평가도 불과 몇 달 만에 포화되면서 모델 성능을 구분할 수 있는 기간이 짧아지고 있다는 설명이다.

평가 방식에 따라 모델 순위가 달라질 수 있다는 연구 결과도 나왔다. 2024년 공개된 대규모언어모델(LLM) 벤치마크 민감도 연구에서는 대표적인 언어이해 평가인 MMLU의 객관식 보기 순서와 답변 선택 방식 등을 바꾸자 모델 순위가 최대 8계단 움직였다. 평가 문제와 정답이 모델의 학습데이터에 포함되면 모델이 처음 보는 문제를 풀어낸 것인지, 학습 과정에서 접한 답을 재현한 것인지 구분하기 어렵다는 문제도 있다.

◇벤치마크점수넘어실제선택·활용까지봐야

독자 AI 모델의 경쟁력을 확인하려면 정해진 시험에서 받은 점수와 함께 실제 시장에서 얼마나 선택받는지도 살펴야 한다는 목소리가 나온다. 하 부위원장은 오픈라우터(OpenRouter) 같은 글로벌 AI 플랫폼에서 특정 모델이 얼마나 선택되는지와 개발자 이용량을 새로운 평가 지표로 제시했다. 실제 서비스에서 반복적으로 선택되는 모델은 성능뿐 아니라 활용성과 비용 경쟁력을 갖췄는지 판단할 단서가 될 수 있다.

벤치마크마다 기준과 평가 요소가 다른 만큼 여러 결과를 교차 검증할 필요가 있다. 복수의 벤치마크 결과에 실제 이용량과 추론비용, 보안성을 함께 반영해야 모델의 기술력과 사업성을 제대로 가늠할 수 있다는 분석이다. 하 부위원장은 "최근 AI 해킹 문제가 많아지고 있기 때문에 보안 측면에서 얼마나 안정적인지도 중요한 평가 요소가 될 것"이라고 말했다.

평가 범위는 대형 모델의 자체 성능에서 산업 현장으로 확산할 수 있는지까지 넓어질 필요도 있다. 기업이 실제 업무에 AI를 도입할 때는 크고 성능이 높은 모델보다 필요한 수준을 충족하면서 비용과 응답속도를 낮춘 모델이 적합할 수 있다. 범용 모델의 성능을 유지하면서 크기를 줄이고 산업별 특화 모델로 전환할 수 있는지가 사업성을 좌우하기 때문이다. 하 부위원장은 "거대한 프런티어 모델을 만들고 그 모델을 디스틸레이션해 작은 모델로 확산시키는 구조가 필요하다"며 "큰 모델만 있어서는 실제 산업에 확산시키기 어렵다"고 설명했다.

모델을 실제 서비스로 연결하는 기술도 함께 갖춰야 한다. 하 부위원장은 "또 하나 중요한 것이 하네스(Harness)"라며 "프런티어 모델을 실제 서비스에 적용하려면 에이전트와 각종 솔루션이 함께 패키지로 제공돼야 한다"고 말했다. 모델을 외부 데이터와 도구, 업무 시스템에 연결하는 하네스와 에이전트, 솔루션도 함께 갖춰야 실제 서비스로 이어질 수 있다는 설명이다. 

이에 따라 향후 독파모 사업 성과를 가늠하는 기준도 경량화 이후의 성능과 추론비용, 서비스 적용 실적 등 새로운 지표로 확대될 것으로 전망된다. 하 부위원장은 "독자 파운데이션 모델 사업을 통해 작년에 비해 올해는 모델 성능이 확실히 좋아졌다"며 "문제는 결국 미국과 중국과의 격차다. 우리가 80점짜리 AI만 가지고 경쟁해서는 안 된다"고 말했다. 이어 "자체 프런티어 AI 경쟁력을 키우는 것이 당면 과제"라고 강조했다.

Copyright © 시사저널e 무단전재 및 재배포 금지