“왜 쓰면 답답하지”…구글, 신형 ‘제미나이4’ 놓고 내부 회의론에 고심
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
구글이 차세대 인공지능(AI) 모델 '제미나이4 아르곤(Gemini 4 Argon)'을 일부 파트너에게 공개했지만, 내부에서는 실제 코딩 성능이 벤치마크 점수만큼 나오지 않는다는 평가가 제기됐다.
구글은 제미나이4가 여러 벤치마크에서 최고 수준의 점수를 기록했고, 보안 능력을 측정하는 한 평가에서는 오픈AI의 '아스트라(Astra)' 모델을 앞섰다고 밝혔다.
모델 개발에 관여한 한 구글 직원은 제미나이4가 최첨단 수준이라는 데 회사 내부의 "광범위한 공감대"가 있다고 말했다.
구글은 지난해 11월 '제미나이3'를 공개하며 AI 모델 경쟁에서 반전의 계기를 마련했다는 평가를 받았다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

9월 30일(현지시간) 블룸버그통신에 따르면 구글은 이날 신뢰할 수 있는 소수의 사이버보안 파트너에게 제미나이4를 우선 공개했다. 추가 테스트를 거쳐 유료 이용자부터 사용 범위를 확대할 예정이다.
구글은 제미나이4가 여러 벤치마크에서 최고 수준의 점수를 기록했고, 보안 능력을 측정하는 한 평가에서는 오픈AI의 ‘아스트라(Astra)’ 모델을 앞섰다고 밝혔다.
그러나 개발 과정에 직접 접근한 일부 직원들은 벤치마크 성적과 실제 사용 경험 사이에 차이가 있다고 전했다. 널리 쓰이는 성능평가에서는 좋은 결과를 내지만 일부 코딩 작업에서는 기대에 못 미친다는 것이다.
구글은 제미나이4가 코딩 등에서 기대에 못 미치고 있다는 평가는 부정확하다고 반박했다.
● 시험 점수는 높은데 실전은 다르다?…AI 업계의 ‘벤치맥싱’
블룸버그가 취재한 내부 관계자들에 따르면 제미나이4의 코딩 성능은 작업에 따라 편차가 있었다. 한 관계자는 앱이나 웹사이트의 화면과 사용 경험을 만드는 프런트엔드 디자인 분야에서 특히 강점을 보이지 못했다고 전했다.
AI 코딩 도구 시장에서는 오픈AI와 앤스로픽 등 경쟁사들도 자체 코딩 에이전트와 관련 서비스를 빠르게 확대하고 있다. 구글로서는 실제 개발 업무에서 체감할 수 있는 성능이 중요해진 상황이다.
AI 업계에서는 벤치마크 점수를 끌어올리는 데 개발 역량이 지나치게 집중되는 현상을 ‘벤치맥싱(benchmaxxing)’이라고 부른다. 고객과 기업들이 모델을 비교할 때 벤치마크 점수를 많이 참고하다 보니 실제 제품의 사용성보다 시험 성적에 맞춰 모델을 최적화할 유인이 커진다는 것이다.
AI 스타트업 서지AI의 에드윈 첸 창업자는 벤치마크에 지나치게 의존하면 특정 프로그래밍 언어로 코드를 잘 작성하는 데 집중하게 되고, 실제로 쓰기 편하거나 완성도 높은 애플리케이션을 만드는 능력은 충분히 평가되지 않을 수 있다고 지적했다.
첸은 이를 대학입학시험에 비유했다. 그는 “아이가 SAT에서 아주 좋은 점수를 받았다고 해도 그 점수가 현실에서의 성과로 그대로 이어지는 것은 아니다”라고 말했다.
제미나이4가 모든 영역에서 약하다는 평가가 나온 것은 아니다. 내부 평가를 아는 관계자는 영상에서 메타데이터를 추출하는 등 텍스트 이외의 정보를 처리하는 능력이 강점이라고 전했다. 안전성과 사이버보안, 자연스럽고 명확한 의사소통 능력도 좋은 평가를 받은 것으로 알려졌다.
구글 내부의 의견도 갈린다. 일부 직원들은 앤스로픽의 ‘페이블(Fable)’과 오픈AI의 아스트라가 제미나이보다 빠른 속도로 발전하고 있다고 보고 있다. 반면 제미나이4가 경쟁 모델을 따라잡았고 최첨단 수준에 도달했다는 평가도 있다.
모델 개발에 관여한 한 구글 직원은 제미나이4가 최첨단 수준이라는 데 회사 내부의 “광범위한 공감대”가 있다고 말했다. 복잡하고 정형화되지 않은 실제 코딩 작업에서 제미나이가 약하다는 평가에도 동의하지 않았다.
● 출시 접은 제미나이3.5…훈련비 최대 4억달러
제미나이는 검색과 지도, 지메일, 크롬 등 구글의 핵심 서비스 전반에 쓰이고 있다. 이들 서비스는 각각 이용자가 10억명을 넘는다. 자체 서비스에 AI 모델을 바로 적용할 수 있다는 점은 구글이 경쟁사보다 가진 강점이다.
하지만 오픈AI와 앤스로픽도 모델 판매를 넘어 코딩 에이전트를 비롯한 자체 제품을 내놓으며 이용자와 개발자, 기업 고객을 직접 공략하고 있다. 최첨단 모델 경쟁에서 밀릴 경우 구글의 유통망만으로는 격차를 메우기 어려울 수 있다는 우려가 나오는 이유다.
구글은 지난해 11월 ‘제미나이3’를 공개하며 AI 모델 경쟁에서 반전의 계기를 마련했다는 평가를 받았다. 올해 5월 개발자 행사에서는 ‘제미나이3.5 프로’를 발표하고 다음 달 출시하겠다고 예고했지만, 실제 출시는 이뤄지지 않았다. 블룸버그에 따르면 구글은 이후 해당 모델 개발 계획을 접었다.
대형 모델 하나를 포기하는 데 들어간 비용도 적지 않을 수 있다. 블룸버그인텔리전스의 만딥 싱 애널리스트는 이 정도 규모의 모델을 한 차례 훈련하는 데 최대 4억달러가 들 수 있다고 추산했다. 고액 연봉을 받는 AI 연구진의 인건비는 별도다.
제미나이4 역시 규모가 매우 큰 모델로 알려졌다. 일반적으로 모델이 커질수록 서비스 운영에 필요한 연산 비용도 늘어 수익성에는 부담이 될 수 있다.
구글은 제미나이4가 소프트웨어 엔지니어링과 금융, 법률, 사이버보안 등 길고 복잡한 작업을 수행하도록 설계됐다고 밝혔다. 한 번에 처리할 수 있는 문맥 길이는 최대 100만 토큰으로, 약 75만 단어에 해당한다.
구글 딥마인드의 코라이 카부쿠오글루 책임자는 최근 “나는 팀을 전적으로 신뢰한다”며 “우리가 언제나 최첨단 수준에 있을 것이라는 점은 확실하다”고 말했다.
최현정 기자 phoebe@donga.com
Copyright © 동아일보. All rights reserved. 무단 전재, 재배포 및 AI학습 이용 금지