“긴 답변 대신 필요한 판단만”… 개발자들 열광한 ‘제브’ 뭐길래
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.
긴 답변 대신 필요한 판단만 내놓는 인공지능(AI) 모델 '제브(Jev)'의 사용이 개발자들 사이에서 빠르게 확산하고 있다.
랭퓨즈는 에이전트·도구 라우팅, 문서·문의 분류, 사람의 검토가 필요한지를 판단하는 에스컬레이션, AI 결과 평가 등을 제브의 활용처로 꼽았다.
타입세이프AI가 이 같은 사례와 함께 제브를 공개한 지 이제 일주일 남짓 지났지만, 개발자들의 활용 실험은 빠르게 늘고 있다.
이승현 라이너 에반젤리스트는 "제브의 의미는 에이전트가 반복하는 중간 판단을 범용 LLM에서 떼어내 싸고 빠르게 처리할 수 있다는 데 있다"며 "다만 제브도 판단 자체를 틀릴 수 있는 만큼 모델 호출 비용만 볼 게 아니라 오판에 따른 손실과 사람의 검토 비용까지 포함한 전체 자동화 비용을 따져봐야 한다"고 평가했다.
이 글자크기로 변경됩니다.
(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.
버셀서 역대 가장 빠른 초기 채택…개발자 활용 실험 잇따라
긴 답변 대신 필요한 판단만 내놓는 인공지능(AI) 모델 '제브(Jev)'의 사용이 개발자들 사이에서 빠르게 확산하고 있다. 버셀(Vercel) AI 게이트웨이에 공개된 지 24시간 만에 유료 이용팀의 약 13%가 사용해 역대 가장 빠른 초기 채택 속도를 기록했다. 공개된 성능 수치치에 따르면 기존 프런티어 대형언어모델(LLM)은 응답에 3~329초, 입력 100만토큰당 0.20~10달러가 드는 데 비해 제브는 70~500밀리초, 0.042달러 수준이다. 예·아니오 같은 짧은 판단 하나를 얻기 위해 매번 LLM을 호출하던 개발자들이 주목한 이유다.

"예·아니오 하나 얻자고 LLM 부르는 건 비효율"
제브와 기존 LLM의 차이는 답을 내놓는 방식을 보면 이해하기 쉽다. LLM에 고객 문의를 주고 "환불 요청인가"라고 물으면 질문을 이해한 뒤 그에 맞는 답변 문장을 만들어낸다. 프로그램에 필요한 것이 환불·교환·배송 가운데 하나를 고르는 단순한 판단이어도 답변을 생성하는 과정은 거친다.
제브는 이런 문장을 만들지 않는다. 자연어로 주어진 상황을 읽은 뒤 개발자가 미리 정한 선택지 가운데 하나를 고르거나 점수를 매기고, 예·아니오를 판단한다. 각 결과의 확률도 함께 반환한다.
AI 애플리케이션 평가·관측 플랫폼 기업 랭퓨즈(Langfuse)는 그동안 이런 판단에도 LLM이 정해진 형식으로 답하도록 따로 설정해야 했다고 설명했다. 랭퓨즈의 아나벨 셰퍼(Annabell Schäfer) 그로스 엔지니어는 "예·아니오 하나를 얻기 위해서도 생성 비용을 지불해왔다"며 "제브는 라우팅이나 분류, 평가처럼 답의 범위가 정해진 반복적인 판단에 적합하다"고 평했다.
타입세이프AI는 하나의 입력을 두고 여러 판단을 동시에 처리할 수 있도록 별도의 모델 구조와 병렬 처리 방식을 적용했다. 예를 들어 고객 문의 하나를 읽고 '환불 요청인가', '긴급한가', '사람의 검토가 필요한가'를 한꺼번에 판단하는 식이다.
제브가 내놓는 확률값의 신뢰도를 높이기 위해 '보정된 결정을 위한 강화학습(RLCD·Reinforcement Learning for Calibrated Decisions)'이라는 방법도 개발했다. 제브가 어떤 판단에 80%의 확률을 제시했다면 비슷한 판단을 반복했을 때 실제 정답률도 80% 수준이 되도록 학습시키는 방식이다. 개발자는 이 확률을 기준으로 자동 처리할지 사람에게 검토를 넘길지를 정할 수 있다.
이 같은 구조는 AI 에이전트에 효과적이다. AI 에이전트는 어떤 도구를 사용할지, 결과를 사람이 검토해야 하는지, 작업이 제대로 끝났는지 등을 단계마다 결정해야 한다. 기존에는 이런 판단에도 LLM을 반복 호출해야 해 토큰 사용량과 비용이 늘어나기 쉬웠다. 제브가 이런 판단을 빠르고 저렴하게 처리할 수 있다는 점에서 AI 에이전트의 운영 부담을 줄일 수 있다는 평가가 나온다. 랭퓨즈는 에이전트·도구 라우팅, 문서·문의 분류, 사람의 검토가 필요한지를 판단하는 에스컬레이션, AI 결과 평가 등을 제브의 활용처로 꼽았다.
'둠' 플레이부터 AI 평가까지…제브 활용 실험 잇따라
개발사인 타입세이프AI는 제브를 게임 '둠(Doom)'에 적용한 실험을 공개했다. 게임 화면을 직접 보여주는 대신 현재 위치와 주변 상황 등을 텍스트로 전달하면 제브가 이동과 공격 등 다음 행동을 결정하도록 했다. 초당 10번씩 제브를 호출했지만 회사가 계산한 비용은 시간당 약 7달러에 불과했다. 타입세이프AI는 일반적인 게임 봇이 더 잘 플레이할 수 있다면서도, 빠른 판단을 반복해야 하는 실시간 환경에서 AI를 계속 호출할 수 있다는 점에 의미를 뒀다.
타입세이프AI는 위키피디아 링크만 따라 출발 문서에서 목표 문서까지 찾아가는 '위키레이싱(Wikiracing)'에도 제브를 적용했다. 문서를 하나 열 때마다 수백개에서 수천개의 링크 가운데 다음에 누를 링크를 골라야 하는 방식이다. 제브는 일부 비교 대상 LLM보다 더 적은 단계를 거쳐 목표 문서에 도달하는 경향을 보였다. 다만 비교에 사용한 LLM 대부분은 추론 기능을 끈 상태였으며, 타입세이프AI도 추론 기능을 사용하면 결과가 달라질 수 있다고 설명했다.
타입세이프AI가 이 같은 사례와 함께 제브를 공개한 지 이제 일주일 남짓 지났지만, 개발자들의 활용 실험은 빠르게 늘고 있다.
웹 자동화 업체 브라우저 유즈(Browser Use)는 제브의 빠른 판단 능력을 브라우저 에이전트에 적용한 '제브 울트라패스트(Jev Ultrafast)'를 공개했다. 제브가 웹페이지에서 다음 행동과 조작할 요소를 판단하고, 실제 문자를 입력해야 할 때만 별도의 소형 LLM을 호출하는 방식이다. 구글 항공편 검색 시험에서는 작업시간 중앙값이 9.45초에서 7.09초로 25% 줄었고, 제브 호출시간 중앙값은 178밀리초였다. 다만 동일 작업을 세 차례씩 비교한 소규모 시험이며 코드 최적화도 함께 적용됐다.
AI가 만든 결과를 검사하는 데도 제브를 활용할 수 있다. 랭퓨즈는 에이전트 실행 결과를 제브에 넣어 사람이 다시 살펴봐야 하는지, 실패가 얼마나 심각한지, 어떤 유형의 실패인지 등을 동시에 판단하는 사례를 공개했다. 평가 항목마다 별도의 답변을 생성하게 하는 대신 항목별 판단과 확률을 한꺼번에 받아 처리하는 방식이다.
이밖에도 개발자들은 제브를 이메일 분류, 코딩 에이전트, 투자, 콘텐츠 분석 등에 적용하고 있다. 이메일 500건을 수초 만에 분류하는 데 3.5센트가 들었고, X 게시물 10만건을 14개 기준으로 분석하는 데는 20.4초와 0.67달러가 소요됐다는 사례가 공개됐다. 클로드 코드의 긴 작업 기록에서 필요한 내용만 제브가 골라 남기는 플러그인도 나왔다. 약 100만토큰의 기록을 8만6000토큰 수준으로 추리는 데 1초 남짓 걸렸다는 설명이다. 블록체인에서는 새 블록이 생성될 때마다 제브가 매수·매도를 결정하도록 한 자동매매 실험도 등장했다. 한 차례 판단에는 81밀리초가 걸렸다.
판단 빠르지만 설명 못해 한계도 뚜렷…전체 비용 따져야
다만 제브는 특정 판단 작업에 특화된 모델민 만큼 한계도 뚜렷하다. 글이나 코드, 요약문을 만들 수 없고 왜 그런 판단을 내렸는지도 설명하지 않는다. 답을 보류하는 기능도 없어 적절한 선택지가 없으면 주어진 답 가운데 하나를 골라야 한다. 질문과 관계없는 정보가 입력에 많아질수록 정확도가 떨어질 수도 있다. 랭퓨즈의 아나벨 셰퍼 엔지니어는 "판단 근거가 필요한 감사나 고객 대응 업무에서는 생성형 모델을 함께 활용할 필요가 있다"고 첨언했다.
이승현 라이너 에반젤리스트는 "제브의 의미는 에이전트가 반복하는 중간 판단을 범용 LLM에서 떼어내 싸고 빠르게 처리할 수 있다는 데 있다"며 "다만 제브도 판단 자체를 틀릴 수 있는 만큼 모델 호출 비용만 볼 게 아니라 오판에 따른 손실과 사람의 검토 비용까지 포함한 전체 자동화 비용을 따져봐야 한다"고 평가했다.
디오고 알메이다 타입세이프AI 대표는 "제브는 아직 초기 단계로 앞으로 더 많은 것을 내놓을 계획"이라며 "어떤 결정을 자동화해야 하는지, 어디서 제브가 잘 작동하고 부족한지 개발자들의 의견을 듣겠다"고 밝혔다.
정종길 기자
jk2@chosunbiz.com
Copyright © IT조선. 무단전재 및 재배포 금지.