GPU 기반 AI 모델 최적화 연구서 초기 성과 온디바이스 AI서 서버 GPU 환경으로 협력 확대 전력·GPU 사용 줄이고 AI 서비스 운영 효율 높여
이상엽 LG유플러스 CTO(전무, 왼쪽)와 이재호 옵트에이아이 대표가 토큰 최적화 협력과 관련해 기념촬영을 하는 모습/제공=LG유플러스
LG유플러스가 인공지능(AI) 모델 최적화 전문기업 옵트에이아이와 AI 토큰 처리 효율을 높이는 기술 개발에 나선다. 같은 GPU에서 처리할 수 있는 토큰량을 기존 대비 최대 4배 높이는 초기 성과도 확보했다.
LG유플러스는 옵트에이아이와 AI 운영 효율을 높이기 위한 '토큰 최적화' 기술을 공동 연구한다고 2일 밝혔다.
토큰은 AI가 이용자의 질문을 이해하고 답변을 생성할 때 처리하는 데이터의 기본 단위다. 토큰 최적화는 AI 모델의 크기와 연산량을 줄여 같은 GPU 자원으로 더 많은 요청을 처리하도록 만드는 기술이다.
AI 서비스 이용이 늘면서 GPU와 전력 사용량도 함께 증가하자 업계에서는 모델 성능뿐 아니라 같은 자원으로 얼마나 많은 연산을 처리할 수 있는지가 주요 과제로 떠오르고 있다.
LG유플러스는 실제 AI 서비스 운영 환경에서 기술 검증과 적용을 맡고, 옵트에이아이는 AI 모델 경량화와 연산 최적화 기술을 개발한다.
양사는 현재 GPU 기반 AI 모델의 답변 생성 과정을 최적화하는 연구를 진행하고 있다. LG유플러스에 따르면 같은 GPU에서 처리할 수 있는 토큰량을 기존 대비 최대 4배까지 높이는 성과를 냈다.
향후에는 대규모 AI 서비스가 운영되는 서버 GPU 환경까지 공동 연구 범위를 넓혀 GPU와 전력 사용량을 줄이면서 응답 속도와 서비스 품질을 유지하는 기술을 개발할 계획이다.
양사는 앞서 온디바이스 AI 분야에서도 협력했다. LG유플러스는 엑사원(EXAONE) 기반 소형언어모델(sLM)에 경량화 기술을 적용해 스마트폰 NPU에서 구동할 수 있도록 했다. 기존 CPU 방식과 같은 수준의 성능을 유지하면서 전력 소모는 78%, 모델 크기는 82% 줄였다고 회사 측은 설명했다.
LG유플러스와 옵트에이아이는 지난 1일 'Efficient AI 테크 세미나'도 공동 개최했다. 행사에는 퓨리오사AI, 베슬에이아이, 한국전자기술연구원(KETI), 한양대학교 등이 참여해 AI 모델 최적화와 AI 반도체, 서비스 적용 사례 등을 공유했다.
LG유플러스는 공동 연구를 통해 확보한 기술을 자사 AI 서비스와 대규모 AI 인프라에 단계적으로 적용할 예정이다.
이상엽 LG유플러스 CTO는 "AI 경쟁력은 같은 자원으로 얼마나 많은 토큰을 효율적으로 처리할 수 있느냐에 달려 있다"며 "옵트에이아이를 비롯한 다양한 파트너들과 토큰 최적화 기술 연구를 확대하고 실제 서비스에 적용할 수 있는 성과를 만들겠다"고 말했다.
이재호 옵트에이아이 대표는 "생성형 AI 시대에는 높은 성능만큼 운영 효율 확보도 중요하다"며 "실제 서비스 환경에서 검증할 수 있는 AI 최적화 기술을 고도화하겠다"고 말했다.