서강대 연구팀, LLM 강화학습 효율 높이는 데이터 재활용법 개발

서강대학교 인공지능학과 장두성 교수 연구팀이 대규모언어모델(LLM) 강화학습에서 기존 학습 경험을 선별적으로 재활용하는 기법을 개발했다. 박현빈 석사과정생이 참여한 논문 ‘Headroom-Drift Replay: A Primitive for Principled Replay Control in GRPO’는 국제학술대회 ‘Conference on Language Modeling(COLM) 2026’에 채택됐다.
기존 LLM 강화학습은 학습 과정마다 새로운 응답이나 문제 해결 과정을 생성해야 해 계산 비용과 시간이 많이 든다. 연구팀은 과거 경험 가운데 추가 학습 가치가 남아 있는지를 뜻하는 ‘Headroom’과 현재 모델에서도 안정적으로 활용할 수 있는지를 나타내는 ‘Policy Drift’를 함께 고려해 재사용할 데이터를 선별하는 Headroom-Drift Replay 기법을 제안했다.
수학·멀티모달 추론과 에이전틱 검색(Agentic Search) 환경에서 실험한 결과 기존 데이터를 단순 재사용하는 방식보다 높은 성능을 보였다고 연구팀은 설명했다. 특히 에이전틱 검색에서는 새로운 데이터를 추가 생성하는 방식보다 높은 성능을 기록하면서 학습 단계당 소요 시간을 197.2초에서 166.3초로 줄였다.
한편 이번 연구는 과학기술정보통신부와 정보통신산업진흥원(NIPA)의 Sovereign AI Foundation Model Project, 정보통신기획평가원(IITP)의 Top-Tier AI Global HRD Invitation Program 지원을 받아 수행됐다.
논문은 10월 6일(현지 시간)부터 9일까지 미국 샌프란시스코에서 열리는 COLM 2026에서 발표될 예정이다.
김나혜 인턴기자 kim.nahye1@joongang.co.kr
Copyright © 중앙일보. 무단전재 및 재배포 금지.
- “당뇨·치매 막는다” 92세 과학자, 믹스커피에 매일 타먹는 것 | 중앙일보
- “쌤과 그 여관 못잊어”…유부남 S대 교사와 여중생 충격 사건 | 중앙일보
- 33살에 50억 만들었다…88년생 ‘노을’ 첫 언론 인터뷰 | 중앙일보
- “여행도 따라가 드려요”…태국서 뜨는 ‘시간당 4만원’ 서비스 | 중앙일보
- “저 여자예요” 여탕 들어가 나체 훔쳐본 20대 남성…처음 아니었다 | 중앙일보
- 회기 중 여성과 호텔 간 광명시의원…“사생활 있는 것 아니냐” | 중앙일보
- “모피 걸친 김주애 본 아이들, 분노했다”…탈북민 전한 북한 민심 | 중앙일보
- 믿었던 HBM 마저…중국이 다 쫓아왔다 [중국 반도체 공습] | 중앙일보
- 170만부 작가도 ‘사재기’ 재판행…韓 베스트셀러 추한 민낯 | 중앙일보
- ‘한 잔’ 생각도 없앤 비만약…최악 불황에 위스키 왕국 와르르 | 중앙일보