KAIST, AI 숨은 취약점 7배 더 찾는 안전성 검증 기술 개발
![김준모 한국과학기술원 교수 [사진=KAIST]](https://img3.daumcdn.net/thumb/R658x0.q70/?fname=https://t1.daumcdn.net/news/202607/30/552779-26fvic8/20260730152049705aawo.jpg)
한국과학기술원(KAIST) 연구진이 인공지능(AI) 숨은 취약점을 기존보다 약 7배 더 다양하게 찾아내는 안전성 검증 기술을 개발했다.
KAIST는 김준모 전기및전자공학부 교수 연구팀이 거대언어모델(LLM) 안전성을 검증하는 레드팀 기술의 한계를 개선한 새로운 프레임워크 '스테이블-지플로우넷(Stable-GFlowNet)'을 개발했다고 30일 밝혔다.
레드팀은 생성형 AI가 유해하거나 위험한 답변을 하도록 공격 프롬프트를 입력해 모델의 숨은 취약점을 찾아내는 안전성 검증 기법이다. 다양한 공격 유형을 발굴할수록 더 많은 취약점을 사전에 제거할 수 있어 공격 성공률과 공격 다양성이 모두 중요한 평가 요소로 꼽힌다.
기존 레드팀 기술은 강화학습 기반으로 공격 성공률은 높았지만 다양한 공격 유형을 찾는 데 한계가 있었다. 반면 생성 흐름 네트워크(GFlowNet)는 공격 다양성은 뛰어나지만 학습이 불안정한 문제가 있었다. 연구팀은 GFlowNet을 거대언어모델(LLM)에 적용해 학습 안정성을 높이고 다양한 취약점을 효과적으로 발굴하는 데 성공했다.
연구팀은 이를 해결하기 위해 △학습 과정을 안정화하는 '대조 궤적 균형(CTB)' △불필요한 정보를 제거하는 '노이즈 경사 가지치기(NGP)' △자연스러운 공격 프롬프트를 생성하도록 돕는 '유창성 안정화 장치(MKS)' 등 세 가지 핵심 기술을 개발했다.
그 결과 스테이블-지플로우넷은 기존 기술이 찾아낸 17개의 고유 공격 유형보다 약 7배 많은 134개의 공격 유형을 발굴하면서도 92%의 높은 공격 성공률을 유지했다. 해당 기술로 학습한 방어 모델은 서로 다른 공격 기법을 활용한 교차 공격 평가에서도 다양한 공격을 효과적으로 방어하며 높은 일반화 성능을 입증했다.
연구팀은 이번 기술이 신약 후보 물질을 설계하는 분자 생성 등 다양한 AI 생성 분야에서도 활용될 수 있을 것으로 기대했다.
김 교수는 "이번 기술은 적은 데이터와 잡음이 많은 환경에서도 AI의 다양한 취약점을 안정적으로 찾아낼 수 있다는 점에서 의미가 있다"며 "생성형 AI를 실제 서비스에 적용하기 전 더 폭넓은 위험 요소를 찾아내고 방어할 수 있어 안전하고 신뢰할 수 있는 AI 개발의 핵심 기반 기술이 될 것"이라고 말했다.
- 논산시 중학생 80명, KAIST서 AI·코딩 역량 키웠다 | 아주경제
- KAIST·엔비디아, AI 공동연구소 설립…5년간 4200억원 투입 | 아주경제
- SK인텔릭스, KAIST와 맞손…'나무엑스' 기반 AI 정신건강 서비스 고도화 | 아주경제
- 태양만으로 하루 6L 식수…배상민 KAIST 교수, 레드닷 최고상 수상 | 아주경제
- 이대영 KAIST 교수 "종이접기 기반 그리퍼, 우주 넘어 산업 현장으로" | 아주경제
- KAIST, 제18대 총장에 배충식 교수 선임 | 아주경제
- 정장선 평택시장, KAIST 방문..."카이스트 협력 관계 이어지길" | 아주경제
- "냉각 전력 10분의 1로"…KAIST, AI 반도체 발열 잡았다 | 아주경제
- 정장선 평택시장, KAIST 이광형 총장에 감사패 전달..."평택캠퍼스 조성 협력에 감사" | 아주경제