1.6조 쏟아부은 공공 AI 학습데이터, 내용 중복에 부실

조동주 기자 2026. 8. 12. 17:02
자동요약 기사 제목과 주요 문장을 기반으로 자동요약한 결과입니다.
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.

정부가 9년 동안 1조6000억 원 넘는 세금을 투입한 인공지능(AI) 학습용 데이터가 중복되고 품질 관리도 부실했던 것으로 감사원 감사 결과 밝혀졌다.

감사원에 따르면 개별 기관들은 각각 수억 원을 들여 과기부가 구축한 AI허브에 올라와 있는 것과 비슷한 데이터를 중복 생산해왔다.

음성재생 설정 이동 통신망에서 음성 재생 시 데이터 요금이 발생할 수 있습니다. 글자 수 10,000자 초과 시 일부만 음성으로 제공합니다.
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

서울 종로구 감사원의 모습. 2026.1.5/뉴스1
정부가 9년 동안 1조6000억 원 넘는 세금을 투입한 인공지능(AI) 학습용 데이터가 중복되고 품질 관리도 부실했던 것으로 감사원 감사 결과 밝혀졌다. 과학기술정보통신부가 이미 데이터를 만들어놨는데도 다른 기관들이 확인 없이 또 세금을 들여 비슷한 데이터를 만들었고 일부 데이터는 AI가 인식할 수 없을 만큼 조악했다.

감사원은 과기부가 2017년부터 1조6328억여 원을 들여 국가AI개발지원 플랫폼 ‘AI허브’에 공개 중인 AI 학습용 데이터 908종과 국가·공공기관 지방자치단체 26곳이 각각 따로 구축한 데이터 313종을 분석한 감사 결과를 12일 공개했다.

감사원에 따르면 개별 기관들은 각각 수억 원을 들여 과기부가 구축한 AI허브에 올라와 있는 것과 비슷한 데이터를 중복 생산해왔다. 예를 들어 한국도로공사가 2022년 ‘로드킬’ 예방을 위해 구축한 야생동물 12종의 학습용 데이터 6만 장 중 42%(2.5만 장)는 2021년 과기부가 생산한 데이터와 유사했다. 대전 서구가 지난해 만든 생활폐기물 데이터 9000장 중 58%(5200장)도 과기부가 5년 전 만든 데이터와 흡사했다.

과기부와 개별 기관들이 서로 데이터 구축 계획을 공유하지 않다보니 같은 기간에 같은 데이터를 만들기도 했다. 과기부는 2021~2023년 알약, 구강, 자율주행 관련 데이터 3종을 구축하는 데 233억 원을 들였는데, 같은 기간 식품의약품안전처 등 3개 기관도 8억4000만 원을 들여 비슷한 데이터를 만들고 있었다.

개별 기관 중 일부는 품질관리 기준과 품질검증 절차가 없어 세금을 들이고도 부실한 결과물을 냈다. 한국도로공사가 지난해 구축한 ‘도로주행 폐쇄회로(CC)TV 학습데이터셋’은 AI가 학습 대상을 인식하는 정보인 ‘어노테이션 정보’에 차량별 위치정보를 누락해 자율주행 기술 개발 용도로 쓸 수 없는 것으로 드러났다. 데이터에 CCTV 속 차량의 위치 좌표를 입력하지 않아 AI가 해당 데이터가 차량인지 인식할 수 없었던 것. 서울시가 2020년 구축한 대형폐기물 학습데이터에는 박스나 탁자 이미지의 파일명이 ‘가방’으로 돼있는 등 데이터 2303장 중 23.4%(538장)가 파일명과 실제 이미지가 달랐다.

조동주 기자 djc@donga.com

Copyright © 동아일보. All rights reserved. 무단 전재, 재배포 및 AI학습 이용 금지