“세탁물 개고 야채 써는 영상 삽니다”… 로봇 업계는 지금 ‘데이터 확보 전쟁’

김수아 기자 2026. 9. 27. 06:03
자동요약 기사 제목과 주요 문장을 기반으로 자동요약한 결과입니다.
전체 맥락을 이해하기 위해서는 본문 보기를 권장합니다.

27일 로봇업계에 따르면 국내 인공지능(AI) 스타트업인 플리토는 최근 한 채용 플랫폼에 '인간-사물 상호작용 행동 영상 데이터 수집 프리랜서 모집'이라는 제목의 구인 공고를 냈다. 이 업체는 거대언어모델(LLM) 훈련을 위한 사투리와 외국어 등 각종 언어 데이터를 모아 판매하는 곳으로 최근 로봇 학습에 필요한 영상 데이터를 수집하고 있다.

또 제조 현장부터 교육, 의료, 금융, 바이오 등 각 산업에 투입할 AI 학습에 필요한 데이터를 수집하기 위한 구체적인 방안도 제시했다.

음성재생 설정 이동 통신망에서 음성 재생 시 데이터 요금이 발생할 수 있습니다. 글자 수 10,000자 초과 시 일부만 음성으로 제공합니다.
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

中, 정부 주도로 데이터 체계 구축
美는 민간 기업들이 자체 확보

가정이나 산업 현장 등에 투입되는 휴머노이드(인간형 로봇)‘의 성능을 높이기 위한 데이터 확보 경쟁이 가열되고 있다. 미국은 대기업을 중심으로, 중국은 국가가 주도해 데이터 확보에 나선 가운데 한국도 최근 관련 예산을 편성하고 인프라를 구축하기 시작했다.

글로벌 인공지능(AI) 데이터 기업 '포세이돈 에이아이' 데이터 수집 서비스 '누모(Numo)'를 통해 수집하고 있는 1인칭 시점의 행동 데이터 영상./ 포세이돈 에이아이 제공

◇ 1000시간 가사노동 영상 구하는 로봇업체들

27일 로봇업계에 따르면 국내 인공지능(AI) 스타트업인 플리토는 최근 한 채용 플랫폼에 ‘인간-사물 상호작용 행동 영상 데이터 수집 프리랜서 모집’이라는 제목의 구인 공고를 냈다. 이 업체는 거대언어모델(LLM) 훈련을 위한 사투리와 외국어 등 각종 언어 데이터를 모아 판매하는 곳으로 최근 로봇 학습에 필요한 영상 데이터를 수집하고 있다.

플리토가 구인 글을 올린 것은 고객사들로부터 휴머노이드 학습에 필요한 데이터 공급 요청이 늘어난 데 따른 조치로 풀이된다. 이번 프로젝트 참여자들은 머리에 거치 장비를 쓰고 카메라를 단 상태에서 일상 속 다양한 물체를 조작하는 영상을 촬영해야 한다.

이는 인간과 유사한 형태인 휴머노이드의 ‘에고센트릭(Egocentric) 모방 학습’을 위한 것이다. 휴머노이드는 팔과 손이 촬영된 영상을 통해 추출된 정보를 기반으로 로봇의 입장에서 모터를 어느 정도 움직여야 하는지 판단하게 된다.

인공지능(AI) 스타트업 ‘플리토(Flitto)'가 수집하고 있는 ‘인간-사물 상호작용 행동 영상 데이터의 일부. 해당 데이터는 로봇 두뇌 역할을 하는 인공지능(AI) 학습에 활용된다./ 플리토 제공

휴머노이드 학습을 위한 영상 데이터는 많이 수집할 수록 좋다고 한다. 많은 경우의 수를 학습할수록 실제 환경에서 안정적인 움직임을 구현할 수 있기 때문이다. 로봇 학습에 컴퓨터 가상 환경으로 구현한 ‘합성데이터’도 쓰이지만, 업계에서는 로봇의 정교한 움직임을 구현하기 위해서는 여전히 ‘현실(Physical World) 데이터’가 중요하다고 입을 모은다.

특히 가정 환경과 공장에 휴머노이드를 도입하는 단계에서 현실 데이터는 더욱 중요하게 쓰인다. 휴머노이드가 실제 가정이나 공장에서 사람처럼 움직이기 위해서는 ‘암묵지 데이터’를 학습하는 것이 관건이다. 암묵지 데이터는 채소의 크기나 강도에 따라 칼을 어느 정도 세기로 쥐는지, 용접공이 용접봉의 각도를 어떻게 전달하는지 등 경험에 따라 축적되는 정보를 뜻한다.

실제로 로봇 제조사들은 방대한 규모의 데이터를 쌓고 있다. 데이터 수집 서비스 ‘누모‘를 운영하고 있는 기업인 포세이돈AI는 최근 고객사로부터 1000시간 분량의 가사노동 데이터 수집 요청을 받았다. 업체 관계자는 “서비스 개시 두 달여 만에 많은 기업으로부터 데이터 수집 요청이 들어오고 있다”며 “이들이 요구하는 데이터 수집 규모도 매우 크다”고 말했다.

구하기 힘든 영상일수록 데이터 판매 가격도 높다고 한다. 미국 데이터 수집·가공 업체 덱스셋에 따르면 가장 기본적인 에고센트릭 모방학습 흑백 영상 데이터는 시간당 약 18~34달러에 거래된다. 센서가 탑재된 장비를 활용해 손가락의 힘과 압력이 기록된 텍타일 데이터는 55~95달러에 거래되는 것으로 나타났다.

최병호 고려대 AI연구소 교수는 “데이터는 많으면 많을수록 좋은데 국내에서는 규제로 인해 데이터를 확보하기 어렵기 때문에 민간에서 사고 파는 경우가 많다”며 “가사노동 로봇의 기술 개발 난이도가 가장 높은데, 이 같은 데이터를 확보하는 것이 어렵기 때문”이라고 설명했다.

미국 휴머노이드 기업 ‘피겨AI(Figure AI)’가 지난달 자체적인 데이터 확보를 위한 데이터 수집 앱 ‘인덱스(Index)’를 개발했다고 밝혔다./ ‘피겨AI(Figure AI)' 홈페이지 캡처

◇中은 국가 주도·美 대기업 중심… 韓도 인프라 구축 첫 발

휴머노이드 로봇 주도권을 다투는 미국과 중국에서는 데이터 확보를 위한 적극적인 행보가 이어지고 있다.

중국 정부는 지난 6월 ‘휴머노이드 로봇·AI 훈련을 위한 특별 실행 계획’을 발표하고 휴머노이드 성능 향상을 위한 데이터 축적 방안을 발표했다. 국가 주도로 실제 현장을 데이터 학습 공간으로 지정하고, 현장을 제공하는 기업이 로봇 제조사에 데이터와 환경 관련 정보를 제공하도록 했다.

또 제조 현장부터 교육, 의료, 금융, 바이오 등 각 산업에 투입할 AI 학습에 필요한 데이터를 수집하기 위한 구체적인 방안도 제시했다. AI 성능 향상을 목표로 데이터 수집부터 정제·가공, 품질 검사 등 데이터 생애주기를 관리해 고품질 데이터를 구축하도록 했다. 중국은 현재 상하이와 베이징 등 주요 도시에 90여 곳의 휴머노이드 데이터 훈련센터를 운영하거나 건설하고 있다.

미국은 기업이 중심이 되고 있다. 미국 휴머노이드 기업 피겨AI는 데이터 수집 앱 ‘인덱스’를 개발해 지금껏 약 1600만개의 영상을 확보했다고 밝혔다. 휴머노이드 ‘옵티머스’를 제조하는 테슬라는 자동차 공장을 활용해 로봇을 학습시키고 있다.

국내에서도 최근 데이터 확보를 위한 인프라 구축이 진행되고 있다. 산업통상부는 내년 1158억원을 투입해 국가 제조데이터 라이브러리 구축할 예정이다. 과학기술정보통신부도 400억원을 들여 피지컬AI 트레이닝센터를 만들기로 했다. LG전자는 서울 서초구에 로봇 학습용 데이터팩토리를 구축하고 연내 로봇을 투입하겠다는 계획을 밝혔다.

최병호 교수는 “한국은 다양한 분야의 제조업 경쟁력이 높기 때문에 휴머노이드 개발을 위한 데이터 확보에도 유리하다”며 “정부가 나서서 데이터를 확보하기 위한 투자에 더 적극적으로 나설 필요가 있다”고 말했다.

- Copyright ⓒ 조선비즈 & Chosun.com -

Copyright © 조선비즈. 무단전재 및 재배포 금지.