[현장] B200 7656장 구축한 NHN클라우드 ‘팩토리X 서울’…고밀도 GPU가 바꾼 설계

이안나 기자 2026. 8. 7. 09:00
음성재생 설정 이동 통신망에서 음성 재생 시 데이터 요금이 발생할 수 있습니다. 글자 수 10,000자 초과 시 일부만 음성으로 제공합니다.
번역beta Translated by kaka i
글자크기 설정 파란원을 좌우로 움직이시면 글자크기가 변경 됩니다.

이 글자크기로 변경됩니다.

(예시) 가장 빠른 뉴스가 있고 다양한 정보, 쌍방향 소통이 숨쉬는 다음뉴스를 만나보세요. 다음뉴스는 국내외 주요이슈와 실시간 속보, 문화생활 및 다양한 분야의 뉴스를 입체적으로 전달하고 있습니다.

- 정부 활용분 6120장 중 대규모 수요는 독자 AI 파운데이션 모델 중심

- NHN클라우드 활용분 1536장 계약 완료…전체 GPU 인프라에 수랭 적용

[디지털데일리 이안나기자] 6일 서울 영등포구 양평동 인공지능(AI) 데이터센터 ‘NHN 팩토리X(FactoryX) 서울’. 건물 6층 데이터홀에는 사람 키보다 높은 검은색 서버 랙이 양옆으로 늘어서 있었다. 랙 상부에는 굵은 수랭 배관이 이어졌고 후면에는 냉매 호스와 전력·통신 케이블이 촘촘하게 연결돼 있었다.

이곳은 NHN클라우드가 활용할 엔비디아 B200 그래픽처리장치(GPU) 1536장이 설치된 공간이다. 랙 한 대에는 B200 GPU 서버 6대가 밀집 배치됐다. 서버와 네트워크 장비 팬이 계속 돌아갔지만 옆 사람의 설명을 듣고 대화를 나누는 데 큰 어려움은 없었다.

이날 현장을 안내한 이일준 NHN클라우드 기술사업부장(이사)은 “B200은 공랭식과 수랭식이 모두 있지만 이곳은 CPU와 GPU 냉각을 모두 수랭식으로 구성했다”고 설명했다. CPU와 GPU에서 발생하는 열 대부분을 액체로 제거해 공랭 설비가 처리해야 할 발열을 줄인 것이다.

NHN 팩토리X 서울은 정부가 지난해 추진한 ‘AI컴퓨팅자원 활용기반 강화사업’으로 확보한 GPU 인프라가 구축된 곳이다. 과학기술정보통신부는 네이버클라우드·NHN클라우드·카카오를 사업자로 선정해 총 1만3000여장의 첨단 GPU를 확보했다. NHN클라우드는 이 가운데 가장 많은 B200 7656장을 맡았다.

NHN클라우드는 지난해 8월 민간 데이터센터 4개 층을 임차해 GPU 서버와 전력·냉각·네트워크 설비를 구축하고 올해 4월 서비스를 시작했다. 양평 데이터센터 전체 IT 장비용 전력 용량은 26메가와트(㎿)이며 NHN클라우드는 절반인 13㎿를 사용한다.

팩토리X 서울은 NHN클라우드가 민간 데이터센터를 임차해 국가 소유 GPU 인프라를 운영하는 구조다. 정부 사업비로 도입한 B200 서버와 네트워크 장비는 국가 자산이며, NHN클라우드는 장비 도입과 아키텍처 설계·구축을 맡아 협약에 따라 5년간 운영한다.

전체 B200 가운데 80%인 6120장은 정부가 산업계와 대학, 연구기관 등에 제공한다. 나머지 20%인 1536장은 NHN클라우드가 이용권을 갖는다. 정부가 데이터센터 임차료와 전기료, 운영 인력 비용을 별도로 지급하지 않는 대신 NHN클라우드가 해당 자원을 자체 연구개발이나 외부 공급에 활용해 운영비를 충당하는 방식이다.

정부 활용분은 3층부터 5층에 배치됐다. 3·4층에는 서버 510대와 B200 4080장을 하나로 연결한 ‘NIPA-CL1’이 구축됐다. 여러 GPU가 동시에 데이터를 주고받는 대규모 AI 모델 학습에 대응하기 위해 두 개 층의 서버를 하나의 클러스터로 묶었다. 5층에는 서버 255대와 B200 2040장으로 구성된 ‘NIPA-CL2’가 있다.

NIPA-CL1은 지난 6월 발표된 글로벌 슈퍼컴퓨터 성능 순위 ‘톱500’에서 20위에 올랐다. 실측 최고 성능은 137.4페타플롭스(PF)로 국내 시스템 가운데 가장 높았다. NIPA-CL2는 68.42PF를 기록해 세계 40위에 이름을 올렸다.

클러스터 규모가 크다고 모든 이용자가 수백·수천장의 GPU를 한꺼번에 요청하는 것은 아니다. 대규모 자원이 필요한 수요는 정부의 독자 AI 파운데이션 모델 프로젝트에 집중되고, 일반 기업과 대학·연구기관은 상대적으로 작은 단위로 자원을 이용한다.

이 이사는 “독자 AI 파운데이션 모델 사업은 한 기업이 막대한 자원을 필요로 한다”며 “일반 산·학·연은 정말 많이 요청하는 곳이 서버 32대 정도이고 대부분은 1~4대 등 소규모로 요청한다”고 말했다. 서버 32대는 B200 256장 규모다. 다만 NHN클라우드는 정부 활용분의 이용기관 수와 전체 자원 배정률 등은 공개하지 않았다.

6층에 배치된 NHN클라우드 활용분은 판매 계약이 모두 체결됐다. 일부 고객은 NHN클라우드의 GPU 관리 플랫폼을 함께 이용하고 대규모 고객에게는 GPU 인프라만 제공하기도 한다. 대표적으로 베슬AI는 NHN클라우드로부터 공급받은 GPU 자원을 자사 서비스를 통해 다시 제공하는 형태다.

다만 소규모 고객이 관리 플랫폼 없이 인프라만 공급해 달라고 요청하는 경우까지 모두 계약하지는 않는다. GPU 서버를 여러 고객에게 소량씩 나눠 공급하면 운영 업무가 늘고 계약 사이에 자원이 사용되지 않는 기간이 생길 수 있어서다. NHN클라우드는 소수 고객에게 대규모 자원을 장기간 제공하는 방식을 선호하고 있다.

이 이사는 기존 GPU 운영 경험상 구축 이후 약 3년이 지나면 임대 가격이 초기의 절반 수준으로 낮아질 수 있다고 설명했다. 초기 가격을 일부 할인하더라도 장기 계약을 체결하면 향후 가격 하락과 자원 유휴 위험을 줄일 수 있다는 판단이다.

이 데이터센터는 당초 랙 한 대가 30킬로와트(㎾)를 사용하는 조건을 기준으로 설계됐다. 반면 B200 서버 6대를 밀집 배치한 랙은 약 75㎾를 소비한다. GPU 랙 하나가 기존 설계 기준으로 랙 2.5개에 해당하는 전력을 사용하는 셈이다.

이 이사는 “데이터홀에 공간은 남아 있지만 GPU 랙이 이곳에 공급할 수 있는 전력을 이미 사용했다”며 “장비를 놓을 자리가 있다고 서버를 더 추가할 수 있는 것은 아니다”라고 말했다. 서버를 늘리려면 장비가 소비할 전력뿐 아니라 추가로 발생하는 열을 처리할 냉각 능력도 함께 확보해야 한다.

GPU 서버를 한 랙에 밀집시킨 것은 장비 간 통신 거리도 고려한 결과다. 대규모 AI 모델 학습에서는 여러 GPU가 하나의 연산 자원처럼 데이터를 주고받는다. NHN클라우드는 GPU 사이가 멀어질수록 통신 지연과 오류 가능성이 커질 수 있다고 보고 서버를 가까이 배치했다.

고밀도 GPU에서 발생하는 열은 수랭식과 공랭식을 함께 사용해 처리한다. 시설 냉각수는 상부 배관을 따라 랙 하단의 냉각수분배장치(CDU)로 이동한다. 이 물이 서버 내부로 직접 들어가는 것은 아니다. CDU의 열교환기에서 서버용 별도 냉매를 식힌 뒤 냉매가 CPU와 GPU에 밀착된 냉각판을 순환하며 장비 열을 흡수한다.

메모리와 전원장치 등 나머지 부품에서 발생하는 열은 공랭 설비로 처리한다. 차가운 공기가 들어가는 서버 전면과 뜨거운 공기가 배출되는 후면은 칸막이로 분리했다. 냉각된 공기와 배기열이 섞여 효율이 떨어지는 것을 막기 위해서다. 랙 아래에는 수랭 배관 이상을 확인하는 누수 탐지 센서도 설치했다.

고밀도 GPU 장비와 냉각수가 채워진 배관의 무게는 바닥 하중에도 영향을 준다. GPU 자체가 무거워지는 데다 수랭 배관과 이를 지지하는 구조물의 무게까지 바닥에 전달되기 때문이다. GPU 집적도가 높아질수록 데이터센터에서 상면이 차지하는 상대적 중요성도 낮아질 전망이다. 서버를 설치할 공간이 남아 있더라도 전력과 냉각 용량을 모두 사용하면 장비를 더 들일 수 없기 때문이다.

이 이사는 “앞으로 GPU는 전력은 더 많이 사용하면서 차지하는 공간은 줄어들 것”이라며 “데이터센터는 면적보다 전력과 냉각이 더 중요한 기준이 될 것으로 본다”고 말했다.

Copyright © 디지털데일리. All rights reserved. 무단 전재 및 재배포 금지.