스페이스X가 AI 데이터센터 구축에서 속도보다 안정성을 중시하는 방식으로 전략을 바꾸고 있다. 기존에는 데이터센터를 빠르게 늘리는 데 집중했다면, 최근에는 전력·냉각 백업 시스템을 사전에 갖추고 운영 전 테스트를 강화하는 방향으로 전환하고 있다.
디 인포메이션은 10일(현지시간) 복수의 관계자를 인용, 스페이스X가 테네시와 미시시피 등에서 진행 중인 데이터센터 건설 방식을 재설계하고 있다고 보도했다.
스페이스X는 올해 초 인수한 xAI의 데이터센터 구축 경험을 바탕으로, GPU 확보와 시설 가동을 최대한 앞당기는 기존 방식을 이어왔다. xAI는 10만개 GPU를 수용하는 데이터센터 '콜로서스'를 122일 만에 구축했다고 밝힌 바 있다.
그러나 이 과정에서 문제도 드러났다. 초기 데이터센터에서는 전력과 냉각 시스템의 이중화가 충분하지 않아 장비 하나의 고장으로 전체 클러스터가 중단될 수 있었던 것으로 전해졌다. 백업 시스템이 완성되기 전에 최소한의 전력·냉각 설비부터 가동하고, 이후 추가 설비를 설치하는 방식도 사용했다.
이에 따라 새로운 데이터센터 경영진은 백업 전력·냉각 설비를 미리 구축하고 가동 전 테스트를 강화하기로 했다. 데이터센터에서 수십대의 가스 터빈 등 임시 전력·냉각 장비에 의존하는 방식도 줄일 계획이다.
변화는 인력에서도 나타나고 있다. 지난 몇주 동안 데이터센터 프로젝트를 이끌던 인력 10여명이 회사를 떠났고, 스페이스X의 로켓과 스타링크 사업에서 일하던 엔지니어들이 데이터센터 구축에 투입됐다. 1300명 이상의 스페이스X 엔지니어가 이 작업에 자원했고, 이 가운데 300명 이상이 최근 한 달 동안 데이터센터 프로젝트에 참여한 것으로 알려졌다.
이번 개편은 최근 발생한 데이터센터 장애와도 관련이 있는 것으로 보인다. 지난주 테네시주 멤피스의 대규모 데이터센터에서 건설 과정 중 전력선이 손상돼 정전이 발생했고, 이로 인해 그록 일부 서비스와 컴퓨팅 고객에게 영향을 준 것으로 전해졌습니다.
일론 머스크 CEO도 X를 통해 "이런 일이 다시는 발생하지 않도록 시정 조치를 취하고 있다"고 밝혔다.
다만 스페이스X가 데이터센터 구축에서 속도전 전략을 완전히 포기한 것은 아닌 것으로 알려졌다. AI 컴퓨팅 인프라를 앤트로픽과 구글 등 외부 고객에게도 제공하는 단계에 들어서면서, 빠른 증설만큼 안정적인 운영이 중요해진 것으로 해석된다.
임대준 기자 ydj@aitimes.com