AI 모델 개발 경쟁에 GPU·데이터센터 용량 극심한 부족...H100 임대료 1년 새 60% 상승
경쟁사끼리 동맹 맺고 CEO가 직접 협상...스타트업은 장기계약·선불 부담에 생존 위협
인공지능(AI) 경쟁이 거세지면서 실리콘밸리에서 가장 귀한 자원이 자금이나 인재를 넘어 '컴퓨팅 파워(compute)'로 빠르게 이동하고 있다. AI 모델을 훈련하고 서비스하기 위한 GPU와 데이터센터 용량이 수요를 따라가지 못하면서 오랜 경쟁기업들이 서로 손을 잡고, 최고경영진이 직접 컴퓨팅 용량 확보 협상에 나서는 이례적인 상황까지 벌어지고 있다.
월스트리트저널(WSJ)에 따르면 AI 업계에서 컴퓨팅 파워 확보는 사실상 새로운 '골드러시'가 됐다. 대규모 AI 모델을 개발하거나 운영하기 위해서는 막대한 연산능력이 필요하지만 실제 사용할 수 있는 GPU와 데이터센터 용량은 제한돼 있다. 이 때문에 기업들은 전 세계를 돌며 남아 있는 컴퓨팅 자원을 찾고 있으며, 일부 스타트업은 제대로 검증되지 않은 데이터센터 업체와 계약하는 위험까지 감수하고 있다.
구글이 27억 달러 들여 데려온 AI 천재도 컴퓨팅 파워 부족
컴퓨팅 자원 부족이 얼마나 심각한지를 보여주는 대표적인 사례가 구글이다.
구글은 2024년 유명 AI 연구자 노엄 셰이저(Noam Shazeer)를 회사로 복귀시키기 위해 약 27억 달러를 지불했다. 셰이저는 구글에서 오랫동안 근무하다 회사를 떠나 자신의 AI 스타트업을 설립했으며, 복귀 후에는 구글의 핵심 AI 기술인 제미나이(Gemini)를 포함한 최첨단 프로젝트에 참여했다.
그러나 막대한 비용을 들여 데려온 셰이저조차 자신이 원하는 만큼의 컴퓨팅 자원을 확보하지 못했다.
WSJ에 따르면 복귀한 지 2년도 지나지 않아 셰이저는 자신의 팀에 배정됐던 컴퓨팅 자원이 다른 프로젝트로 넘어갔다고 알렸다. 그는 이후 경쟁사인 OpenAI로 자리를 옮겼다.
이는 AI 경쟁에서 최고 수준의 연구자를 확보하는 것만으로는 충분하지 않다는 점을 보여준다. 아무리 뛰어난 연구자와 알고리즘을 가지고 있어도 이를 학습시키고 실험할 GPU와 데이터센터가 없다면 새로운 모델을 개발할 수 없기 때문이다.
'AI 서버 찾아 전 세계로'...닭장 개조한 데이터센터까지 등장
컴퓨팅 자원을 찾아다니는 전문 업체도 등장하고 있다.
샌프란시스코 컴퓨트(San Francisco Compute)는 세계 각지의 데이터센터를 조사한 뒤 확보한 컴퓨팅 용량을 엔비디아 같은 대기업부터 소규모 AI 스타트업까지 빌려주는 사업을 하고 있다.
회사의 최고기술책임자(CTO) 에릭 박(Eric Park)은 사람들이 생각하지 못하는 지역까지 찾아다니며 GPU와 서버 용량을 확보하고 있다.
그는 미국 농촌지역에서 데이터센터를 찾던 중 외관상 닭장처럼 보이는 건물을 개조해 AI 서버를 가동하는 시설을 발견하기도 했다. 이후 우기 중 필리핀 마닐라를 방문했다가 차량이 홍수에 갇혀 물속을 걸어서 빠져나온 뒤 바로 대만으로 이동해 AI 서버 제조업체와 만났다.
작은 규모의 GPU 클러스터라도 중소 AI 업체에는 중요한 자원이 될 수 있기 때문이다.
발표된 데이터센터는 많지만 "실제로 쓸 수 있는 건 훨씬 적다"
전 세계 기술기업들은 수십억 또는 수백억 달러 규모의 AI 데이터센터 건설 계획을 잇따라 발표하고 있다. 그러나 발표된 컴퓨팅 용량과 실제 지금 사용할 수 있는 컴퓨팅 자원 사이에는 상당한 차이가 있다는 지적도 나온다.
캐나다 AI 기업 코히어(Cohere)의 공동창업자 닉 프로스트(Nick Frosst)는 발표됐다가 취소되는 프로젝트가 많고, 당초 발표한 규모보다 훨씬 작게 건설되는 사례도 있다고 말했다.
오픈소스 AI 스타트업 아시(Arcee)는 최근 한 인프라 업체로부터 투자자금과 컴퓨팅 용량을 동시에 제공받기로 했지만 데이터센터 건설이 지연되면서 계약 자체가 무산됐다.
아시의 마크 맥퀘이드(Mark McQuade) 최고경영자(CEO)는 컴퓨팅 관련 계약은 실제로 자원이 확보되기 전까지는 확실하다고 믿기 어렵다는 취지로 상황을 설명했다.
H100 컴퓨팅 임대료 1년 새 60% 상승
수요가 공급을 압도하면서 가격도 빠르게 상승하고 있다.
데이터·컨설팅 업체 세미애널리시스(SemiAnalysis)에 따르면 엔비디아 H100 GPU를 이용한 컴퓨팅 파워를 1년 계약으로 임대하는 시간당 비용은 지난 1년 동안 약 60% 상승했다.
AI 인프라 투자 규모도 급증하고 있다. 구글 모회사 알파벳(Alphabet)은 올해 최대 2,000억 달러에 달하는 자본지출을 예상하고 있으며 상당 부분이 AI 인프라 구축에 투입될 것으로 전망된다.
과거에는 스타트업도 아마존웹서비스(AWS) 등에서 필요한 GPU를 비교적 짧은 기간 임대할 수 있었다. 하지만 현재는 대형 AI 기업들이 사용 가능한 컴퓨팅 자원을 대거 확보하면서 클라우드 업체들도 계약조건을 강화하고 있다.
일부 업체는 수년짜리 장기계약을 요구하고 계약금으로 전체 비용의 최대 30%를 선불로 요구한다. 스타트업이 비용을 내지 못할 경우를 대비해 지급보증인을 요구하는 사례도 있다.
앤트로픽, 경쟁자 머스크 찾아가 컴퓨팅 파워 협상
컴퓨팅 자원 부족은 경쟁기업 사이의 관계까지 바꾸고 있다.
지난 3월 앤트로픽(Anthropic) 공동창업자 톰 브라운(Tom Brown)은 캘리포니아 호손에 있는 일론 머스크(Elon Musk)의 AI 기업 xAI 사무실을 직접 방문했다. 목적은 xAI가 보유한 컴퓨팅 파워를 임대하기 위한 협상이었다.
당시 앤트로픽은 AI 코딩 서비스 Claude Code가 예상보다 폭발적인 인기를 끌면서 컴퓨팅 자원이 부족해졌고, 이 때문에 서비스 장애가 빈번하게 발생하고 있었다.
두 달 뒤인 5월 앤트로픽은 머스크의 스페이스X(SpaceX)와 300메가와트(MW)가 넘는 컴퓨팅 파워를 임대하는 계약을 발표했다. 이후 공개된 내용에 따르면 이 계약의 잠재적 가치는 향후 수년간 최대 450억 달러에 달할 수 있다.
특히 머스크는 과거 앤트로픽을 공개적으로 비판해온 인물이다. 그러나 컴퓨팅 자원을 둘러싼 이해관계 앞에서는 경쟁관계도 달라졌다. 머스크는 계약 이후 앤트로픽 경영진에게 좋은 인상을 받았다는 취지의 글까지 소셜미디어 X에 올렸다.
앤트로픽의 다리오 아모데이(Dario Amodei) CEO 역시 올해 메타(Meta)의 최고AI책임자 알렉산더 왕(Alexandr Wang)과 직접 통화해 추가 컴퓨팅 용량 확보를 논의했다. 메타는 실제로 앤트로픽에 칩을 제공할지를 내부적으로 검토했지만 현재까지는 제공하지 않기로 결정한 것으로 전해졌다.
구글 내부에서도 '누가 GPU를 쓸 것인가' 권력투쟁
컴퓨팅 자원 부족은 기업 간 경쟁뿐만 아니라 한 회사 내부에서도 갈등을 만들고 있다.
구글의 마운틴뷰 본사에서는 어떤 AI 프로젝트에 귀중한 컴퓨팅 자원을 우선적으로 배정할지를 놓고 연구자들 사이에서 경쟁이 벌어지고 있다.
공동창업자 세르게이 브린(Sergey Brin)은 자신이 중요하다고 판단한 프로젝트에 컴퓨팅 자원을 배정하기 위해 기존 배정 절차를 변경하기도 하는 것으로 전해졌다.
구글 딥마인드(DeepMind)를 공동창업하고 최근까지 조직을 이끌었던 데미스 허사비스(Demis Hassabis) 역시 장기 AI 연구에 배정되는 컴퓨팅 자원이 부족하다는 데 불만을 표시한 것으로 알려졌다.
AI 기업에서 컴퓨팅 파워가 단순한 IT 인프라가 아니라 어떤 연구와 제품을 추진할지를 결정하는 전략적 자원이 되고 있는 것이다.
너무 많이 사도 파산, 적게 사도 성장 막혀
AI 스타트업들은 더욱 어려운 선택에 직면해 있다.
앞으로 서비스 사용자가 얼마나 늘어날지 정확하게 예측하기 어렵기 때문에 컴퓨팅 자원을 얼마나 미리 확보할 것인지 결정해야 한다.
컴퓨팅 자원을 너무 적게 계약하면 사용자가 급증할 때 서비스를 제대로 제공하지 못해 성장 기회를 놓칠 수 있다. 반대로 실제 수요보다 지나치게 많은 자원을 장기계약으로 확보하면 막대한 고정비 부담으로 회사가 위험해질 수 있다.
빠르게 성장하고 있는 AI 스타트업 인스팅트(Instinct)는 최근 100억 달러의 기업가치로 10억 달러를 조달했다. 올해 들어서만 세 번째 자금조달이다. 그러나 막대한 현금을 확보하고도 자체 데이터센터를 보유한 메타나 훨씬 많은 자본과 컴퓨팅 자원을 갖춘 OpenAI와 경쟁하기는 쉽지 않다.
인스팅트의 노아 신(Noah Shinn) CEO는 향후 사용자가 1억 명까지 증가할 경우를 대비해 지금부터 컴퓨팅 자원을 구매해야 하는지를 고민하고 있다고 밝혔다.
벤처캐피털 그레이디언트 벤처스(Gradient Ventures)의 잭 브래튼-글레넌(Zach Bratun-Glennon)은 컴퓨팅 자원을 너무 많이 계약하면 과도한 리스 의무 때문에 회사가 파산할 수도 있고, 너무 적게 계약하면 성장 속도가 꺾이고 고객 불만이 커질 수 있다고 설명했다.
VC도 이제 돈 대신 GPU까지 제공
컴퓨팅 자원이 스타트업의 성장을 좌우하기 시작하면서 벤처캐피털의 역할도 변하고 있다.
일부 벤처캐피털은 직접 GPU 클러스터를 확보한 뒤 투자한 스타트업에 다시 임대하거나 컴퓨팅 업체와 체결하는 계약을 보증해주고 있다.
세계적인 스타트업 액셀러레이터 와이콤비네이터(Y Combinator)는 지난해 한 투자기업이 AI 모델 훈련을 위해 두 달 동안 120개의 GPU가 필요했지만 적절한 계약을 구하지 못하자 자체적으로 스타트업 전용 GPU 클러스터를 구축해 지난 7월 서비스를 시작했다.
AI 전문 벤처캐피털 래디컬 벤처스(Radical Ventures)는 아예 GPU 확보를 전문적으로 담당하는 팀을 운영한다. 이들은 사용 가능한 GPU와 가격, 계약조건을 지속적으로 추적하고 투자기업을 컴퓨팅 공급업체와 연결한다.
이 회사의 데이비드 카츠(David Katz)는 지난 5년간 소규모 팀을 이끌며 수십억 달러 규모의 컴퓨팅 계약을 협상했다고 밝혔다. 투자 여부를 결정하기 전부터 데이터센터 업체들과 연락해 향후 투자할 가능성이 있는 기업에 필요한 컴퓨팅 용량을 확보할 수 있는지 확인하는 경우도 있다.
AI 경쟁의 새로운 진입장벽...'돈이 있어도 GPU가 없다'
AI 산업 초창기에는 뛰어난 연구자와 충분한 투자자금을 확보하면 새로운 기업도 기존 기술기업에 도전할 수 있다는 기대가 있었다.
하지만 현재는 상황이 달라지고 있다.
AI 모델 규모가 커지고 이용자가 급증하면서 대규모 GPU 클러스터와 안정적인 전력, 데이터센터 시설을 확보하지 못하면 모델을 개발하는 것조차 어려워지고 있다. 스타트업이 수십억 달러를 조달해도 필요한 컴퓨팅 자원을 확보하지 못하면 자금 자체가 경쟁력으로 이어지지 않을 수 있다.
반대로 구글과 메타처럼 자체 데이터센터를 대규모로 운영하거나 OpenAI·앤트로픽처럼 수백억 달러 규모의 장기 컴퓨팅 계약을 체결할 수 있는 기업들은 더욱 강력한 우위를 확보하고 있다.
AI 경쟁의 핵심 질문도 이에 따라 변하고 있다. 얼마 전까지 실리콘밸리의 스타트업들이 가장 먼저 묻던 질문이 '어디서 자금을 조달할 것인가'였다면, 이제는 '누가 필요한 컴퓨팅 파워를 확보해줄 수 있는가'가 기업의 생존을 결정하는 질문이 되고 있다.
컴퓨팅 파워를 둘러싼 경쟁이 장기화할 경우 AI 산업은 기술력뿐 아니라 데이터센터·전력·GPU를 대규모로 확보할 수 있는 기업을 중심으로 더욱 빠르게 재편될 가능성이 있다. 세계적인 AI 경쟁이 소프트웨어와 알고리즘의 싸움을 넘어 실제 전력과 반도체, 데이터센터를 차지하기 위한 거대한 인프라 전쟁으로 바뀌고 있는 것이다.







