심원섭 맥킨지 부파트너
심원섭 맥킨지 부파트너
인공지능(AI)의 확산이 데이터센터의 구조를 바꾸고 있다. 과거 데이터센터가 주로 개별 서버 성능과 범용 중앙처리장치(CPU) 중심이었다면 지금의 AI 클러스터는 수만 개의 그래픽처리장치(GPU)와 고속 네트워크를 하나의 시스템으로 묶는 방향으로 진화 중이다. 수조 개의 파라미터를 처리하는 AI 모델을 학습시키기 위해 GPU들이 교환하는 데이터의 양은 상상을 초월한다. 이때 연결의 문제는 새로운 병목을 만들어낸다.

실리콘 포토닉스, 전력 손실과 발열 줄인다

반도체 업계는 이미 한 번 큰 병목을 경험했다. GPU의 연산 속도를 메모리가 따라가지 못했다. 이를 해결하기 위해 등장한 고대역폭메모리(HBM)은 GPU와 메모리 간의 데이터 대역폭을 획기적으로 확대하면서 정체를 해소하는 듯했다. 하지만 이제 칩과 칩 사이, 서버와 서버 사이에서의 흐름이 문제가 되기 시작했다.

AI 모델이 커질수록 GPU 간 통신량은 폭발적으로 늘어난다. 그런데 기존 구리 배선을 이용한 데이터 전송은 거리가 길어질수록 에너지 손실이 커지고 발열도 심하다. AI 데이터센터에서 전력과 냉각이 중요해진 이유다.